پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک‌های کدنویسی چگونه Claude 4.7 را به یک برنامه‌نویس ناکارآمد تبدیل کردند؟

·۲۴ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
بنچمارک‌های کدنویسی چگونه Claude 4.7 را به یک برنامه‌نویس ناکارآمد تبدیل کردند؟
اشتراک‌گذاری

تصور کنید یک روز کامل را صرف عیب‌یابی ۳۰۰۰ خط کد کنید. در نهایت بفهمید یک دستور ساده می‌توانست جایگزین تمام آن‌ها شود. این واقعیت تلخ برای توسعه‌دهنده‌ای است که از Claude Code با مدل Opus 4.7 استفاده می‌کند.

این رفتار نشان‌دهنده شکافی عمیق در مهندسی نرم‌افزار است. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در اینجا دچار یک خطای استراتژیک شده است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی ابزارهای خودکارسازی اشاره کردیم، هدف رسیدن به بهره‌وری است، نه تولید حجم زیاد کد.

به نقل از گزارشی در ۱۲ می ۲۰۲۶، مدل Claude کتابخانه‌های pywikibot و mwparserfromhell را از صفر بازنویسی کرد. نتایج این رویکرد بسیار ناکارآمد بود:

  • مدل ۱۲۲ خط کد برای پاک‌سازی متن نوشت، در حالی که یک دستور ساده از mwparserfromhell کافی بود.
  • حدود ۲۵۰۰ خط کد برای مدیریت ویرایش‌ها تولید کرد که بعداً با تنها ۸ خط کد از pywikibot جایگزین شدند.
  • یک دیکشنری غلط‌گیر ۱۸ موردی ساخت که تمام آن در کتابخانه RETF موجود بود.

طبق گزارش این توسعه‌دهنده، پس از دستور صریح برای مهاجرت به کتابخانه‌های استاندارد، حجم کد از ۳۰۰۰ خط به ۱۲۵۹ خط کاهش یافت.

این شکست احتمالاً از نحوه آموزش مدل‌ها می‌آید. بسیاری از بنچمارک‌های کدنویسی «بسته» هستند؛ یعنی مدل به اینترنت یا نصب بسته دسترسی ندارد. اگر مدل برای حل مسئله بدون ابزار خارجی پاداش بگیرد، یاد می‌گیرد که کتابخانه‌ها را نادیده بگیرد. این یعنی توهم (Hallucination) — شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — در اینجا به شکل «توهم هزینه» ظاهر می‌شود. مدل سعی می‌کند کدهای زائد را دفاع کند چون قبلاً آن‌ها را در پنجره متنی (Context Window) — مثل میز کاری که فقط جای چند ورق دارد — نوشته است.

این وضعیت باعث ایجاد بدهی فنی (Technical Debt) می‌شود؛ مثل خانه‌ای که با چسب به جای میخ ساخته شده و هر لحظه ممکن است فرو بریزد.

گام بعدی شما

  • هنگام استفاده از مدل‌های کدنویسی، صراحتاً از آن‌ها بخواهید ابتدا در PyPI به دنبال کتابخانه‌های موجود بگردند.
  • کدهای تولیدشده توسط AI را از نظر «تکرار چرخ» (Reinventing the wheel) بازبینی کنید.
  • منتظر بنچمارک‌های «وب-باز» باشید که توانایی مدل در تحقیق و وارد کردن کتابخانه‌ها را می‌سنجند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار مدل‌های کدنویسی را به چالش می‌کشد. تکیه بر مدل‌هایی که دچار توهمات «هزینه-کرد» هستند، می‌تواند منجر به ایجاد بدهی فنی غیرقابل مدیریت در مقیاس صنعتی شود.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.