پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Fable 5.1 با نرخ موفقیت ۳۸.۸٪ در صدر محک کدنویسی سازمانی قرار گرفت

·۲۲ شهریور ۱۴۰۵۸ دقیقه مطالعه
معیار ارزیابی Real-SWE — آزمایشگاه‌های خاص: بنچمارکی برای اندازه‌گیری توانایی مدل‌های هوش مصنوعی در حل مسائل واقعی نرم‌افزاری
معیار ارزیابی Real-SWE — آزمایشگاه‌های خاص: بنچمارکی برای اندازه‌گیری توانایی مدل‌های هوش مصنوعی در حل مسائل واقعی نرم‌افزاری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین محکی که مدل‌ها را روی کدهای خصوصی و لایسنس‌دار (غیرقابل دسترس در وب) می‌سنجد و افشای این واقعیت که نرخ موفقیت مدل‌های پیشرو در محیط واقعی سازمانی هنوز زیر ۴۰٪ است.

اگر تصور می‌کنید دستیارهای کدنویسی هوش مصنوعی اکنون آماده جایگزینی با مهندسان ارشد هستند، اعداد جدید چیز دیگری می‌گویند. نرخ موفقیت کمتر از ۴۰ درصد در محیط‌های واقعی سازمانی، مرز جدیدی است که نشان می‌دهد فاصله میان مدل‌های زبانی و واقعیت‌های پیچیده مهندسی نرم‌افزار هنوز بسیار زیاد است. برای پرداختن به این موضوع، Specific Labs در ۱۲ سپتامبر ۲۰۲۶ محکی به نام Real-SWE را معرفی کرد؛ بنچمارکی که مدل‌های پیشرو AI را روی کدبیس‌های خصوصی و دارای لایسنس ارزیابی می‌کند، جایی که راهکارهای آن‌ها در اینترنت عمومی در دسترس نیست.

اکثر محک‌های فعلی بر تکالیف مصنوعی یا مخازن متن‌باز تکیه می‌کنند که مدل‌ها احتمالاً در طول دوره آموزش خود آن‌ها را دیده‌اند. این موضوع یادآور تحلیل‌های فارنزیک اخیر است که نشان داد بخش بزرگی از داده‌های SWE-bench پیش‌تر عمومی شده بودند و باعث ایجاد نتایج خوش‌بینانه اما غیرواقعی شده بود. Real-SWE با استفاده از کدهای عملیاتی شرکت‌های واقعی، بازی را تغییر داده است. این رویکرد تضمین می‌کند که تکالیف به‌طور ذاتی «خارج از توزیع» (out-of-distribution) باشند و در واقع کارهای اقتصادی ارزشمندی باشند که به‌طور معمول به یک مهندس حقوق‌بگیر سپرده می‌شوند.

زمینه: ماهیت کدهای سازمانی

مهندسی تولید در دنیای واقعی فراتر از نوشتن یک تابع ساده است. این کار مستلزم درک معماری موجود، حفظ رفتارهایی است که کاربران به آن‌ها تکیه کرده‌اند و اعمال تغییرات در چارچوب محدودیت‌های عملیاتی واقعی است.

شرکت Specific Labs کدبیس‌ها را از طریق یک فرآیند غربالگری سخت‌گیرانه انتخاب کرد. آن‌ها بر شرکت‌هایی تمرکز کردند که دارای حجم استفاده بالا، تیم‌های مهندسی قدرتمند و بارهای کاری تولیدی دشوار بودند. تکالیف نمونه از محیط‌های متنوعی استخراج شده‌اند، از جمله:

  • یک پلتفرم فین‌تک مصرف‌کننده که بیش از ۱۰۰,۰۰۰ صورت‌حساب بانکی را پردازش می‌کند.
  • یک پلتفرم فروش AI سازمانی که از جریان‌های کاری پیچیده تجاری پشتیبانی می‌کند.
  • یک رقیب برای Luma/Partiful با بیش از ۲۰۰,۰۰۰ کاربر و رتبه ۱۰۰ برتر در اپ استور.

طبق گزارش withspecific.com، این بنچمارک ترکیبات «مدل-و-هارنس» (model-and-harness) را ارزیابی می‌کند تا جریان‌های کاری واقعی مهندسی را منعکس کند. عامل‌ها (Agents) باید در سیستم‌های اختصاصی پیمایش کنند، از کنوانسیون‌های کدنویسی خاص هر شرکت پیروی کنند و تغییراتی را مدیریت کنند که پیامدهای تجاری مستقیم دارند، مانند محاسبات مالیاتی و مهاجرت مشتریان.

چالش‌های محیط سازمانی

Real-SWE بر سه دلیل خاص تمرکز دارد که چرا تکالیف کدبیس خصوصی حیاتی هستند. نخست، این تکالیف به‌طور ذاتی خارج از توزیع هستند؛ زیرا ۹۹ درصد توکن‌ها در سازمان‌های دنیای واقعی از دید مدل‌های پیشرو پنهان است. دوم، این تکالیف نشان‌دهنده کارهای اقتصادی قابل‌اتکا هستند که رابطه مستقیمی با هزینه‌های شرکت دارند.

سوم، الگوهای مهندسی خاص هر شرکت اهمیت زیادی دارد. سازمان‌ها استانداردهای سخت‌گیرانه‌ای برای کد دارند. نتایج فعلی نشان می‌دهد که مدل‌ها در درک این الگوها ضعیف هستند و مکرراً الزامات را نادیده می‌گیرند یا در تایید فرضیات خود شکست می‌خورند.

جزئیات: پیچیدگی تکالیف دنیای واقعی

تکالیف دنیای واقعی در دو محور اصلی با تکالیف مصنوعی تفاوت دارند: اثر کدنویسی زیربنایی و جزئیات دستورالعمل‌ها. این عوامل لایه‌هایی از پیچیدگی را اضافه می‌کنند که مدل‌های پیشرو امروز را به چالش می‌کشد:

  • دامنه بین-عملکردی (Cross-Functional Scope): یک تغییر واحد اغلب چندین بخش از اپلیکیشن را در بر می‌گیرد. عامل‌ها باید منطق تجاری موجود و الگوهای کدنویسی شرکت را درک کنند و در عین حال سیستم پیرامونی را فعال نگه دارند.
  • دستورالعمل‌های ناقص (Underspecified Instructions): دستورات تغییر مورد نیاز را توصیف می‌کنند اما کشف جزئیات پیاده‌سازی را بر عهده عامل می‌گذارند. این دقیقاً مشابه روشی است که مهندسان انسانی تیکت‌ها را دریافت می‌کنند. هر رفتاری که توسط تاییدکننده (verifier) لازم باشد، باید یا ذکر شده باشد یا به‌طور معقول قابل کشف باشد.
  • عمق منطق تجاری: تکالیف اغلب شامل منطق‌های با ریسک بالا هستند. برای مثال، یک تسک مستلزم اصلاح صورت‌حساب‌ها است تا هر کسب‌وکار مالیات صحیحی را دریافت کند و در عین حال اطمینان حاصل شود که مشتریان معاف از مالیات، مالیات پرداخت نمی‌کنند.

در مثال مالیاتی، عامل باید چندین سناریو را مدیریت کند: برخی کسب‌وکارها نرخ‌های خود را دارند، برخی از یک ارائه‌دهنده مرجع مالیاتی بر اساس مقصد خریدار استفاده می‌کنند و برخی هیچ مالیاتی جمع نمی‌کنند. عامل باید با محیط sandbox TaxJar، محیط تولید TaxJar و یک دفتر کل InfluxDB تعامل داشته باشد. اگر مرجع مالیاتی آدرسی را رد کند، این مورد باید گزارش شود بدون اینکه روند صدور صورت‌حساب متوقف شود. در نهایت، صورت‌حساب‌های بین طرف‌های اروپایی باید ثبت VAT هر دو طرف را نشان دهند.

جزئیات محیط فنی

برای حل این تکالیف، عامل‌ها باید در یک پشته پیچیده از زیرساخت‌ها و ابزارهای تجاری عمل کنند. هر تسک تنها سرویس‌هایی را در اختیار مدل قرار می‌دهد که جریان کاری خاص آن نیاز دارد:

  • ابر و ارکستراسیون: شبیه‌ساز AWS، Docker و Kubernetes.
  • پایگاه‌های داده: PostgreSQL، MySQL، MongoDB و Redis.
  • زبان‌ها و فریم‌ورک‌ها: Go، Python، Node.js و NestJS (TypeScript).
  • ابزارهای تجاری: GitHub، Linear MCP، Slack، Intercom، Google Drive، Email و ClickUp.
  • تست: Vitest.

رتبه‌بندی عملکرد

نرخ حل مسائل (Resolution Rate)، که معادل pass@1 و میانگین هشت اجرای مستقل برای هر تسک است، یک تقلا و دشواری قابل توجه را در تمام مدل‌ها نشان می‌دهد:

  • Fable 5.1 (با استفاده از Claude Code): ۳۸.۸٪
  • GPT-6 Astra (با استفاده از Codex CLI): ۳۳.۸٪
  • Gemini 3.8 Flash (با استفاده از Gemini CLI): ۳۱.۲٪
  • GLM 5.3 (با استفاده از Claude Code): ۲۸.۸٪
  • Grok 4.6 (با استفاده از Grok Build): ۲۳.۸٪
  • Muse Spark 1.3 (با استفاده از Muse Code): ۲۳.۸٪
  • Kimi K3 (با استفاده از Kimi Code): ۱۸.۸٪
  • GPT-5.6 Sol (با استفاده از Codex CLI): ۱۶.۲٪

شکاف پیچیدگی

تکالیف دنیای واقعی به‌طور قابل توجهی پیچیده‌تر از تکالیف مصنوعی هستند. میانگین تعداد فایل‌های ویرایش‌شده برای یک راهکار مرجع در Real-SWE برابر با ۱۱ فایل است، در حالی که در بنچمارک‌هایی مانند FrontierCode یا DeepSWE این عدد تنها ۶ فایل است.

طول پرامپت‌ها نیز در بنچمارک‌های مختلف متفاوت است. یک دستورالعمل معمولی در Real-SWE دارای ۱,۷۴۲ کاراکتر است. برای مقایسه، میانگین طول پرامپت‌ها به شرح زیر است:

  • Terminal-Bench: ۳۱,۵۸۴ کاراکتر
  • FrontierCode: ۲,۰۵۶ کاراکتر
  • DeepSWE: ۱,۹۷۵ کاراکتر
  • Real-SWE: ۱,۷۴۲ کاراکتر
  • FrontierSWE v2: ۹۹۲ کاراکتر

حالت‌های شکست و موانع فنی

Specific Labs دریافت که در ۶ مورد از هر ۱۰ تکالیف، نرخ حل مسائل زیر ۱۵ درصد بوده است. هیچ مدل واحدی نتوانست تمام تکالیف را حل کند. شکست‌ها با استفاده از تاکسونومی DeepSWE گروه‌بندی شدند که نشان داد «نادیده گرفتن الزامات» رایج‌ترین دلیل شکست است. سایر حالت‌های شکست مکرر عبارتند از:

  • فرضیات تاییدنشده
  • خطاهای یکپارچه‌سازی (Integration errors)
  • رگرسیون‌ها (Regressions)
  • ویرایش فایل اشتباه

مدل‌ها همچنین با «زمان تا حل» (time-to-resolution) دست و پنجه نرم کردند. تقریباً ۷۱.۴٪ از اجراهایی که کمتر از ۱۰ دقیقه طول کشیدند شکست خوردند (۷۰ شکست در مقابل ۲۸ موفقیت از ۹۸ مورد). برای اجراهایی که ۱۰ دقیقه یا بیشتر طول کشیدند، نرخ شکست ۷۳.۴٪ بود (۳۹۸ شکست در مقابل ۱۴۴ موفقیت از ۵۴۲ مورد). این نشان می‌دهد که صرفاً دادن زمان بیشتر به یک عامل، لزوماً دشواری‌های زیربنایی در تحلیل منطق پیچیده تجاری را حل نمی‌کند.

زیرساخت و ابزارها

برای شبیه‌سازی یک محیط تولید واقعی، هر عامل در یک سندباکس ایزوله اجرا شد. این رویکرد مشابه سیستم‌های ردیابی دقیق Oqoqo است که امکان پایش هر فراخوانی ابزار و هزینه توکن را در محیط‌های سندباکس فراهم می‌کند تا تحلیل دقیق‌تری از رفتار عامل‌ها به دست آید. تمام تکالیف از فرمت Harbor استفاده می‌کنند و تاییدکننده‌ها در زمان نمره‌دهی تزریق می‌شوند. این تاییدکننده‌ها یا از مجموعه‌های تست موجود در کدبیس الهام گرفته شده‌اند یا دقیقاً از همان تست‌ها استفاده می‌کنند.

هزینه حل مسائل

جالب است که هزینه مالی بالاتر در هر اجرا، نرخ موفقیت بالاتری را تضمین نمی‌کند. هزینه‌های تخمینی هر اجرا از ۲.۵۰ تا ۶.۹۶ دلار متغیر است.

Gemini 3.8 Flash به نرخ حل ۳۱.۲٪ با کمترین هزینه تخمینی ۲.۵۰ دلار در هر اجرا دست یافت. در مقابل، Fable 5.1 برای نرخ موفقیت ۳۸.۸٪، ۶.۹۶ دلار هزینه داشت. سایر هزینه‌ها عبارتند از:

  • GPT-5.6 Sol: ۲.۶۵ دلار (۱۶.۲٪ حل)
  • Muse Spark 1.3: ۲.۷۴ دلار (۲۳.۸٪ حل)
  • Grok 4.6: ۳.۴۴ دلار (۲۳.۸٪ حل)
  • Kimi K3: ۳.۹۰ دلار (۱۸.۸٪ حل)
  • GPT-6 Astra: ۴.۶۷ دلار (۳۳.۸٪ حل)
  • GLM 5.3: ۵.۱۲ دلار (۲۸.۸٪ حل)

تحلیل ارزش خاص هر تکالیف

تحلیل تکالیف خاص، تفاوت زیادی را در کارایی مدل‌ها نشان می‌دهد. برای مثال، در تسک «سنجش توکن API»، مدل Fable 5.1 حدود ۹۵ هزار توکن مصرف کرد، در حالی که GLM 5.3 حدود ۱۷۷ هزار و Gemini 3.8 Flash حدود ۱۳۴ هزار توکن مصرف کردند. در تسک «اسکن خطی‌شونده» (Linearizable scan)، مدل Grok 4.6 مقدار عظیم ۲۶۱ هزار توکن مصرف کرد، در حالی که Fable 5.1 تنها ۸۶ هزار توکن مصرف نمود.

به‌طور کلی، میانگین هزینه‌ها در هر اجرا تفاوت چشمگیری داشت: GLM 5.3 با ۱۱۷ هزار توکن گران‌ترین بود و پس از آن Muse Spark 1.3 با ۸۷ هزار و Gemini 3.8 Flash با ۹۴ هزار توکن قرار داشتند. GPT-5.6 Sol با ۲۳ هزار توکن بهینه‌ترین و GPT-6 Astra با ۲۴ هزار توکن در رتبه بعدی بود.

تحلیل: مشکل «توکن‌های خصوصی»

این داده‌ها نشان‌دهنده یک محدودیت بنیادی در نحوه آموزش مدل‌های پیشرو است. از آنجایی که ۹۹ درصد توکن‌های سازمانی از مجموعه‌های آموزشی عمومی پنهان هستند، مدل‌ها عملاً نسبت به الگوهای مهندسی خاص و محدودیت‌های معماری دنیای شرکتی کور هستند. این تکالیف به‌طور ذاتی خارج از توزیع هستند زیرا در اینترنت در دسترس نیستند. برای غلبه بر این چالش، برخی شرکت‌ها مانند Arga Labs از رویکرد ساخت دوقلوهای دیجیتال برای آموزش ایمن عامل‌ها روی داده‌های واقعی استفاده می‌کنند تا ریسک‌های محیط تولید را کاهش دهند.

برای جامعه فنی، این موضوع تمرکز را از توانایی‌های استدلال خام به توانایی انطباق با «زمینه محلی» (local context) تغییر می‌دهد. این واقعیت که مدل‌ها مکرراً الزامات را نادیده می‌گیرند یا در تایید فرضیات شکست می‌خورند، نشان می‌دهد که عامل‌های فعلی فاقد «شکاکیت حرفه‌ای» مورد نیاز برای مهندسی در سطح تولید هستند. بسیاری از سازمان‌ها عمیقاً به استانداردهای کد اهمیت می‌دهند، اما مدل‌های امروزی در درک این کنوانسیون‌های خاص شرکتی ضعیف هستند.

Real-SWE ثابت می‌کند که «متخصص کدنویسی» بودن در LeetCode یا GitHub با «مهندس نرم‌افزار» بودن در یک سازمان خصوصی متفاوت است. توانایی حفظ رفتارهای موجود در حالی که تغییری در ۱۱ فایل مختلف اعمال می‌شود، همچنان یک مانع بزرگ برای نسل فعلی هوش مصنوعی است.

برای اینکه ببینید ابزارهای داخلی شما چگونه این سطح از پیچیدگی را مدیریت می‌کنند، می‌توانید دسترسی به تکالیف نمونه ارائه شده توسط Specific Labs را درخواست کنید.

گام بعدی شما

  • اگر از عامل‌های کدنویس در پروژه‌های سازمانی استفاده می‌کنید، روی تایید دستی الزامات (Requirements) تمرکز کنید، زیرا مدل‌ها در این بخش بیشترین خطا را دارند.
  • برای کاهش هزینه‌ها، مدل‌های بهینه‌تری مثل Gemini 3.8 Flash را برای تکالیف ساده‌تر تست کنید، زیرا تفاوت موفقیت آن‌ها با مدل‌های گران‌قیمت در محیط‌های واقعی کمتر از حد انتظار است.
  • دسترسی به تکالیف نمونه Specific Labs را درخواست کنید تا توانایی ابزارهای داخلی خود را در مواجهه با کدهای خصوصی بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این نتایج بر اساس اعتبار داده‌های دنیای واقعی ثابت می‌کند که اتکای کامل به AI در کدنویسی سازمانی فعلاً ریسک بالایی دارد. تخصص مدل‌ها در محیط‌های باز، لزوماً به معنای کارآمدی آن‌ها در معماری‌های بسته و پیچیده شرکت‌ها نیست.

تأثیر برای ایران

برای برنامه‌نویسان ایرانی که در پروژه‌های Outsource یا سازمانی کار می‌کنند، این خبر هشدار می‌دهد که ابزارهای AI فعلی در درک بیزنس‌لاژیک‌های پیچیده داخلی ضعیف‌اند و نظارت انسانی سخت‌گیرانه همچنان ضروری است.

·نگاه ما
تحریریه دات‌هوش

این داده‌ها نشان می‌دهند که تخصص در حل مسائل LeetCode یا گیت‌هاب با مهندسی نرم‌افزار در یک شرکت خصوصی تفاوت بنیادین دارد. مدل‌های فعلی فاقد «تردید حرفه‌ای» (Professional Skepticism) لازم برای محیط‌های عملیاتی هستند و نمی‌توانند بین تغییر در کد و حفظ پایداری کل سیستم تعادل برقرار کنند. تمرکز صنعت باید از افزایش توان استدلال خام به سمت بهبود انطباق با بستر محلی (Local Context) تغییر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.