تصور کنید عاملی که نه تنها کد مینویسد، بلکه ساعتها روی تنظیمات یک شبکه عصبی کلنجار میرود تا رکورد یک متخصص انسانی را بزند. مدل Fable 5 اکنون ۸۱.۷٪ از فاصلهٔ عملکردی تا رکورد انسانی در بهینهساز nanoGPT را بسته است.
طبق تحلیل فنی منتشر شده در ۲۲ اوت ۲۰۲۶ توسط Prime Intellect، این نتیجه بالاترین عملکرد خودکار ثبتشده در میان ۱۵۳ اجرای مختلف با حضور ۱۸ مدل پیشرو است. این بنچمارک در حالی منتشر میشود که صنعت از رابطهای سادهٔ چت به سمت عاملهای (Agents) خودکار حرکت میکند که قادر به پژوهش و بهینهسازی تکرارشونده هستند.
همانطور که در تحلیل قبلی ما دربارهی موفقیت مدل Inherent 27B در بازتولید پژوهشها اشاره کردیم، توانایی مدل در اصلاح خودکار ابرپارامترهای (Hyperparameters) یک شبکه عصبی (Neural Network) برای شکست دادن یک خط مبنای انسانی، محک واقعی استقلال مدل است.
کالبدشکافی عملکرد
بر اساس مستندات این مطالعه، برای هدایت مدلها از ابزارهایی مانند claude-code و codex استفاده شده است. نتایج کلیدی به شرح زیر است:
- Fable 5: با ثبت نتیجهٔ ۲۷۲۶، ۸۱.۷٪ از شکاف انسانی را در ۸.۷ روز زمانِ عامل بست.
- Opus 5: با نتیجهٔ ۲۹۲۰، ۵۳.۶٪ از این شکاف را پوشش داد.
- Kimi K3: با استفاده از ابزار prime-agent به نرخ ۵۲.۲٪ رسید.
- GPT-5.6 Sol: تنها ۳۵.۹٪ از شکاف را بست، در حالی که به محاسبات بسیار بیشتری (۲.۹ میلیارد ردپا) نیاز داشت.
در حالی که Fable 5 در کارایی و نتیجه پیشتاز است، دادهها نشاندهنده یک سقوط شدید در عملکرد سایر مدلهاست. مدلهایی مانند GPT-5.5 و Kimi K2.7 بهشدت متزلزل بودند و بهترتیب تنها ۸.۱٪ و ۷.۲٪ از رکورد انسانی را به دست آوردند.
برای متخصصان فنی، این تغییر نشان میدهد که مقیاس خام مدل دیگر محرک اصلی موفقیت در بهینهسازی نیست. تفاوت نتایج میان مدلهایی که از یک ابزار یکسان استفاده کردهاند، ثابت میکند که قابلیتهای استدلال داخلی برای عیبیابی تکرارشونده، اکنون گلوگاه اصلی در گردشکارهای عاملمحور (Agentic) است.
گام بعدی شما
- بررسی بنچمارکهای «اسپیدران» (Speedrun) برای شناسایی مدلهایی که واقعاً توانایی استقلال در مدیریت کدبیسهای خودبهبودبخش را دارند.
- تحلیل نسبت «زمان عامل» به «کیفیت خروجی» برای کاهش هزینههای استنتاج در پروژههای بهینهسازی.
- آزمایش مدلهای استدلالی در محیطهای ایزوله برای سنجش نرخ خطای آنها در اصلاح ابرپارامترها.
اما کاهش زمان رسیدن به این رکوردها از چند روز به چند ساعت، مرز بعدی این رقابت است که در گزارشهای آتی بررسی خواهیم کرد.




گفتگو