امتیاز ۵۰٪ در محک SWE-bench، مرز جدیدی برای عامل (Agent) موسوم به Darwin Gödel Machine است؛ جهشی در قابلیتهای خودکار که از طریق بازنویسی کدِ عملیاتی توسط خودِ مدل به دست آمده است. به نقل از گزارشی که در ۶ اکتبر ۲۰۲۶ منتشر شد، این عامل که توسط Sakana و آزمایشگاه جف کلون توسعه یافته، مجموعهای از متدهای پیچیده مهندسی نرمافزار را — دقیقاً مشابه چکلیست ورود یک مهندس ارشد به پروژه — بهطور خودکار پیادهسازی کرده است. این رویکرد در واقع تکامل یافتهی استراتژیهای امتیازدهی و بازآموزی است که مدلهای پیشرو را به عاملهای عملیاتی تبدیل میکند.
این پیشرفت در حالی رخ میدهد که صنعت از پرامپتهای ایستا به سمت بهبود بازگشتی (Recursive Self-improvement) حرکت میکند. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، بحثهای مربوط به هوش مصنوعی بازگشتی پیش از این بیشتر در سطح تئوریک و «ابر-هوش» بود، اما این مورد یک رویکرد کاربردیتر است؛ جایی که عامل بهطور تکرارشونده ابزارهای خود را برای حل مسائل سختتر بهینه میکند.

بر اساس مستندات منتشر شده، این عامل در حدود ۸۰ تکرار، بدون هیچ دستور انسانی، چندین بهبود حیاتی در ساختار پشتیبان (Scaffolding) خود ایجاد کرد:
- ارتقای قابلیتهای مشاهده و تحلیل فایلها.
- افزودن مرحلهی اجباری اعتبارسنجی وصله (Patch Validation) پیش از ثبت نهایی هر اصلاحیه.
- تولید و رتبهبندی چندین راهکار جایگزین بهجای ارسال اولین نتیجهی بهدستآمده.
- ایجاد تاریخچهای پویا از تلاشهای قبلی و دلایل شکست آنها.
این بهینهسازیهای خودنویس منجر به جهشی چشمگیر در عملکرد شد. امتیاز این عامل در SWE-bench از ۲۰٪ به ۵۰٪ و در محک Polyglot از ۱۴٪ به ۳۱٪ رسید. با این حال، دستیابی به امتیاز بالا در بنچمارکها همواره به معنای موفقیت در محیطهای واقعی نیست و شکاف میان صحت پیادهسازی و صحت سیستمی در عاملهای کدنویس همچنان یک چالش بنیادین است.
برای جامعه فنی، این نتیجه فرضیهی نیاز به تنظیم دقیق (Fine-tuning) خارجی یا پرامپتهای طراحیشده توسط انسان برای بهبود عاملها را به چالش میکشد. این یافته نشان میدهد کارآمدترین مسیر برای رسیدن به عاملهای سطح بالا، اجازه دادن به آنهاست تا با ساختار عملیاتی خود مانند یک کد تغییرپذیر برخورد کنند و آن را از طریق آزمون و خطا بهینه سازند.
گام بعدی شما
- بررسی قابلیتهای بازنویسی خودکار در فریمورکهای عاملمحور برای کاهش وابستگی به مهندسی پرامپت.
- تحلیل پایداری حلقههای بازگشتی در پروژههای بزرگ برای جلوگیری از رگرسیونهای سیستمی.
- رصد تعمیمپذیری رویکرد «خود-ساختاری» (Self-scaffolding) در حوزههای استدلالی غیر از کدنویسی.
اما پایداری این حلقههای بازگشتی در مقیاس صنعتی هنوز یک علامت سؤال است — به تحلیل ما دربارهی ریسکهای همراستاسازی در مدلهای خود-بهبودبخش مراجعه کنید.




گفتگو