پرش به محتوای اصلی
پرش به محتوای مقاله

عامل Darwin Gödel با بازنویسی کد داخلی، امتیاز SWE-bench را به ۵۰٪ رساند

·۱۴ مهر ۱۴۰۵۱ دقیقه مطالعه
عامل‌های یادگیرنده RSI: بازنویسی داربست خود توسط عامل‌ها
عامل‌های یادگیرنده RSI: بازنویسی داربست خود توسط عامل‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر رویکرد از بهبود مدل (Model Improvement) به بهبود ساختار عملیاتی (Scaffolding Improvement) به‌صورت خودکار و بدون دخالت انسان.

امتیاز ۵۰٪ در محک SWE-bench، مرز جدیدی برای عامل (Agent) موسوم به Darwin Gödel Machine است؛ جهشی در قابلیت‌های خودکار که از طریق بازنویسی کدِ عملیاتی توسط خودِ مدل به دست آمده است. به نقل از گزارشی که در ۶ اکتبر ۲۰۲۶ منتشر شد، این عامل که توسط Sakana و آزمایشگاه جف کلون توسعه یافته، مجموعه‌ای از متدهای پیچیده مهندسی نرم‌افزار را — دقیقاً مشابه چک‌لیست ورود یک مهندس ارشد به پروژه — به‌طور خودکار پیاده‌سازی کرده است. این رویکرد در واقع تکامل یافته‌ی استراتژی‌های امتیازدهی و بازآموزی است که مدل‌های پیشرو را به عامل‌های عملیاتی تبدیل می‌کند.

این پیشرفت در حالی رخ می‌دهد که صنعت از پرامپت‌های ایستا به سمت بهبود بازگشتی (Recursive Self-improvement) حرکت می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، بحث‌های مربوط به هوش مصنوعی بازگشتی پیش از این بیشتر در سطح تئوریک و «ابر-هوش» بود، اما این مورد یک رویکرد کاربردی‌تر است؛ جایی که عامل به‌طور تکرارشونده ابزارهای خود را برای حل مسائل سخت‌تر بهینه می‌کند.

عوامل یادگیری RSI: عامل‌هایی که داربست خود را بازنویسی می‌کنند

بر اساس مستندات منتشر شده، این عامل در حدود ۸۰ تکرار، بدون هیچ دستور انسانی، چندین بهبود حیاتی در ساختار پشتیبان (Scaffolding) خود ایجاد کرد:

  • ارتقای قابلیت‌های مشاهده و تحلیل فایل‌ها.
  • افزودن مرحله‌ی اجباری اعتبارسنجی وصله (Patch Validation) پیش از ثبت نهایی هر اصلاحیه.
  • تولید و رتبه‌بندی چندین راهکار جایگزین به‌جای ارسال اولین نتیجه‌ی به‌دست‌آمده.
  • ایجاد تاریخچه‌ای پویا از تلاش‌های قبلی و دلایل شکست آن‌ها.

این بهینه‌سازی‌های خودنویس منجر به جهشی چشمگیر در عملکرد شد. امتیاز این عامل در SWE-bench از ۲۰٪ به ۵۰٪ و در محک Polyglot از ۱۴٪ به ۳۱٪ رسید. با این حال، دستیابی به امتیاز بالا در بنچمارک‌ها همواره به معنای موفقیت در محیط‌های واقعی نیست و شکاف میان صحت پیاده‌سازی و صحت سیستمی در عامل‌های کدنویس همچنان یک چالش بنیادین است.

برای جامعه فنی، این نتیجه فرضیه‌ی نیاز به تنظیم دقیق (Fine-tuning) خارجی یا پرامپت‌های طراحی‌شده توسط انسان برای بهبود عامل‌ها را به چالش می‌کشد. این یافته نشان می‌دهد کارآمدترین مسیر برای رسیدن به عامل‌های سطح بالا، اجازه دادن به آن‌هاست تا با ساختار عملیاتی خود مانند یک کد تغییرپذیر برخورد کنند و آن را از طریق آزمون و خطا بهینه سازند.

گام بعدی شما

  • بررسی قابلیت‌های بازنویسی خودکار در فریم‌ورک‌های عامل‌محور برای کاهش وابستگی به مهندسی پرامپت.
  • تحلیل پایداری حلقه‌های بازگشتی در پروژه‌های بزرگ برای جلوگیری از رگرسیون‌های سیستمی.
  • رصد تعمیم‌پذیری رویکرد «خود-ساختاری» (Self-scaffolding) در حوزه‌های استدلالی غیر از کدنویسی.

اما پایداری این حلقه‌های بازگشتی در مقیاس صنعتی هنوز یک علامت سؤال است — به تحلیل ما درباره‌ی ریسک‌های همراستاسازی در مدل‌های خود-بهبودبخش مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تجربه عملی در محیط SWE-bench ثابت می‌کند که خود-بهینه‌سازی کد عملیاتی، سریع‌تر از آموزش مجدد مدل است. این تغییر، هزینه توسعه عامل‌های تخصصی را به‌شدت کاهش می‌دهد.

تأثیر برای ایران

این رویکرد برای برنامه‌نویسان ایرانی که با محدودیت دسترسی به سخت‌افزارهای سنگین برای Fine-tuning مواجه‌اند، مسیری جایگزین برای ارتقای عملکرد عامل‌های محلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مهندسی پرامپت با «مهندسی خودکار ساختار» توسط مدل، پارادایم توسعه عامل‌ها را تغییر می‌دهد. اگر مدل بتواند ابزارهای استنتاج خود را بر اساس نتایج واقعی اصلاح کند، سقف عملکرد مدل‌های زبانی دیگر به اندازه پارامترها، بلکه به کیفیت حلقه‌ی بازخورد (Feedback Loop) وابسته خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.