تصور کنید در مسابقهای شرکت کردهاید که هرچه سریعتر میدوید، خط پایان دورتر میشود تا شما هرگز متوقف نشوید. این دقیقاً همان مکانیزمی است که پژوهشگران برای عبور از سقف توانمندیهای هوش مصنوعی طراحی کردهاند.
ماشین گودل ملکه قرمز (Red Queen Gödel Machine) گرهی بنیادی در بهبود بازگشتی (Recursive Improvement) را باز میکند: این واقعیت که یک عامل (Agent) خودبهبودبخش، تنها تا حدی پیشرفت میکند که ابزار سنجش آن اجازه دهد. با تکامل همزمان ارزیاب و عامل، سیستمی ایجاد شده است که در آن استاندارد موفقیت، همگام با رشد هوش مصنوعی، بهطور خودکار بالا میرود. این رویکرد در راستای موج جدیدی از خودکارسازی است که سرعت پیشرفت پژوهشهای هوش مصنوعی را به شکلی غیرمنتظره افزایش داده است.
این پژوهش به مسئله «سقف ارزیابی» میپردازد؛ وضعیتی که در آن عامل تمام بهبودهای قابل تشخیص توسط یک محک (Benchmark) ثابت را به اتمام میرساند. در ساختارهای سنتی، وقتی هوش مصنوعی بر یک مجموعه آزمون ایستا مسلط میشود، پیشرفت متوقف میگردد زیرا سیگنال ارزیابی دیگر نمیتواند تفاوت بین یک راهکار «خوب» و یک راهکار «عالی» را تشخیص دهد. الکس یاکوب (Alex Iacob)، دانشجوی دکترا و عضو تیم پژوهشی، توضیح میدهد: «آزمون صرفاً پیشرفت را اندازهگیری نمیکند، بلکه آن را تعریف میکند؛ بنابراین کارآمدی آزمون تبدیل به سقفی میشود که عامل نمیتواند از آن فراتر رود.»

زمینه و چارچوب عملیاتی
برای شکستن این چرخه، تیمی متشکل از متخصصان انویدیا (NVIDIA)، فلور لبز (Flower Labs)، MBZUAI و Inria یک حلقه تکاملی متقابل را پیاده کردند. این سامانه همزمان در میان نسخههای متعدد یک عامل جستوجو میکند و ارزیابی که آنها را قضاوت میکند، اصلاح مینماید.
همانطور که در بحثهای گذشته ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تکیه بر معیارهای ثابت همواره نقطه ضعف سیستمهای خودکار بوده است. این رویکرد جدید از «فرضیه ملکه قرمز» در زیستشناسی تکاملی (۱۹۷۳) الهام گرفته است. این فرضیه که نامش از شخصیتی در کتاب «آینه» لوئیس کارول آمده، میگوید گونهها برای بقا در برابر سایر گونههای در حال تکامل، باید مدام تغییر کنند تا حتی در جای خود باقی بمانند. در کتاب، ملکه قرمز به آلیس میگوید: «باید تمام توانی را برای دویدن به کار ببری تا فقط بتوانی در جای خود باقی بمانی.»
در این چارچوب هوش مصنوعی، عامل و ارزیاب در رقابتی مشابه قرار میگیرند. بهجای بهبود عامل در برابر یک آزمون ثابت، ارزیابی همگام با عامل تکامل مییابد. هرچه عامل توانمندتر شود، ارزیابی سختگیرانهتر میشود و سقف موفقیت بالاتر میرود. این یک مسابقهی تسلیحاتی است که در آن هر دو طرف برای بقا و پیشرفت مجبور به تکامل هستند. این تحول در معماری عاملها، این پرسش را برمیانگیزد که آیا سیستمهای خود-بهبودبخش در نهایت نیاز به ابزارهای سنتی را از بین میبرند یا خیر.
جزئیات فنی و سازوکار
طبق مستندات این پژوهش، سازوکار ماشین گودل بر محورهای زیر استوار است:
- حلقه تکامل متقابل: ماشین گودل ملکه قرمز در میان نسخههای احتمالی متعددی از یک عامل هوش مصنوعی جستوجو میکند و همزمان ارزیابی را که این عاملها را قضاوت میکند، بهبود میبخشد. این فرآیند یک بوتاسترپ بازگشتی ایجاد میکند که در آن عاملها و ارزیابها با هم رشد میکنند.
- مکانیزمهای پایداری: برای اطمینان از اینکه پیشرفت بهطور قابلاعتمادی اندازهگیری شود، ارزیاب در هر فاز از جستوجو ثابت نگه داشته میشود تا نوسانات تصادفی باعث گمراهی سیستم نشود.
- نقاط بازرسی (Checkpointing): در فواصل زمانی مشخص، یک ارزیاب قویتر جایگزین ارزیاب قدیمی میشود؛ مشروط بر اینکه ارزیاب جدید در نمونههای مرجع و مورد اعتماد (Ground-truth) عملکرد بهتری از پیشین خود نشان دهد.
- بازنشانی استانداردها: به محض نصب ارزیاب جدید، تمام امتیازات کسبشده توسط ارزیاب قدیمی حذف میشوند. این اقدام تضمین میکند که فاز بعدی جستوجو صرفاً توسط استانداردهای جدید و سختگیرانهتر هدایت شود، در حالی که سیستم همچنان به بررسیهای قابلاعتماد متصل باقی میماند.
تحلیل عملکرد و بنچمارکها
این چارچوب در وظایفی با پیچیدگی بالا، از جمله اثبات ریاضیات در سطح المپیاد، درجهبندی پاسخها و نگارش مقالات علمی آزمایش شد. بر اساس پیشچاپ arXiv، نتایج به شرح زیر است:
- نگارش علمی: نویسندگانی که بهصورت تکاملی رشد کردند، نرخ پذیرش ۱.۷۸ تا ۱.۸۶ برابری را در برابر پانلی متنوع از مدلهای «عامل-بهعنوان-داور» (Agent-as-a-judge) کسب کردند.
- صحت درجهبندی: ارزیابان تکاملیافته، افزایش ۹ درصدی در صحت تطبیق با دادههای مرجع (Ground-truth accuracy) نشان دادند.
کاهش هزینههای محاسباتی
یکی از یافتههای کلیدی این مطالعه، کارآمدی معماریهای ترکیبی برای کاهش هزینههای توسعه است. پژوهشگران مدل گرانقیمت ChatGPT-5.5 را با مدل بازمتن NVIDIA Nemotron 3 Ultra ترکیب کردند تا داوران و نویسندگان علمی را تکامل دهند.
این ساختار ترکیبی در حالی به عملکرد مدلهای خالص ChatGPT نزدیک شد که هزینههای توکن (Token) جستوجو را تقریباً ۱۳ برابر کاهش داد. دانیل برکهارت (Daniel Burkhardt)، مدیر روابط توسعهدهندگان انویدیا، تأکید میکند که مدلهای Nemotron بهطور خاص برای بارهای کاری استدلالی و عاملمحور طراحی شدهاند و این نتایج نشان میدهد مدلهای باز چگونه میتوانند نقش حیاتی در سیستمهای پیشرفته ایفا کنند.

از منظر فنی، این دستاورد فرضیه رایج مبنی بر نیاز به مجموعهدادههای ایستا یا بنچمارکهای انسانی برای خودبهبودی را به چالش میکشد و رابطهای پویا و تخاصمی بین «خالق» و «منتقد» ایجاد میکند.
پروفسور نیک لین (Nic Lane) معتقد است اگر مدلهای باز بتوانند بخش عمده جستوجو را بر عهده بگیرند و مدلهای پیشرو (Frontier) تنها هدایت سطح بالا را انجام دهند، مسیری عملی برای دستیابی به سیستمهای عامل باز با هزینه بسیار کمتر باز میشود. او اشاره میکند: «این یک نتیجه محدود است و باید مراقب باشیم که آن را بیش از حد بزرگ جلوه ندهیم، اما در عین حال نشان میدهد که این متدولوژی به کجا میتواند برسد.»
برای اکوسیستم گستردهتر هوش مصنوعی، این بدان معناست که مسیر رسیدن به بهبود بازگشتی شبیه به AGI ممکن است نه به قدرت محاسباتی خام بیشتر، بلکه به حلقههای ارزیابی پیچیدهتر وابسته باشد. اگر مدلهای باز واقعاً بتوانند بار جستوجو را به دوش بکشند، هزینه توسعه عاملهای خودمختار بسیار توانمند بهشدت کاهش خواهد یافت.
پروفسور نیک لین هشدار داد که این نتایج مقدماتی هستند و برای تعیین مقیاسپذیری کامل، به افقهای جستوجوی طولانیتری نیاز است. با این حال، تیم پژوهشی — که شامل نویسندگانی چون الکس یاکوب، آندری یووانوویچ، ویلیام اف. شن، دانیل برکهارت، مهتداد کرمانجی، نوربک تستان، لورنزو سانی، نیکولو آلبرتو الیا ونانزی، آمبرواز اودونات، زیو کائو، بیل مارینو، شینچی کیو و دیگران است — متعهد شدهاند که متدولوژی زیربنایی را بهصورت متنباز منتشر کنند تا پذیرش گستردهتر و آزمایش در وظایف متنوع هوش مصنوعی تسهیل شود.
گام بعدی شما
- بررسی مستندات متدولوژی ماشین گودل پس از انتشار کدها برای پیادهسازی در گردشکارهای خودبهبودبخش.
- آزمایش ترکیب مدلهای باز (مانند Nemotron) با مدلهای بسته برای کاهش هزینه استنتاج در سیستمهای چندعاملی.
- رصد کردن نتایج مقیاسپذیری این روش در وظایف غیرمتنی مانند کدنویسی پیچیده.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو