پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش انویدیا: تکامل هم‌زمان ارزیاب و عامل هزینه‌های محاسباتی را کاهش داد

·۲۶ مرداد ۱۴۰۵۵ دقیقه مطالعه۴ بازدید
فرضیه ملکه سرخ: راهی نو برای هوش مصنوعی خودبهبودیابنده
فرضیه ملکه سرخ: راهی نو برای هوش مصنوعی خودبهبودیابنده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی بنچمارک‌های ایستا با ارزیابان تکامل‌یافته (Co-evolved Evaluators) که مانع از توقف پیشرفت مدل در اثر اشباع داده‌ها می‌شود و هزینه جست‌وجو را ۱۳ برابر کاهش می‌دهد.

تصور کنید در مسابقه‌ای شرکت کرده‌اید که هرچه سریع‌تر می‌دوید، خط پایان دورتر می‌شود تا شما هرگز متوقف نشوید. این دقیقاً همان مکانیزمی است که پژوهشگران برای عبور از سقف توانمندی‌های هوش مصنوعی طراحی کرده‌اند.

ماشین گودل ملکه قرمز (Red Queen Gödel Machine) گرهی بنیادی در بهبود بازگشتی (Recursive Improvement) را باز می‌کند: این واقعیت که یک عامل (Agent) خودبهبودبخش، تنها تا حدی پیشرفت می‌کند که ابزار سنجش آن اجازه دهد. با تکامل هم‌زمان ارزیاب و عامل، سیستمی ایجاد شده است که در آن استاندارد موفقیت، هم‌گام با رشد هوش مصنوعی، به‌طور خودکار بالا می‌رود. این رویکرد در راستای موج جدیدی از خودکارسازی است که سرعت پیشرفت پژوهش‌های هوش مصنوعی را به شکلی غیرمنتظره افزایش داده است.

این پژوهش به مسئله «سقف ارزیابی» می‌پردازد؛ وضعیتی که در آن عامل تمام بهبودهای قابل تشخیص توسط یک محک (Benchmark) ثابت را به اتمام می‌رساند. در ساختارهای سنتی، وقتی هوش مصنوعی بر یک مجموعه آزمون ایستا مسلط می‌شود، پیشرفت متوقف می‌گردد زیرا سیگنال ارزیابی دیگر نمی‌تواند تفاوت بین یک راهکار «خوب» و یک راهکار «عالی» را تشخیص دهد. الکس یاکوب (Alex Iacob)، دانشجوی دکترا و عضو تیم پژوهشی، توضیح می‌دهد: «آزمون صرفاً پیشرفت را اندازه‌گیری نمی‌کند، بلکه آن را تعریف می‌کند؛ بنابراین کارآمدی آزمون تبدیل به سقفی می‌شود که عامل نمی‌تواند از آن فراتر رود.»

فرضیه ملکه سرخ: راهی نو برای هوش مصنوعی خودبهبودی

زمینه و چارچوب عملیاتی

برای شکستن این چرخه، تیمی متشکل از متخصصان انویدیا (NVIDIA)، فلور لبز (Flower Labs)، MBZUAI و Inria یک حلقه تکاملی متقابل را پیاده کردند. این سامانه هم‌زمان در میان نسخه‌های متعدد یک عامل جست‌وجو می‌کند و ارزیابی که آن‌ها را قضاوت می‌کند، اصلاح می‌نماید.

همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تکیه بر معیارهای ثابت همواره نقطه ضعف سیستم‌های خودکار بوده است. این رویکرد جدید از «فرضیه ملکه قرمز» در زیست‌شناسی تکاملی (۱۹۷۳) الهام گرفته است. این فرضیه که نامش از شخصیتی در کتاب «آینه» لوئیس کارول آمده، می‌گوید گونه‌ها برای بقا در برابر سایر گونه‌های در حال تکامل، باید مدام تغییر کنند تا حتی در جای خود باقی بمانند. در کتاب، ملکه قرمز به آلیس می‌گوید: «باید تمام توانی را برای دویدن به کار ببری تا فقط بتوانی در جای خود باقی بمانی.»

در این چارچوب هوش مصنوعی، عامل و ارزیاب در رقابتی مشابه قرار می‌گیرند. به‌جای بهبود عامل در برابر یک آزمون ثابت، ارزیابی هم‌گام با عامل تکامل می‌یابد. هرچه عامل توانمندتر شود، ارزیابی سخت‌گیرانه‌تر می‌شود و سقف موفقیت بالاتر می‌رود. این یک مسابقه‌ی تسلیحاتی است که در آن هر دو طرف برای بقا و پیشرفت مجبور به تکامل هستند. این تحول در معماری عامل‌ها، این پرسش را برمی‌انگیزد که آیا سیستم‌های خود-بهبودبخش در نهایت نیاز به ابزارهای سنتی را از بین می‌برند یا خیر.

جزئیات فنی و سازوکار

طبق مستندات این پژوهش، سازوکار ماشین گودل بر محورهای زیر استوار است:

  • حلقه تکامل متقابل: ماشین گودل ملکه قرمز در میان نسخه‌های احتمالی متعددی از یک عامل هوش مصنوعی جست‌وجو می‌کند و هم‌زمان ارزیابی را که این عامل‌ها را قضاوت می‌کند، بهبود می‌بخشد. این فرآیند یک بوت‌استرپ بازگشتی ایجاد می‌کند که در آن عامل‌ها و ارزیاب‌ها با هم رشد می‌کنند.
  • مکانیزم‌های پایداری: برای اطمینان از اینکه پیشرفت به‌طور قابل‌اعتمادی اندازه‌گیری شود، ارزیاب در هر فاز از جست‌وجو ثابت نگه داشته می‌شود تا نوسانات تصادفی باعث گمراهی سیستم نشود.
  • نقاط بازرسی (Checkpointing): در فواصل زمانی مشخص، یک ارزیاب قوی‌تر جایگزین ارزیاب قدیمی می‌شود؛ مشروط بر اینکه ارزیاب جدید در نمونه‌های مرجع و مورد اعتماد (Ground-truth) عملکرد بهتری از پیشین خود نشان دهد.
  • بازنشانی استانداردها: به محض نصب ارزیاب جدید، تمام امتیازات کسب‌شده توسط ارزیاب قدیمی حذف می‌شوند. این اقدام تضمین می‌کند که فاز بعدی جست‌وجو صرفاً توسط استانداردهای جدید و سخت‌گیرانه‌تر هدایت شود، در حالی که سیستم همچنان به بررسی‌های قابل‌اعتماد متصل باقی می‌ماند.

تحلیل عملکرد و بنچمارک‌ها

این چارچوب در وظایفی با پیچیدگی بالا، از جمله اثبات ریاضیات در سطح المپیاد، درجه‌بندی پاسخ‌ها و نگارش مقالات علمی آزمایش شد. بر اساس پیش‌چاپ arXiv، نتایج به شرح زیر است:

  • نگارش علمی: نویسندگانی که به‌صورت تکاملی رشد کردند، نرخ پذیرش ۱.۷۸ تا ۱.۸۶ برابری را در برابر پانلی متنوع از مدل‌های «عامل-به‌عنوان-داور» (Agent-as-a-judge) کسب کردند.
  • صحت درجه‌بندی: ارزیابان تکامل‌یافته، افزایش ۹ درصدی در صحت تطبیق با داده‌های مرجع (Ground-truth accuracy) نشان دادند.

کاهش هزینه‌های محاسباتی

یکی از یافته‌های کلیدی این مطالعه، کارآمدی معماری‌های ترکیبی برای کاهش هزینه‌های توسعه است. پژوهشگران مدل گران‌قیمت ChatGPT-5.5 را با مدل بازمتن NVIDIA Nemotron 3 Ultra ترکیب کردند تا داوران و نویسندگان علمی را تکامل دهند.

این ساختار ترکیبی در حالی به عملکرد مدل‌های خالص ChatGPT نزدیک شد که هزینه‌های توکن (Token) جست‌وجو را تقریباً ۱۳ برابر کاهش داد. دانیل برکهارت (Daniel Burkhardt)، مدیر روابط توسعه‌دهندگان انویدیا، تأکید می‌کند که مدل‌های Nemotron به‌طور خاص برای بارهای کاری استدلالی و عامل‌محور طراحی شده‌اند و این نتایج نشان می‌دهد مدل‌های باز چگونه می‌توانند نقش حیاتی در سیستم‌های پیشرفته ایفا کنند.

فرضیه ملکه سرخ: راهی نو برای هوش مصنوعی خودبهبودی

از منظر فنی، این دستاورد فرضیه رایج مبنی بر نیاز به مجموعه‌داده‌های ایستا یا بنچمارک‌های انسانی برای خودبهبودی را به چالش می‌کشد و رابطه‌ای پویا و تخاصمی بین «خالق» و «منتقد» ایجاد می‌کند.

پروفسور نیک لین (Nic Lane) معتقد است اگر مدل‌های باز بتوانند بخش عمده جست‌وجو را بر عهده بگیرند و مدل‌های پیشرو (Frontier) تنها هدایت سطح بالا را انجام دهند، مسیری عملی برای دستیابی به سیستم‌های عامل باز با هزینه بسیار کمتر باز می‌شود. او اشاره می‌کند: «این یک نتیجه محدود است و باید مراقب باشیم که آن را بیش از حد بزرگ جلوه ندهیم، اما در عین حال نشان می‌دهد که این متدولوژی به کجا می‌تواند برسد.»

برای اکوسیستم گسترده‌تر هوش مصنوعی، این بدان معناست که مسیر رسیدن به بهبود بازگشتی شبیه به AGI ممکن است نه به قدرت محاسباتی خام بیشتر، بلکه به حلقه‌های ارزیابی پیچیده‌تر وابسته باشد. اگر مدل‌های باز واقعاً بتوانند بار جست‌وجو را به دوش بکشند، هزینه توسعه عامل‌های خودمختار بسیار توانمند به‌شدت کاهش خواهد یافت.

پروفسور نیک لین هشدار داد که این نتایج مقدماتی هستند و برای تعیین مقیاس‌پذیری کامل، به افق‌های جست‌وجوی طولانی‌تری نیاز است. با این حال، تیم پژوهشی — که شامل نویسندگانی چون الکس یاکوب، آندری یووانوویچ، ویلیام اف. شن، دانیل برکهارت، مهتداد کرمانجی، نوربک تستان، لورنزو سانی، نیکولو آلبرتو الیا ونانزی، آمبرواز اودونات، زیو کائو، بیل مارینو، شینچی کیو و دیگران است — متعهد شده‌اند که متدولوژی زیربنایی را به‌صورت متن‌باز منتشر کنند تا پذیرش گسترده‌تر و آزمایش در وظایف متنوع هوش مصنوعی تسهیل شود.

گام بعدی شما

  • بررسی مستندات متدولوژی ماشین گودل پس از انتشار کدها برای پیاده‌سازی در گردش‌کارهای خودبهبودبخش.
  • آزمایش ترکیب مدل‌های باز (مانند Nemotron) با مدل‌های بسته برای کاهش هزینه استنتاج در سیستم‌های چندعاملی.
  • رصد کردن نتایج مقیاس‌پذیری این روش در وظایف غیرمتنی مانند کدنویسی پیچیده.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار دانشگاه کمبریج و انویدیا، ثابت می‌کند که سقف پیشرفت AI را می‌توان با تکامل هم‌زمان ارزیاب جابه‌جا کرد. این موضوع هزینه توسعه عامل‌های خودمختار را به‌شدت کاهش داده و وابستگی به نظارت انسانی را کم می‌کند.

تأثیر برای ایران

این خبر برای پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد؛ چرا که استفاده از مدل‌های باز (Open Weights) در کنار مدل‌های بسته، مسیری ارزان‌تر برای توسعه عامل‌های پیشرفته را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این رویکرد پارادایم «بهبود از طریق داده‌های بیشتر» را به «بهبود از طریق ارزیابی سخت‌گیرانه‌تر» تغییر می‌دهد. در واقع، ماشین گودل نشان می‌دهد که برای رسیدن به هوش مصنوعی سطح بالا، لزوماً به مدل‌های بزرگ‌تر نیاز نداریم، بلکه به «منتقدان» هوشمندتری نیاز داریم که بتوانند نقاط ضعف مدل را شناسایی کنند. این یعنی مسیر AGI ممکن است از طریق بهینه‌سازی حلقه‌های بازخورد (Feedback Loops) همگرا شود، نه فقط افزایش پارامترها.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.