پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل: RRSI هزینه استنتاج عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد

·۱۱ مهر ۱۴۰۵۴ دقیقه مطالعه
RSSI گوگل: عامل هوشمند بدون تغییر مدل، با تغییر روش حل بهتر می‌شود.
RSSI گوگل: عامل هوشمند بدون تغییر مدل، با تغییر روش حل بهتر می‌شود.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم منظم‌سازی (Regularization) برای بهبود بازگشتیِ محیط پیرامونی مدل؛ به‌جای تغییر وزن‌های مدل، «پوشش» مدل بهینه می‌شود تا از حفظ کردن داده‌های تست جلوگیری شود.

تصور کنید عاملی ساخته‌اید که در محیط تست بی‌نقص عمل می‌کند، اما به محض استقرار در دنیای واقعی، به‌طور کامل شکست می‌خورد. این «تله‌ی آموزش» (Training Trap) یکی از بزرگ‌ترین موانع توسعه‌ی سیستم‌های عامل‌محور است، جایی که یک عامل در زمان بهینه‌سازی پرامپت می‌درخشد اما در لحظه‌ی تولید (Production) ناکام می‌ماند.

برای حل این مشکل، گوگل کلود ای‌آی ریسرچ (Google Cloud AI Research) در همکاری با دانشگاه استنفورد و مراکز دانشگاهی دیگر، در ۲۱ سپتامبر ۲۰۲۶ متد RRSI (بهبود خودکار بازگشتی منظم‌شده برای هارنس‌های عامل) را معرفی کرد. اکثر توسعه‌دهندگان مدل زبانی بزرگ (LLM) را تنها محرک عملکرد می‌دانند، اما RRSI بر روی «هارنس» (Harness) تمرکز دارد؛ یعنی پوششی متشکل از پرامپت‌ها، دسترسی به ابزارها، مدیریت حافظه و کنترل‌های جریان کاری که مدل را احاطه کرده‌اند. مدل زبانی بزرگ — مثل موتور یک ماشین — تنها بخشی از قدرت است؛ اما هارنس شبیه به فرمان و چرخ‌هاست و اگر این بخش‌ها بد طراحی شده باشند، قدرتمندترین موتورها هم بی‌فایده‌اند.

RRSI گوگل: عامل هوش مصنوعی بدون تغییر مدل، با تغییر روش حل مسئله بهتر می‌شود

همان‌طور که در تحلیل قبلی ما درباره‌ی پروتکل MCP و حل شکست‌های عملیاتی اشاره کردیم، مشکل اصلی در بهبودهای بازگشتی است. روش‌های پیشین اجازه می‌دادند مدل‌ها تغییراتی در هارنس پیشنهاد دهند که روی کاغذ موفق به نظر می‌رسیدند، اما در واقع مدل فقط داده‌های آموزشی را «حفظ» کرده بود. در برخی موارد، این عامل‌های «بهبودیافته» در عمل حتی بدتر از نسخه‌ی اولیه (Baseline) عمل می‌کردند. این وضعیت منجر به بیش‌برازش (Overfitting) — شبیه به دانش‌آموزی که جواب تست‌ها را حفظ می‌کند اما مفهوم را نمی‌فهمد — می‌شد و در نتیجه عملکرد عامل در محیط واقعی افت می‌کرد. این چالش دقیقاً همان نقطه‌ای است که گوگل در گزارش‌های پیشین خود بر کاهش احتمال بیش‌برازش در عامل‌های هوش مصنوعی از طریق چارچوب RRSI تأکید کرده بود.

سازوکار RRSI

سیستم RRSI به‌جای محدود کردن آنچه می‌توان تغییر داد، فرآیند جست‌وجو را منظم می‌کند. بر اساس مستندات این پروژه، این متد از یک سیستم کنترل دوطرفه استفاده می‌کند:

  • بخش پیشنهاد (Proposal Side): از یک «بودجه ویرایش تعدیلی» (Annealed Edit Budget) استفاده می‌کند که در مراحل اول اجازه تغییرات گسترده را می‌دهد، اما در مراحل نهایی، تغییرات را به نقاط تک، کوچک و قابل‌اندازه‌گیری محدود می‌کند. همچنین تاریخچه‌ی فرضیات شکست‌خورده را ثبت می‌کند تا از تکرار خطاهای مشابه جلوگیری شود.
  • بخش انتخاب (Selection Side): یک «منتقد» (Critic) پیشنهاداتی را که بیش از حد به داده‌های آموزشی خاص وابسته هستند، فیلتر و حذف می‌کند. همچنین یک «کف تعدیل‌شده با نویز» (Noise-adjusted Floor) برای نادیده گرفتن نوسانات کوچک و یک «قانون هزینه» (Cost Rule) را اجرا می‌کند؛ به این معنا که هر افزایش در مصرف توکن (Token) — تکه‌های کوچکی از متن که مدل پردازش می‌کند — باید با بهبود واقعی و قابل‌اندازه‌گیری در عملکرد توجیه شود.

داده‌های عملکردی

این سیستم در هشت محک (Benchmark) مختلف در حوزه‌های کدنویسی، فضاهای کاری عامل‌ها و مهندسی آزمایش شد. به نقل از صفحه رسمی پروژه، RRSI به‌طور متوسط ۴ امتیاز در مجموعه‌های توسعه (Development Sets) و ۳.۴ امتیاز در شش مجموعه‌ی آزمونِ مجزا (Held-out Test Sets) کسب کرد.

در حوزه‌های فضای کاری عامل‌ها (مانند JobBench، GDPval و APEX-Agents)، این متد با امتیاز ۴۳.۶ از خط پایه (۳۹.۷) و روش‌های پیشین مثل HarnessX پیشی گرفت. نکته‌ی کلیدی این است که RRSI مصرف توکن‌ها را بین ۳۰٪ تا ۳۶٪ نسبت به روش‌های بهبود خودکارِ بدون منظم‌سازی کاهش داد.

برای توسعه‌دهندگان، این یافته اولویت را از ارتقای مدل به بازرسی و ممیزی هارنس تغییر می‌دهد. اگر عاملی حافظه‌ی زمینه را فراموش می‌کند یا فایل‌ها را اشتباه می‌خواند، تغییر مدل اغلب گران‌ترین و کم‌اثرترین راه است. در عوض، اجرای «قانون هزینه» — جایی که هر دستور اضافه‌شده به پرامپت باید ارزش خود را ثابت کند — از انباشت بدهی فنی در پرامپت‌های حجیم و متورم جلوگیری می‌کند.

با این حال، پژوهشگران به چهار محدودیت اشاره کرده‌اند. اول اینکه مدل اصلی در این مطالعه ثابت (Frozen) بود و تغییرات مدل در حین فرآیند لحاظ نشد. دوم اینکه این متد به مجموعه‌های توسعه خاصی وابسته است. سوم و چهارم اینکه پیش از پذیرش جهانی، نیاز به اعتبارسنجی بیشتر در معماری‌های مختلف عامل دارد.

گام بعدی شما

برای شروع به‌کارگیری این اصول، عملکرد عامل خود را روی مجموعه‌داده‌ای که هرگز ندیده است، ارزیابی کنید. اگر متوجه شدید پیشرفت عامل متوقف شده است، به‌جای تغییر در همان پرامپت تکراری، سیستم را مجبور کنید بخشی از هارنس را که تا به حال دست‌نخورده مانده — مانند مدیریت حافظه یا ترتیب فراخوانی ابزارها — تغییر دهد.

  • برای هر دستور جدید در پرامپت، یک معیار اندازه‌گیری تعریف کنید تا مطمئن شوید افزایش مصرف توکن، منجر به بهبود خروجی شده است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متد با تکیه بر اعتبار پژوهشی گوگل و استنفورد، هزینه‌ی استنتاج را به‌شدت کاهش می‌دهد. این موضوع برای شرکت‌هایی که در مقیاس بالا از عامل‌ها استفاده می‌کنند، به معنای کاهش مستقیم صورت‌حساب‌های ابری است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه برای APIها و GPUها روبر هستند، کاهش ۳۰ درصدی مصرف توکن‌ها یک مزیت اقتصادی مستقیم است.

·نگاه ما
تحریریه دات‌هوش

تمرکز روی «هارنس» به‌جای مدل، پارادایم توسعه را از مهندسی مدل به مهندسی سیستم تغییر می‌دهد. این رویکرد ثابت می‌کند که بسیاری از شکست‌های عامل‌های هوش مصنوعی ناشی از ضعف در استدلال مدل نیست، بلکه نتیجه‌ی نبودِ ساختارهای کنترلی در محیط پیرامونی است. در واقع، بهینه‌سازی لایه‌ی محیطی، راهکاری ارزان‌تر و پایدارتر از Fine-tuning برای رسیدن به دقت عملیاتی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.