پرش به محتوای اصلی
پرش به محتوای مقاله

بِنچمارک MORPHEUS: عامل‌های یادگیری تقویتی در محیط‌های پویا شکست می‌خورند

·۲۳ تیر ۱۴۰۵۵ دقیقه مطالعه
شبیه‌ساز مورفیوس: بنچمارک یادگیری تقویتی پیوسته در محیط‌های سازمانی غیرایستا
شبیه‌ساز مورفیوس: بنچمارک یادگیری تقویتی پیوسته در محیط‌های سازمانی غیرایستا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی MORPHEUS به عنوان نخستین بنچمارک سازمان‌محور که به جای بازنشانی‌های سریع، بر «پایداری» و «ناپایداری ساختاری» تمرکز دارد تا شکاف بین آزمایشگاه و محیط تولید را اندازه بگیرد.

تصور کنید یک عامل هوشمند را در محیطی رها کنید که قوانین بازی‌اش هر چند ساعت یک‌بار تغییر می‌کند؛ در دنیای واقعی، اکثر این مدل‌ها در همین لحظه فرو می‌پاشند. برای به چالش کشیدن این شکنندگی، شرکت Skyfall AI پلتفرم MORPHEUS را معرفی کرد؛ یک پلتفرم شبیه‌ساز سازمانی پایدار که هدف آن اجبار به یادگیری تقویتی مستمر (Continual Reinforcement Learning یا CRL) در شرایط ناپایداری ساختارمند است.

بیشتر بنچمارک‌های فعلی یادگیری تقویتی (RL) بر پایه بازنشانی‌های دوره‌ای (Episodic Resets) کار می‌کنند، یعنی محیط پس از هر تلاش به حالت اول بازمی‌گردد. اما عملیات تجاری در دنیای واقعی پیوسته و بدون توقف است. طبق مستندات فنی این پروژه، این تفاوت باعث ایجاد «کسری وضعیت تثبیت‌شده» (Settled-state Deficit) می‌شود؛ وضعیتی که در آن عامل‌ها در آزمایشگاه‌های ایستا می‌درخشند اما در محیط تولید پویا شکست می‌خورند. این چالش در مدیریت وضعیت‌ها، یادآور نیاز به زیرساخت‌های مقاوم برای حفظ حافظه است؛ همان‌طور که به‌کارگیری SQLite برای جلوگیری از گم شدن وضعیت عامل‌ها در هنگام کرش گامی در جهت پایداری حافظه در محیط‌های عملیاتی است. MORPHEUS با بهره‌گیری از «فرضیه دنیای بزرگ» (Big World Hypothesis - Javed & Sutton, 2024)، پیچیدگی محیط را به گونه‌ای تعریف می‌کند که از ظرفیت بازنمایی عامل فراتر رود. به دلیل این حجم از پیچیدگی، حتی اگر دینامیک‌های زیربنایی محیط ثابت باشند، محیط برای عامل ناپایدار و متغیر به نظر می‌رسد.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت و پایداری مدل‌های عامل‌محور اشاره کردیم، گذار از محیط‌های کنترل‌شده به دنیای واقعی همیشه با چالش‌های پیش‌بینی‌ناپذیر همراه است. برای ایجاد یادگیری مستمر واقعی، چارچوب MORPHEUS سه ویژگی کلیدی و ستونی را الزامی می‌کند:

  • پایدار بودن (Persistence): تصمیمات گذشته به صورت انباشته روی دینامیک‌های آینده اثر می‌گذارند و اثرات آن‌ها در طول زمان باقی می‌ماند.
  • ناپایداری (Non-stationarity): هیچ سیاست ثابت و یکسانی در بلندمدت بهینه نمی‌ماند و هر استراتژی در نهایت منسوخ می‌شود.
  • پیچیدگی عملیاتی (Operational Complexity): هیچ سیاست بهینه واحد و جهانی برای کل محیط وجود ندارد که بتوان با آن تمام حالت‌ها را پوشش داد.

برای شبیه‌سازی این سطح از پیچیدگی، این پلتفرم از یک معماری پلاگین مبتنی بر TypeScript استفاده می‌کند. در این ساختار، هر محیط یک پلاگین مجزا و مستقل است که داده‌های اولیه (Seed Data)، مستندات، یک زمان‌بند شبیه‌سازی (Simulation Scheduler) و توصیف‌گرهای عملیاتی (Operational Descriptors یا ODs) را صادر می‌کند. این ODها در واقع برنامه اجرای گام‌به‌گام برای یک قابلیت خاص را تعریف می‌کنند. عامل‌ها از طریق یک API قابلیت (Capability API) با محیط تعامل می‌کنند و هر فراخوانی در این API، اجرای یک OD را فعال می‌کند.

به نقل از تحلیل فنی marktechpost.com، این پلتفرم برای پیش‌برد ناپایداری از دو موتور اصلی استفاده می‌کند: یک موتور تزریق خطا و یک کنترل‌کننده تغییر پیکربندی غیرهمزمان.

موتور تزریق خطا ۱۱ نوع اختلال مشخص را معرفی می‌کند؛ مواردی مانند missing_data (داده‌های گم‌شده)، dependency_failure (شکست وابستگی‌ها) و rate_limit (محدودیت نرخ درخواست). این اختلالات در چهار سطح شدت پیش‌فرض پیاده‌سازی شده‌اند:

  • سبک (Light): ۵٪
  • واقع‌گرایانه (Realistic): ۸٪
  • متوسط (Moderate): ۱۵٪
  • تهاجمی (Aggressive): ۳۰٪

برای جلوگیری از این موضوع که عامل‌ها صرفاً از زمان‌بندی به‌روزرسانی‌ها به عنوان یک «ساعت داخلی» برای تشخیص تغییرات استفاده کنند، کنترل‌کننده تغییرات (Shift Controller)، میزان تقاضا و پیش‌فرض‌های خطا را به صورت مستقل از حلقه آموزش (Training Loop) تغییر می‌دهد. این سازوکار تضمین می‌کند که جابه‌جایی‌های محیطی هرگز با به‌روزرسانی‌های گرادیان هم‌راستا نشوند و عامل نتواند از تناوب به‌روزرسانی به عنوان یک ساعت جایگزین استفاده کند.

پلتفرم عملکرد را از طریق سه تاییدکننده عملیاتی بومی (Native Operational Verifiers) می‌سنجد که در کنار هم یک پاداش ترکیبی را می‌سازند:

  • سیگنال‌های رویداد خطا ($w_f = 0.5$): این مقدار به صورت مجموع منفی شدت تیکت‌های خطا محاسبه می‌شود.
  • وضعیت دفتر کل مالی ($w_l = 0.25$): یک نسبت برش‌خورده (Clipped Ratio) از هزینه واقعی در مقابل هزینه برنامه‌ریزی‌شده است.
  • توان عملیاتی منابع ($w_p = 0.25$): یک نسبت برش‌خورده از واحدهای پردازش‌شده در برابر کل ظرفیت موجود است.

تحت مفروضات حد بالای تئوری (صفر بودن خطاها، حداقل هزینه و توان عملیاتی کامل)، حد بالای پاداش برای هر پیکربندی برابر با ۰.۵۰ محاسبه می‌شود.

به دلیل بزرگی فضای عملیاتی در شبیه‌سازهای سازمانی که برای یادگیری تقویتی خام از نقطه صفر بسیار زیاد است، تیم تحقیق از یک خط لوله آموزشی دو مرحله‌ای و پیچیده استفاده کرد. در مرحله اول، مدل Gemini 3.1 Pro از طریق چارچوب ری‌اکت (ReAct) مسیرهای عملیاتی (Trajectories) را جمع‌آوری کرد. سپس این ردپای‌ها برای تنظیم نظارت‌شده (SFT) مدل Qwen3-14B به کار رفت تا یک چک‌پوینت مشترک ایجاد شود. این کار باعث شد شایستگی عملیاتی پایه (Basic Operational Competence) از رفتار واقعی یادگیری مستمر تفکیک شود. در نهایت، تمام مدل‌های خط پایه (Baselines) از الگوریتم بهینه‌سازی سیاست تقریبی (PPO) به عنوان بهینه‌ساز آنلاین برای آموزش‌های پسینی استفاده کردند.

پژوهشگران برای ارزیابی جامع، شش معیار تعریف کردند؛ زیرا مجموع اسکالر پاداش‌های انباشته، عملکرد واقعی را در یک افق ناپایدار می‌پوشاند. این معیارها عبارتند از: پاداش هر پیکربندی، سرعت تطبیق (Adaptation Speed)، فراموشی (Forgetting)، زمان بازیابی (Recovery Time)، پایداری (Stability) و شکاف عملکرد (Performance Gap).

سرعت تطبیق، معیار اصلی و شاخص گزارش‌ها است و تعداد گام‌هایی را می‌شمارد که طول می‌کشد تا میانگین متحرک پاداش به نصف حد بالای تئوری برسد. این نیاز به تطبیق سریع در محیط‌های متغیر، یادآور پیشرفت‌های اخیر در متدهای انطباقی است؛ برای مثال روش MOCA توانسته است سرعت انطباق کاوشگرها را تا ۲۰ برابر افزایش دهد که نشان‌دهنده اهمیت بهینه‌سازی زمان واکنش در سیستم‌های پویاست. تشخیص‌های تکمیلی شامل «مزیت تطبیق نسبی» (RAA) و ردیابی پلاستیسیته (Plasticity) از طریق رتبه مؤثر (Effective Rank) است.

در آزمایش چهار خانواده الگوریتمی (PPO, HER, EWC, LCM) روی دو تکلیف تخصصی، هیچ الگوریتمی برتری مطلق نداشت. تکلیف اول شامل تخصیص پویای منابع تحت رانش ساختاریافته و تکلیف دوم زمان‌بندی تحت رانش با اثرات تأخیری بود:

  • LCM (مدل زمینه نهان): سریع‌ترین سرعت تطبیق را به دست آورد اما هیچ مزیت خاصی در تکلیف دوم نشان نداد.
  • EWC (تثبیت وزن‌ها): در کسب پاداش برای خروجی‌های فرآیندی تکلیف اول پیشتاز بود و در برخی مناطق بهترین تطبیق را داشت.
  • HER (بازپخش پس‌نگری): بهترین پاداش را در تکلیف دوم کسب کرد.
  • PPO: به عنوان خط پایه شکست عمل کرد و تنها در پیکربندی اولیه توانست تطبیق یابد.

نکته تکان‌دهنده اینجاست که PPO و HER عموماً در رژیم‌های بعدی، حتی بدون وجود سیگنال‌های برچسب‌دار، نتوانستند تطبیق یابند. میانگین شکاف عملکرد در تمام روش‌ها نزدیک به ۱.۰ باقی ماند که نشان می‌دهد این نقص، یک محدودیت ساختاری در الگوریتم‌هاست و نه مشکلی ناشی از تنظیمات هایپرپارامترها.

این تغییر در بنچمارک‌ها، فرضات پیشین حوزه AI را به چالش می‌کشد و ثابت می‌کند که «حل کردن» یک تکلیف بی‌معناست، اگر عامل نتواند تغییر رژیم محیطی را بدون برچسب‌های صریح شناسایی کند.

گام بعدی شما

  • اگر مهندس AI هستید: می‌توانید از مخزن Skyfall-Research/morpheus-evals برای تست این نکته استفاده کنید که آیا عامل‌های شما تغییر رژیم (مثلاً تغییر تقاضا از حالت پایین به حالت انفجاری) را بدون داشتن برچسب شناسایی می‌کنند یا خیر.
  • اگر دانشمند داده هستید: می‌توانید از این چارچوب برای تست «تخصیص اعتبار با تاخیر» (Delayed Credit Assignment) استفاده کنید؛ مانند معیارهای تحویل On-Time In-Full (OTIF) که تنها چند روز پس از تصمیم ارسال، قابل مشاهده هستند.
  • اگر مهندس نرم‌افزار هستید: می‌توانید از فرمت پلاگین TypeScript برای تغییر قابلیت مشاهده (Observability) یا تعویض سیستم پاداش‌ها بدون تغییر در دینامیک‌های اصلی محیط استفاده کنید.
  • بررسی کنید که آیا مدل‌های شما در مواجهه با تغییرات ناپایدار دچار فراموشی فاجعه‌بار (Catastrophic Forgetting) می‌شوند یا خیر.

اما تاثیر این ناپایداری بر هزینه‌های استنتاج در مقیاس صنعتی حتی پیچیده‌تر است — به تحلیل ما درباره بهینه‌سازی هزینه GPU مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر استانداردهای سخت‌گیرانه ارزیابی، ثابت می‌کند که عامل‌های فعلی برای استقرار در محیط‌های پیچیده سازمانی آماده نیستند. این موضوع اعتبار ادعاهای مربوط به «خودکارسازی کامل سازمان‌ها» را زیر سوال می‌برد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان یادگیری تقویتی در ایران اهمیت دارد تا بازار مصرف عمومی؛ چرا که چارچوب ارزیابی آن به‌صورت متن‌باز در دسترس است.

·نگاه ما
تحریریه دات‌هوش

شکست الگوریتم‌های PPO و HER در MORPHEUS نشان می‌دهد که صنعت در حال توهم «حل مسئله» است. ما با مدل‌هایی روبرو هستیم که در محیط‌های ایستا متخصص‌اند اما در محیط‌های پویا، حافظه عملیاتی‌شان کار نمی‌کند. این یافته، نیاز به گذار از بهینه‌سازهای ساده به معماری‌های یادگیری مستمر واقعی را ضروری می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.