پرش به محتوای اصلی
پرش به محتوای مقاله

آیا رویکرد XM می‌تواند مشکل تاری مود را در رباتیک حل کند؟

·۱۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
حلقه آموزش ممکن است مهم‌تر از مولد باشد: مدل‌سازی اکتشافی
حلقه آموزش ممکن است مهم‌تر از مولد باشد: مدل‌سازی اکتشافی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی محور سوم پیش‌آموزش (K) که با بهینه‌سازی بر اساس «بهترین از K» در زمان آموزش، اجازه می‌دهد مدل‌های پیچیده بدون نیاز به گام‌های متعدد، تنها در یک مرحله خروجی دقیق تولید کنند.

تصور کنید یک ربات برای برداشتن یک جسم، به‌جای اینکه صدها بار مسیر را در ذهن خود بازبینی کند، در یک چشم‌بهم‌زن تصمیم نهایی و دقیقی بگیرد. این جهش در سرعت، نتیجه‌ی رویکردی است که استنتاج را از یک فرآیند تکراری به یک عملیات تک‌مرحله‌ای تبدیل می‌کند.

به نقل از مقاله‌ی منتشرشده در جولای ۲۰۲۶ با عنوان «مدل‌سازی اکتشافی: باز کردن محور سوم پیش‌آموزش و تولید سرتاسری»، چارچوب آموزشی جدیدی به نام مدل‌سازی اکتشافی (Explorative Modeling یا XM) معرفی شده است. این متد که توسط الکسی گلدستون، هنگ جی و ییلون دو توسعه یافته، بار محاسباتی اکتشاف را از مرحله استنتاج (Inference) به چرخه آموزش منتقل می‌کند تا مدل‌های مولد بتوانند خروجی‌های شفاف و منسجم را تنها در یک گام تولید کنند.

مسئله‌ی تاری مود (Mode Blurring)

یکی از چالش‌های بنیادین در تولید داده‌های پیچیده و چندمودی (Multimodal)، پدیده‌ای به نام «تاری مود» است. این اتفاق زمانی رخ می‌دهد که یک ورودی واحد یا یک پرامپت، چندین هدف معتبر داشته باشد؛ برای مثال، پیش‌بینی قاب بعدی یک مسیر غیرقابل‌پیش‌بینی یا خلق یک تصویر از یک توصیف متنی بسیار کلی.

طبق مستندات این پژوهش، آموزش‌های بازسازی‌کننده استاندارد که از توابع زیان متداول استفاده می‌کنند، تمایل دارند میانگین ریاضی تمام اهداف محتمل را خروجی دهند. در کنترل پیوسته یا تولید تصویر، این میانگین‌گیری به شکل پیش‌بینی‌های غیرواقعی و محو ظاهر می‌شود که فاقد شفافیت و جزئیات دقیق هستند.

سوگیری مواجهه و تأخیر استنتاج

برای فرار از تاری مود، سیستم‌های فعلی مانند مدل‌های انتشار (Diffusion Models) و ترنسفورمرهای autoregressive بصری، فرآیند تولید را تجزیه می‌کنند. آن‌ها یک وظیفه پیچیده را به ده‌ها یا صدها گام کوچک، افزایشی و تقریباً تک‌مودی تقسیم می‌کنند.

اگرچه این روش مؤثر است، اما باعث ایجاد یک عدم‌تطابق بین آموزش و استنتاج می‌شود که به آن «سوگیری مواجهه» (Exposure Bias) می‌گویند. در طول آموزش، مدل‌ها از بافتار داده‌های واقعی (Teacher Forcing) استفاده می‌کنند. اما در زمان استنتاج، آن‌ها به پیش‌بینی‌های گذشته‌ی خود تکیه می‌کنند. در این حالت، خطاهای کوچک اولیه در طول زمان انباشته شده و منجر به انحراف توزیعی و «شناسایی‌ناپذیری معرفتی» (Epistemic Underidentification) می‌شود؛ حالتی که مدل با وضعیت‌هایی مواجه می‌گردد که فاقد بافتار تاریخی شفاف هستند. علاوه بر این، این زنجیره‌های چندمرحله‌ای بار محاسباتی عظیمی را تحمیل می‌کنند.

رویکرد XM به‌جای تجزیه فرآیند تولید، فرآیند آموزش را تجزیه می‌کند. در مدل توصیف شده در مقاله جولای ۲۰۲۶، مدل برای هر ورودی آموزشی $K$ کاندیدای خروجی تولید می‌کند و گرادیان تنها از طریق تک کاندیدایی که بیشترین تطابق را با داده مرجع دارد، پس‌انتشار (Backpropagation) می‌یابد.

سازوکار «بهترین از K» (Best-of-K)

این گردش کار آموزشی از چهار مرحله فنی متمایز پیروی می‌کند:

  • تولید کاندیدا: مدل $K$ خروجی بالقوه مختلف برای یک ورودی واحد ایجاد می‌کند.
  • ارزیابی تطبیق: هر کاندیدا با استفاده از یک معیار زیان (Loss Metric) مشخص، در برابر داده‌های هدف امتیاز می‌گیرد.
  • پس‌انتشار گزینشی: تنها کاندیدای برنده (آن که کمترین میزان زیان را دارد) انتخاب می‌شود.
  • به‌روزرسانی گرادیان: وزن‌های شبکه صرفاً بر اساس آن شاخه برنده به‌روزرسانی می‌شوند.

این مکانیسم را می‌توان از طریق یک جریان کاری خاص تصور کرد: برای یک ورودی $x$ و هدف $y$، مدل مجموعه‌ای از کاندیداها را تولید کرده، زیان هر یک را محاسبه می‌کند، شاخص کمترین زیان را شناسایی می‌کند (torch.argmin) و عملیات Backward pass را تنها روی آن best_loss انجام می‌دهد.

با امتناع از میانگین‌گیری از اهداف متناقض، مدل یاد می‌گیرد که بر روی مودهای داده‌ای مشخص و متمایز متمرکز شود. در نتیجه، هنگام استقرار واقعی، مدل می‌تواند ورودی را مستقیماً به یک نتیجه منسجم نگاشت کند بدون اینکه نیازی به زنجیره گام‌های پالایش داشته باشد و به‌طور مؤثر نیاز به نمونه‌گیری‌های کند را حذف کند.

مقیاس‌بندی و بنچمارک‌های عملکرد

پژوهشگران «بیان‌گری مولد» ($K$) را به‌عنوان محور سوم پیش‌آموزش، در کنار تعداد پارامترها و حجم مجموعه داده معرفی کرده‌اند. بر اساس گزارش این تیم، مقیاس‌بندی $K$ دستاوردهای هم‌افزایی در حوزه‌های گسسته و پیوسته، شامل زبان، ویدیو و تولید تصویر داشته است:

  • مقیاس داده: با افزایش اندازه مجموعه‌های داده، بهره‌وری حاصل از اکتشاف از ۷٪ به ۳۶٪ رشد کرد.
  • مقیاس مدل: با افزایش تعداد پارامترها، این بهره‌وری از ۱۳٪ به ۲۳٪ افزایش یافت.

در بنچمارک‌های عملی، نتایج بهینه‌سازی بسیار قابل توجه است:

  • بهره‌وری نمونه‌گیر: بهبود ۶.۲ برابری نسبت به آموزش‌های سنتی.
  • بهره‌وری FLOP: بهبود ۴.۱ برابری در کل عملیات ممیز شناور.
  • بهره‌وری پارامتری: بهبود ۴۷ درصدی.

در وظایف بصری با استفاده از خودرمزگذارهای نمایش (Representation Autoencoders - RAE)، این روش به امتیاز FID ۱.۴۳ در ImageNet-256x256 دست یافت. این نتیجه در حالی حاصل شد که سرعت همگرایی مدل حدود ۳۰۰ برابر سریع‌تر از مدل‌های پایه ترنسفورمرهای درونی‌ساز مقیاس‌پذیر (SiT) بود؛ نکته قابل توجه این است که این دستاورد بدون استفاده از Classifier-free Guidance به دست آمد.

در حوزه‌ی رباتیک و وظایف کنترلی، مانند شبیه‌سازی رفتار (Behavior Cloning) و مدل‌سازی جهانی شرط‌بندی‌شده با هدف (Goal-conditioned World Modeling)، مدل‌های اکتشافی سرتاسری در عملکرد با سیاست انتشار (Diffusion Policy) و دیفیوزر (Diffuser) برابری کردند. نکته حیاتی این است که آن‌ها این عملکرد را در حالی ارائه دادند که به ۱۶ تا ۲۵۶ برابر گام استنتاج کمتری نیاز داشتند. این تمرکز بر بهره‌وری در آموزش، مشابه رویکردهایی است که در مدل‌های استدلالی جدید برای جایگزینی برچسب‌های متنی با داده‌های ویدئویی دیده می‌شود، جایی که کیفیت داده ورودی در مرحله پیش‌آموزش، کلید بهبود عملکرد است.

محدودیت‌های پیاده‌سازی

متخصصان باید توجه داشته باشند که این کارایی با هزینه‌هایی در زمان آموزش همراه است. هزینه محاسباتی هر گام آموزشی بالاتر می‌رود، زیرا مدل باید $K$ کاندیدا تولید کند نه تنها یک مورد. اگرچه بهره‌وری کلی FLOP به دلیل همگرایی سریع‌تر بهبود می‌یابد، اما سربار هر مرحله (per-step overhead) افزایش می‌یابد.

همچنین دو وابستگی فنی اصلی وجود دارد:
۱. فرض پوشش کاندیداها: موفقیت آموزش Best-of-K بر این فرض استوار است که حداقل یکی از $K$ نمونه تولید شده، به اندازه کافی به مود هدف نزدیک باشد. اگر $K$ برای یک توزیع بسیار پیچیده بیش از حد کوچک باشد، ممکن است کاندیداها نتوانند هدف واقعی را پوشش دهند.
۲. وابستگی به رتبه‌بندی: کیفیت تعهد به مود (Mode Commitment) به شدت به دقت معیار زیان تطبیقی بستگی دارد که برای شناسایی بهترین کاندیدا در مرحله انتخاب استفاده می‌شود.

این تغییر دیدگاه نشان می‌دهد که برای کاربردهای آنی (Real-time) مانند هوش مصنوعی تعاملی یا رباتیک‌های سرعت‌بالا، صرف منابع محاسباتی در زمان آموزش به‌صرفه‌تر از پرداخت «مالیات تأخیر» در هر بار فراخوانی استنتاج است. با پرداختن به تاری مود در سطح تابع هدف، توسعه‌دهندگان می‌توانند از «اکتشاف» به عنوان یک پیچ تنظیم عملی برای مقیاس‌بندی کیفیت مدل استفاده کنند.

پژوهشگران و مهندسان می‌توانند جزئیات کامل فنی را در مقاله اصلی میزبانی شده در arXiv با شماره (2607.27372) بیابند.

گام بعدی شما

  • اگر روی مدل‌های کنترل رباتیک کار می‌کنید، معماری Best-of-K را برای جایگزینی زنجیره‌های کند Diffusion بررسی کنید.
  • بررسی کنید که آیا توزیع داده‌های شما به قدری پیچیده است که مقدار $K$ پیش‌فرض را برای پوشش مودهای هدف افزایش دهید.
  • مستندات فنی کامل را در مقاله arXiv (2607.27372) مطالعه کنید.

اما تأثیر این کاهش تأخیر بر لبه‌های پردازشی (Edge Computing) حتی حیاتی‌تر است — به تحلیل ما درباره‌ی توزیع مدل‌ها در سخت‌افزارهای محدود مراجعه کنید.

چرا این موضوع مهم است؟

این متد با حذف نیاز به نمونه‌گیری‌های تکراری، استقرار مدل‌های مولد در سیستم‌های سخت‌افزاری با تأخیر پایین (Low-latency) را ممکن می‌کند. اعتبار این یافته‌ها بر اساس بهبودهای ملموس در بنچمارک‌های ImageNet و رباتیک استوار است.

تأثیر برای ایران

این پژوهش برای تیم‌های تحقیقاتی رباتیک و کنترل در ایران که با محدودیت منابع GPU برای استنتاج سریع روبرو هستند، یک مسیر بهینه برای کاهش هزینه عملیاتی مدل‌ها در مرحله اجرا ارائه می‌دهد.

·نگاه ما
تحریریه دات‌هوش

انتقال پیچیدگی از استنتاج به آموزش، پارادایم «سرعت در برابر دقت» را در رباتیک به‌چالش می‌کشد. این رویکرد ثابت می‌کند که بسیاری از تأخیرهای مدل‌های مولد نه به دلیل محدودیت سخت‌افزاری، بلکه به دلیل استراتژی‌های آموزش نادرست است که مدل را مجبور به میانگین‌گیری می‌کند. در واقع، اکتشاف در زمان آموزش، جایگزین پالایش در زمان اجرا شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.