تصور کنید رباتی دارید که پیش از هر حرکت، آینده را در ذهن خود شبیهسازی میکند تا از خطاهای احتمالی جلوگیری کند. رباتی که بتواند آینده خود را پیش از حرکت تصور کند، بهطور قابلتوجهی سازگارتر از رباتی است که صرفاً به محرکها واکنش نشان میدهد. در ۷ اکتبر ۲۰۲۶، محققان چارچوب OpenWAM را معرفی کردند؛ سیستمی که با جداسازی نحوه پیشبینی نتایج بصری و اجرای عملیات، به نرخ موفقیت میانگین ۹۸.۶ درصدی در چهار مجموعه آزمون دستکاری LIBERO دست یافت.
بیشتر مدلهای فعلی «دنیا-عمل» (World-Action Models) شبیه جعبههای سیاهی هستند که در آنها ستون فقرات مدل (Backbone)، مجموعه دادهها و دستورالعملهای آموزش بهطور کامل با هم ادغام شدهاند. این ساختار باعث میشود تشخیص این موضوع تقریباً غیرممکن باشد که آیا ربات بهدلیل ناتوانی در تصور هدف شکست خورده یا بهدلیل ضعف در اجرای فیزیکی حرکت. OpenWAM این مشکل را با ایجاد یک زیرساخت مشترک حل میکند که در آن پیشبینی ویدیو و کنترل ربات را میتوان بهعنوان ماژولهای مستقل جابهجا، بازآرایی یا به یکدیگر متصل کرد.
برای درک بهتر، ربات را مانند تیمی متشکل از دو متخصص تصور کنید: یک فیلمبردار حرفهای (متخصص ویدیو) که تمام زوایای یک صحنه را پیشبینی میکند، و یک ورزشکار ماهر (متخصص عمل) که دقیقاً میداند هر عضله را چطور به کار بگیرد تا هدف را بزند. در سیستمهای سنتی، این دو نقش توسط یک نفر ایفا میشد. اما در OpenWAM، این دو تخصص جدا شدهاند و از طریق یک مکانیزم توجه (Attention) مشترک با هم ارتباط برقرار میکنند. این معماری به شما اجازه میدهد «چشمهای» ربات را بدون نیاز به آموزش مجدد «عضلات» آن ارتقا دهید.
همانطور که در تحلیلهای پیشین ما دربارهی مدلهای بنیادی بینایی اشاره کردیم، جداسازی لایههای ادراکی از لایههای اجرایی کلید مقیاسپذیری در سیستمهای خودمختار است.
معماری: MoT و پیشآموزش
این سیستم با یک بنیاد بصری عظیم آغاز میشود. تیم پژوهشی مدل Wan2.2-5B را با پیشآموزش روی تقریباً ۳.۳۴ میلیون مسیر حرکتی، که در مجموع ۱۴.۶۴ هزار ساعت ویدیو بود، بهینه کردند. این مرحله از پیشآموزش (Pretraining) — شبیه خواندن میلیونها کتاب برای یادگیری قواعد زبان بدون تمرین عملی — تنها با استفاده از ویدیو و بدون هیچگونه برچسبهای عملیاتی یا ورودیهای حسگر داخلی (Proprioceptive) انجام شد. این رویکرد یادگیری از دادههای بصری، یادآور استراتژیهای مشابهی است که شرکت Reka AI برای حذف دادههای گرانقیمت رباتیک از طریق ویدیوهای اینترنتی به کار گرفت.
بر اساس مستندات پروژه، منابع دادههای آموزشی طیف گستردهای از دستکاریهای رباتیک واقعی و مصنوعی، دستکاریهای هدایتشده توسط انسان و تعاملات انسانی را پوشش میداد. منابع کلیدی عبارت بودند از:
- OXE: پوشش ۴۹ مجموعه داده مختلف دستکاری.
- InternData-A1: ارائه دادههای مصنوعی برای افزایش تنوع.
- Ego-Exo4D: ثبت تعاملات انسانی از زوایای مختلف.
- UMI Family: شامل نسخههای UMI، DexUMI، UMI on Legs و MV-UMI.
برای فعالسازی تولید بهینه، تیم از «توجه علی» (Causal Attention) استفاده کرد. این مکانیزم به مدل اجازه میدهد ویدیوها را تکهتکه (Chunk) تولید کند؛ بهطوری که هر تکه از مشاهدات فعلی، گذشته و تکههای قبلی استفاده میکند، اما به تکههای آینده دسترسی ندارد. توکنهای هر تکه بهطور همزمان حذف نویز (Denoise) میشوند. این بنیاد بصری پس از ۱۴ روز آموزش روی ۳۲ عدد واحد پردازش گرافیکی (GPU) مدل NVIDIA B200 تثبیت شد.
برای تبدیل این متخصص بصری به یک کنترلکننده، محققان از معماری ترکیب ترنسفورمرها (Mixture-of-Transformers یا MoT) استفاده کردند. این معماری، متخصص ویدیو ۵ میلیارد پارامتری را با یک متخصص عمل ۲ میلیارد پارامتری جفت میکند. متخصص عمل در ابتدا بهعنوان نسخههایی از لایههای پیشآموز شده ویدیو (با تطبیق عرض لایهها) آغاز به کار میکند. در حالی که هر متخصص لایههای نرمالسازی، تصویر (Projection) و لایههای پیشخور (Feed-forward) مخصوص به خود را حفظ میکند، آنها از یک مکانیزم توجه مشترک روی توکنهای ترکیبی برای تبادل اطلاعات حیاتی استفاده میکنند. همچنین هر دو متخصص به دستورالعملهای مربوط به وظیفه (Task Instruction) توجه دارند.
برنامههای تعاملی قابل پیکربندی
یکی از کاربردیترین ویژگیهای OpenWAM، انعطافپذیری در ترتیب تولید است. این چارچوب از چندین «برنامه تعاملی» با استفاده از تطبیق جریان نهفته (Latent Flow Matching) پشتیبانی میکند. در این برنامهها، چهار فریم ویدیویی نهفته به هر تکه عملیاتی ۱۶ مرحلهای اختصاص مییابد و دادههای حسگر داخلی (Proprioception) برای هر تکه تأمین میشود.
انواع برنامهها و مکانیزمهای آنها عبارتند از:
- VTA (ویدیو-سپس-عمل): مدل ابتدا ویدیوی آینده را پیشبینی میکند و سپس اقدامات لازم برای رسیدن به آن حالت را تعیین میکند. در طول آموزش، مرحله دوم از مسیرهای ثبتشده یاد میگیرد؛ اما در زمان استنتاج (Inference)، از پیشبینیهای مرحله اول استفاده میکند.
- ATV (عمل-سپس-ویدیو): مدل ابتدا تصمیم به اقدام میگیرد و سپس نتیجه بصری حاصل از آن را پیشبینی میکند. مشابه VTA، این مدل برای آموزش از مسیرهای ثبتشده و برای استنتاج از پیشبینیهای مرحله اول بهره میبرد.
- Joint (مشترک): در این حالت، ویدیو و اقدامات بهطور همزمان تولید میشوند.
هر برنامه همان دستورالعمل وظیفه و تاریخچه مشاهدات را دریافت میکند، در حالی که ستون فقرات، توکنسازی و هدف آموزش ثابت میمانند. این ساختار به محققان اجازه داد تا آزمایش کنند که آیا توجه بین توکنهای ویدیو و عمل در آینده اصلاً ضروری است یا خیر. برای مثال، در آزمون LIBERO-Long، رویکرد جداسازیشده (Decoupled) با موفقیت ۹۷.۰ درصدی، تقریباً با رویکرد مشترک (۹۶.۶ درصد) برابری کرد.
جداسازی دینامیکها: IDM و FDM
OpenWAM یک رابط «زمینه محلی» (Local-Context Interface) معرفی میکند که برنامهریزی وظیفه را از انتقالهای فیزیکی جدا میکند. این فرآیند توسط دو مدل مستقل مدیریت میشود که هیچگونه دستور زبان وظیفه یا تاریخچه پیش از شروع را دریافت نمیکنند. این جداسازی اجازه میدهد پیشبین ویدیو برای وظایف جدید بهینه شود، در حالی که آزمایش شود که آیا همان مدل دینامیک هنوز اقدامات درست را تولید میکند یا خیر.
رابطهای زمینه محلی عبارتند از:
- مدل دینامیک معکوس (IDM): مشاهده فعلی + وضعیت داخلی + ویدیوی آینده ارائهشده $ \rightarrow $ مسیر اقدام.
- مدل دینامیک پیشرو (FDM): مشاهده فعلی + وضعیت داخلی + مسیر اقدام ارائهشده $ \rightarrow $ ویدیوی آینده.
پیشبین ویدیو بهجای ارسال حالتهای پنهان ترنسفورمر یا حافظه (Cache)، لایههای نهفته VAE ویدیو را به IDM منتقل میکند. چون این اجزا از نمایشهای سازگار استفاده میکنند، میتوانند بهطور جداگانه آموزش دیده و در زمان استنتاج به هم متصل شوند. به همین ترتیب، یک FDM میتواند نتیجه اقداماتی را پیشبینی کند که توسط یک سیاست (Policy) مجزا تولید شدهاند.
قدرت دادههای ضدواقعی (Counterfactuals)
آموزشهای استاندارد رباتیک فقط نشان میدهند انسان چه کاری «انجام داد»، نه اینکه اگر ربات کاری را «اشتباه» انجام میداد چه اتفاقی «میافتاد». برای حل این مشکل، تیم مجموعه داده LIBERO-Long-CF را ایجاد کرد که شامل ۳۲ هزار قطعه ضدواقعی در ده وظیفه مختلف است. هر یک از این قطعات شامل ۱۲۸ کنترل و ۱۲۹ مشاهده همگامشده از دو زاویه دید است. این مجموعه داده ۲۹.۷ برابر بیشتر از دموهای اصلی است و از همان وظایف، داراییها و قوانین فیزیکی استفاده میکند. این تمرکز بر تحلیل سناریوهای نادر و خطاها، مشابه رویکردی است که در مجموعه داده nuReasoning برای باز کردن منطق تصمیمگیری خودروهای خودران در موارد خاص (Edge Cases) به کار رفت.
این قطعات ضدواقعی از طریق بازگرداندن حالتهای شبیهساز و تلاش عمدی برای اجرای توالیهای عملیاتی جایگزین (که اغلب ناموفق بودند) ایجاد شدند. تیم موارد زیر را تغییر داد:
- اندازه و جهت حرکت.
- زمانبندی و محورهای فردی اقدام.
- رفتار گیره (Gripper).
۷۵ درصد از قطعات در امتداد یک دمو شروع شدند، در حالی که ۲۵ درصد پس از یک اختلال عملیاتی اضافی آغاز شدند. در این شروعهای مختلشده، مجری نهایی (End Effector) بهطور میانگین ۳.۳۴ سانتیمتر (میانه ۱.۹۰ سانتیمتر) از مسیر دمو فاصله داشت. در ۶۱.۶ درصد از این شروعها، اشیاء به پیکربندیهایی خارج از دمو منتقل شدند (که با ۱ سانتیمتر جابجایی، ۵ درجه چرخش یا ۵ درصد حرکت مفصل اندازهگیری شد).
یادگیری انتقالی و بازاستفاده از IDM
این دادههای ضدواقعی برای یادگیری انتقالی (Transfer Learning) — شبیه وقتی که یک راننده ماشین، مهارتهایش را سریعاً به راندن کامیون منتقل میکند — حیاتی بودند. تیم این موضوع را با منجمد کردن (Freeze) مدلهای IDM آموزشدیده روی LIBERO-Long و جفت کردن آنها با پیشبینهای ویدیویی که برای چهار وظیفه LIBERO-90 بهینه شده بودند، آزمایش کرد. این وظایف هدف شامل چیدن کاسهها در سینی (۶۴)، قرار دادن کتاب در محفظه چپ یک جاکتابی (۷۴)، روشن کردن اجاق گاز و قرار دادن تابه روی آن (۲۱) و تکرار وظیفه اجاق در یک صحنه متفاوت (۴۵) بود.
نتایج انتقال به شرح زیر بود:
- IDM زمینه محلی (با دادههای CF): میانگین موفقیت ۸۴.۰ درصد.
- IDM زمینه محلی (فقط دموها): میانگین موفقیت ۲۱.۵ درصد.
- آموزش فقط با CF: میانگین موفقیت ۸۴.۵ درصد.
افزودن انتقالهای ضدواقعی، نرخ موفقیت را بیش از ۶۰ واحد افزایش داد. علاوه بر این، نگه داشتن دموها در مجموعه آموزش به مدل کمک کرد تا مهارتهای اصلی خود را حفظ کند؛ بهطوری که موفقیت در وظایف منبع در مقایسه با آموزش فقط CF، از ۹۰.۶ درصد به ۹۴.۴ درصد رسید، در حالی که میانگین انتقال آنها نزدیک باقی ماند.
اعتبارسنجی دینامیک پیشرو
برای آزمایش FDM، تیم ۲,۵۶۰ آینده ضدواقعی (۱۶ شاخه اقدام از ۱۶۰ زمینه شروع در ده وظیفه LIBERO) را تحلیل کرد. هر مدل مشاهدات اولیه و اقدامات کاندید یکسانی را دریافت کرد. آنها اندازهگیری کردند که آیا نزدیکترین تطبیق پیشبینی (بر اساس RGB MSE) در میان ۱۶ جایگزین، همان نتیجه واقعی است یا خیر.
نظارت ضدواقعی (Counterfactual Supervision)، مقدار RGB MSE را ۳۴.۵ درصد کاهش داد و شناسایی آینده درست را از ۲۱.۱ درصد به ۷۱.۳ درصد افزایش داد.
آزمایشهای دنیای واقعی و دو-بازویی
فراتر از شبیهسازی، محققان سیستم را روی یک ربات دو-بازویی با استفاده از دو بازوی Franka Research 3 مجهز به گیرههای موازی، دو دوربین مچی و یک دوربین شخص ثالث آزمایش کردند. برنامههای VTA و Joint در وظایف پیچیده دنیای واقعی به میانگین موفقیت ۹۲ درصدی رسیدند. آنها روی ۲۰۰ دمو برای نان تست، ۲۰۰ دمو برای مکعب و ۱۸۰ دمو برای فنجان (هر کدام حدود ۳۰ ثانیه) آموزش دیدند و روی ۵۰، ۵۰ و ۳۶ آزمایش برای هر روش ارزیابی شدند.
وظایف دو-بازویی عبارت بودند از:
- برشته کردن نان تست.
- تکمیل لایه نهایی یک مکعب روبیک ۲x۲.
- مرتبسازی فنجانها بر اساس رنگ.
مدلهای تخصصی در مقابل مدلهای یکپارچه
تیم همچنین یک چکپوینت یکپارچه واحد را آزمایش کرد که روی تولید سیاست (Policy)، IDM و FDM آموزش دیده بود. این مدل یکپارچه ۶۰ درصد آموزش را به تولید مشترک ویدیو-عمل روی دموها، ۲۰ درصد به IDM زمینه محلی و ۲۰ درصد به FDM زمینه محلی اختصاص داد. در بخش دینامیک، نیمی از نمونهها دمو و نیمی دیگر ضدواقعی بودند.
در حالی که مدل یکپارچه به موفقیت ۹۲.۸ درصدی در LIBERO-Long رسید (و از موفقیت ۸۸.۰ درصدی سیستم UVA پیشی گرفت)، مشخص شد که تخصصگرایی برنده است. مدلهای سیاست اختصاصی، موفقیت در وظایف بالاتری را حفظ کردند و مدلهای دینامیک که بهطور جداگانه آموزش دیده بودند، پیشبینیهای دقیقتری از ویدیوهای ضدواقعی و موقعیت مجری نهایی ارائه دادند. با این حال، مدل یکپارچه دقیقترین بازسازیها را روی دموهای واقعی ارائه کرد.
تأثیر پیشآموزش و MoT
پیشآموزش مخصوص رباتیک حیاتی بود. پیشآموزش علی ویدیو-ربات، موفقیت در LIBERO-Long را نسبت به مقداردهی اولیه Wan2.2 اصلی، برای VTA حدود ۲۹.۴ واحد و Joint حدود ۳۴.۴ واحد بهبود بخشید. علاوه بر این، معماری MoT (متخصصان مجزا) در مقایسه با یک DiT مشترک که هر دو مودالیته را پردازش میکرد، موفقیت VTA را ۵.۰ واحد و Joint را ۳.۰ واحد افزایش داد.
این تغییر به سمت مدلهای دنیای ترکیبپذیر، معیار یادگیری رباتیک را تغییر میدهد. بهجای آموزش یک مدل جدید برای هر وظیفه، توسعهدهندگان اکنون میتوانند «موتور فیزیک» (IDM/FDM) را بهعنوان یک دارایی قابل استفاده مجدد در نظر بگیرند. این کار بهطور چشمگیری مقدار دادههای مورد نیاز برای آموزش یک مهارت جدید به ربات را کاهش میدهد، زیرا تنها هدف بصری سطح بالا باید آموخته شود. این رویکرد در واقع گامی در جهت استفاده از مدلهای دنیای مجازی برای غلبه بر محدودیتهای فیزیکی است، مشابه آنچه در بررسی استفاده از دادههای بازیهای ویدئویی برای آموزش هوش مصنوعی فیزیکی و خودروهای خودران مشاهده شد.
برای متخصصان، این بدان معناست که تمرکز از جمعآوری دموهای بیشتر به جمعآوری «دادههای شکست» تغییر میکند. توانایی شبیهسازی و یادگیری از آنچه «نباید» انجام داد، اکنون به اندازه دانستن مسیر درست ارزشمند است.
برای بررسی پیادهسازی، مخزن OpenWAM کد کامل آموزش و ارزیابی را به همراه وزنهای مدل ویدیویی پیشآموز شده برای انطباق توسط جامعه علمی فراهم کرده است.
گام بعدی شما
- بررسی مخزن OpenWAM برای دسترسی به کدهای آموزش و وزنهای مدل پیشآموز شده.
- تحلیل دادههای ضدواقعی (Counterfactuals) برای بهبود استواری مدلهای کنترلی در پروژههای رباتیک.
- آزمایش رویکرد VTA در مقابل Joint برای تشخیص بهینهترین ترتیب استنتاج در وظایف بصری-حرکتی.
اما تأثیر این معماری بر کاهش هزینههای سختافزاری استنتاج حتی چشمگیرتر است — به تحلیل ما درباره بهینهسازیهای لایه استنتاج مراجعه کنید.




گفتگو