پرش به محتوای اصلی
پرش به محتوای مقاله

دانشگاه استنفورد: دست‌یابی به نرخ موفقیت ۹۸.۶ درسی در جابه‌جایی اشیا

·۱۵ مهر ۱۴۰۵۹ دقیقه مطالعه۲ بازدید
چارچوب متن‌باز OpenWAM برای مدل‌های ترکیبی جهان-کنش
چارچوب متن‌باز OpenWAM برای مدل‌های ترکیبی جهان-کنش
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی داده‌های ضدواقعی (Counterfactual) برای آموزش مدل‌های دینامیک رباتیک که نرخ موفقیت در یادگیری انتقالی را بیش از ۶۰ درصد بهبود بخشید.

تصور کنید رباتی دارید که پیش از هر حرکت، آینده را در ذهن خود شبیه‌سازی می‌کند تا از خطاهای احتمالی جلوگیری کند. رباتی که بتواند آینده خود را پیش از حرکت تصور کند، به‌طور قابل‌توجهی سازگارتر از رباتی است که صرفاً به محرک‌ها واکنش نشان می‌دهد. در ۷ اکتبر ۲۰۲۶، محققان چارچوب OpenWAM را معرفی کردند؛ سیستمی که با جداسازی نحوه پیش‌بینی نتایج بصری و اجرای عملیات، به نرخ موفقیت میانگین ۹۸.۶ درصدی در چهار مجموعه آزمون دستکاری LIBERO دست یافت.

بیشتر مدل‌های فعلی «دنیا-عمل» (World-Action Models) شبیه جعبه‌های سیاهی هستند که در آن‌ها ستون فقرات مدل (Backbone)، مجموعه داده‌ها و دستورالعمل‌های آموزش به‌طور کامل با هم ادغام شده‌اند. این ساختار باعث می‌شود تشخیص این موضوع تقریباً غیرممکن باشد که آیا ربات به‌دلیل ناتوانی در تصور هدف شکست خورده یا به‌دلیل ضعف در اجرای فیزیکی حرکت. OpenWAM این مشکل را با ایجاد یک زیرساخت مشترک حل می‌کند که در آن پیش‌بینی ویدیو و کنترل ربات را می‌توان به‌عنوان ماژول‌های مستقل جابه‌جا، بازآرایی یا به یکدیگر متصل کرد.

برای درک بهتر، ربات را مانند تیمی متشکل از دو متخصص تصور کنید: یک فیلم‌بردار حرفه‌ای (متخصص ویدیو) که تمام زوایای یک صحنه را پیش‌بینی می‌کند، و یک ورزشکار ماهر (متخصص عمل) که دقیقاً می‌داند هر عضله را چطور به کار بگیرد تا هدف را بزند. در سیستم‌های سنتی، این دو نقش توسط یک نفر ایفا می‌شد. اما در OpenWAM، این دو تخصص جدا شده‌اند و از طریق یک مکانیزم توجه (Attention) مشترک با هم ارتباط برقرار می‌کنند. این معماری به شما اجازه می‌دهد «چشم‌های» ربات را بدون نیاز به آموزش مجدد «عضلات» آن ارتقا دهید.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بنیادی بینایی اشاره کردیم، جداسازی لایه‌های ادراکی از لایه‌های اجرایی کلید مقیاس‌پذیری در سیستم‌های خودمختار است.

معماری: MoT و پیش‌آموزش

این سیستم با یک بنیاد بصری عظیم آغاز می‌شود. تیم پژوهشی مدل Wan2.2-5B را با پیش‌آموزش روی تقریباً ۳.۳۴ میلیون مسیر حرکتی، که در مجموع ۱۴.۶۴ هزار ساعت ویدیو بود، بهینه کردند. این مرحله از پیش‌آموزش (Pretraining) — شبیه خواندن میلیون‌ها کتاب برای یادگیری قواعد زبان بدون تمرین عملی — تنها با استفاده از ویدیو و بدون هیچ‌گونه برچسب‌های عملیاتی یا ورودی‌های حس‌گر داخلی (Proprioceptive) انجام شد. این رویکرد یادگیری از داده‌های بصری، یادآور استراتژی‌های مشابهی است که شرکت Reka AI برای حذف داده‌های گران‌قیمت رباتیک از طریق ویدیوهای اینترنتی به کار گرفت.

بر اساس مستندات پروژه، منابع داده‌های آموزشی طیف گسترده‌ای از دستکاری‌های رباتیک واقعی و مصنوعی، دستکاری‌های هدایت‌شده توسط انسان و تعاملات انسانی را پوشش می‌داد. منابع کلیدی عبارت بودند از:

  • OXE: پوشش ۴۹ مجموعه داده مختلف دستکاری.
  • InternData-A1: ارائه داده‌های مصنوعی برای افزایش تنوع.
  • Ego-Exo4D: ثبت تعاملات انسانی از زوایای مختلف.
  • UMI Family: شامل نسخه‌های UMI، DexUMI، UMI on Legs و MV-UMI.

برای فعال‌سازی تولید بهینه، تیم از «توجه علی» (Causal Attention) استفاده کرد. این مکانیزم به مدل اجازه می‌دهد ویدیوها را تکه‌تکه (Chunk) تولید کند؛ به‌طوری که هر تکه از مشاهدات فعلی، گذشته و تکه‌های قبلی استفاده می‌کند، اما به تکه‌های آینده دسترسی ندارد. توکن‌های هر تکه به‌طور هم‌زمان حذف نویز (Denoise) می‌شوند. این بنیاد بصری پس از ۱۴ روز آموزش روی ۳۲ عدد واحد پردازش گرافیکی (GPU) مدل NVIDIA B200 تثبیت شد.

برای تبدیل این متخصص بصری به یک کنترل‌کننده، محققان از معماری ترکیب ترنسفورمرها (Mixture-of-Transformers یا MoT) استفاده کردند. این معماری، متخصص ویدیو ۵ میلیارد پارامتری را با یک متخصص عمل ۲ میلیارد پارامتری جفت می‌کند. متخصص عمل در ابتدا به‌عنوان نسخه‌هایی از لایه‌های پیش‌آموز شده ویدیو (با تطبیق عرض لایه‌ها) آغاز به کار می‌کند. در حالی که هر متخصص لایه‌های نرمال‌سازی، تصویر (Projection) و لایه‌های پیش‌خور (Feed-forward) مخصوص به خود را حفظ می‌کند، آن‌ها از یک مکانیزم توجه مشترک روی توکن‌های ترکیبی برای تبادل اطلاعات حیاتی استفاده می‌کنند. همچنین هر دو متخصص به دستورالعمل‌های مربوط به وظیفه (Task Instruction) توجه دارند.

برنامه‌های تعاملی قابل پیکربندی

یکی از کاربردی‌ترین ویژگی‌های OpenWAM، انعطاف‌پذیری در ترتیب تولید است. این چارچوب از چندین «برنامه تعاملی» با استفاده از تطبیق جریان نهفته (Latent Flow Matching) پشتیبانی می‌کند. در این برنامه‌ها، چهار فریم ویدیویی نهفته به هر تکه عملیاتی ۱۶ مرحله‌ای اختصاص می‌یابد و داده‌های حس‌گر داخلی (Proprioception) برای هر تکه تأمین می‌شود.

انواع برنامه‌ها و مکانیزم‌های آن‌ها عبارتند از:

  • VTA (ویدیو-سپس-عمل): مدل ابتدا ویدیوی آینده را پیش‌بینی می‌کند و سپس اقدامات لازم برای رسیدن به آن حالت را تعیین می‌کند. در طول آموزش، مرحله دوم از مسیرهای ثبت‌شده یاد می‌گیرد؛ اما در زمان استنتاج (Inference)، از پیش‌بینی‌های مرحله اول استفاده می‌کند.
  • ATV (عمل-سپس-ویدیو): مدل ابتدا تصمیم به اقدام می‌گیرد و سپس نتیجه بصری حاصل از آن را پیش‌بینی می‌کند. مشابه VTA، این مدل برای آموزش از مسیرهای ثبت‌شده و برای استنتاج از پیش‌بینی‌های مرحله اول بهره می‌برد.
  • Joint (مشترک): در این حالت، ویدیو و اقدامات به‌طور هم‌زمان تولید می‌شوند.

هر برنامه همان دستورالعمل وظیفه و تاریخچه مشاهدات را دریافت می‌کند، در حالی که ستون فقرات، توکن‌سازی و هدف آموزش ثابت می‌مانند. این ساختار به محققان اجازه داد تا آزمایش کنند که آیا توجه بین توکن‌های ویدیو و عمل در آینده اصلاً ضروری است یا خیر. برای مثال، در آزمون LIBERO-Long، رویکرد جداسازی‌شده (Decoupled) با موفقیت ۹۷.۰ درصدی، تقریباً با رویکرد مشترک (۹۶.۶ درصد) برابری کرد.

جداسازی دینامیک‌ها: IDM و FDM

OpenWAM یک رابط «زمینه محلی» (Local-Context Interface) معرفی می‌کند که برنامه‌ریزی وظیفه را از انتقال‌های فیزیکی جدا می‌کند. این فرآیند توسط دو مدل مستقل مدیریت می‌شود که هیچ‌گونه دستور زبان وظیفه یا تاریخچه پیش از شروع را دریافت نمی‌کنند. این جداسازی اجازه می‌دهد پیش‌بین ویدیو برای وظایف جدید بهینه شود، در حالی که آزمایش شود که آیا همان مدل دینامیک هنوز اقدامات درست را تولید می‌کند یا خیر.

رابط‌های زمینه محلی عبارتند از:

  • مدل دینامیک معکوس (IDM): مشاهده فعلی + وضعیت داخلی + ویدیوی آینده ارائه‌شده $ \rightarrow $ مسیر اقدام.
  • مدل دینامیک پیشرو (FDM): مشاهده فعلی + وضعیت داخلی + مسیر اقدام ارائه‌شده $ \rightarrow $ ویدیوی آینده.

پیش‌بین ویدیو به‌جای ارسال حالت‌های پنهان ترنسفورمر یا حافظه (Cache)، لایه‌های نهفته VAE ویدیو را به IDM منتقل می‌کند. چون این اجزا از نمایش‌های سازگار استفاده می‌کنند، می‌توانند به‌طور جداگانه آموزش دیده و در زمان استنتاج به هم متصل شوند. به همین ترتیب، یک FDM می‌تواند نتیجه اقداماتی را پیش‌بینی کند که توسط یک سیاست (Policy) مجزا تولید شده‌اند.

قدرت داده‌های ضدواقعی (Counterfactuals)

آموزش‌های استاندارد رباتیک فقط نشان می‌دهند انسان چه کاری «انجام داد»، نه اینکه اگر ربات کاری را «اشتباه» انجام می‌داد چه اتفاقی «می‌افتاد». برای حل این مشکل، تیم مجموعه داده LIBERO-Long-CF را ایجاد کرد که شامل ۳۲ هزار قطعه ضدواقعی در ده وظیفه مختلف است. هر یک از این قطعات شامل ۱۲۸ کنترل و ۱۲۹ مشاهده هم‌گام‌شده از دو زاویه دید است. این مجموعه داده ۲۹.۷ برابر بیشتر از دموهای اصلی است و از همان وظایف، دارایی‌ها و قوانین فیزیکی استفاده می‌کند. این تمرکز بر تحلیل سناریوهای نادر و خطاها، مشابه رویکردی است که در مجموعه داده nuReasoning برای باز کردن منطق تصمیم‌گیری خودروهای خودران در موارد خاص (Edge Cases) به کار رفت.

این قطعات ضدواقعی از طریق بازگرداندن حالت‌های شبیه‌ساز و تلاش عمدی برای اجرای توالی‌های عملیاتی جایگزین (که اغلب ناموفق بودند) ایجاد شدند. تیم موارد زیر را تغییر داد:

  • اندازه و جهت حرکت.
  • زمان‌بندی و محورهای فردی اقدام.
  • رفتار گیره (Gripper).

۷۵ درصد از قطعات در امتداد یک دمو شروع شدند، در حالی که ۲۵ درصد پس از یک اختلال عملیاتی اضافی آغاز شدند. در این شروع‌های مختل‌شده، مجری نهایی (End Effector) به‌طور میانگین ۳.۳۴ سانتی‌متر (میانه ۱.۹۰ سانتی‌متر) از مسیر دمو فاصله داشت. در ۶۱.۶ درصد از این شروع‌ها، اشیاء به پیکربندی‌هایی خارج از دمو منتقل شدند (که با ۱ سانتی‌متر جابجایی، ۵ درجه چرخش یا ۵ درصد حرکت مفصل اندازه‌گیری شد).

یادگیری انتقالی و بازاستفاده از IDM

این داده‌های ضدواقعی برای یادگیری انتقالی (Transfer Learning) — شبیه وقتی که یک راننده ماشین، مهارت‌هایش را سریعاً به راندن کامیون منتقل می‌کند — حیاتی بودند. تیم این موضوع را با منجمد کردن (Freeze) مدل‌های IDM آموزش‌دیده روی LIBERO-Long و جفت کردن آن‌ها با پیش‌بین‌های ویدیویی که برای چهار وظیفه LIBERO-90 بهینه شده بودند، آزمایش کرد. این وظایف هدف شامل چیدن کاسه‌ها در سینی (۶۴)، قرار دادن کتاب در محفظه چپ یک جاکتابی (۷۴)، روشن کردن اجاق گاز و قرار دادن تابه روی آن (۲۱) و تکرار وظیفه اجاق در یک صحنه متفاوت (۴۵) بود.

نتایج انتقال به شرح زیر بود:

  • IDM زمینه محلی (با داده‌های CF): میانگین موفقیت ۸۴.۰ درصد.
  • IDM زمینه محلی (فقط دموها): میانگین موفقیت ۲۱.۵ درصد.
  • آموزش فقط با CF: میانگین موفقیت ۸۴.۵ درصد.

افزودن انتقال‌های ضدواقعی، نرخ موفقیت را بیش از ۶۰ واحد افزایش داد. علاوه بر این، نگه داشتن دموها در مجموعه آموزش به مدل کمک کرد تا مهارت‌های اصلی خود را حفظ کند؛ به‌طوری که موفقیت در وظایف منبع در مقایسه با آموزش فقط CF، از ۹۰.۶ درصد به ۹۴.۴ درصد رسید، در حالی که میانگین انتقال آن‌ها نزدیک باقی ماند.

اعتبارسنجی دینامیک پیشرو

برای آزمایش FDM، تیم ۲,۵۶۰ آینده ضدواقعی (۱۶ شاخه اقدام از ۱۶۰ زمینه شروع در ده وظیفه LIBERO) را تحلیل کرد. هر مدل مشاهدات اولیه و اقدامات کاندید یکسانی را دریافت کرد. آن‌ها اندازه‌گیری کردند که آیا نزدیک‌ترین تطبیق پیش‌بینی (بر اساس RGB MSE) در میان ۱۶ جایگزین، همان نتیجه واقعی است یا خیر.

نظارت ضدواقعی (Counterfactual Supervision)، مقدار RGB MSE را ۳۴.۵ درصد کاهش داد و شناسایی آینده درست را از ۲۱.۱ درصد به ۷۱.۳ درصد افزایش داد.

آزمایش‌های دنیای واقعی و دو-بازویی

فراتر از شبیه‌سازی، محققان سیستم را روی یک ربات دو-بازویی با استفاده از دو بازوی Franka Research 3 مجهز به گیره‌های موازی، دو دوربین مچی و یک دوربین شخص ثالث آزمایش کردند. برنامه‌های VTA و Joint در وظایف پیچیده دنیای واقعی به میانگین موفقیت ۹۲ درصدی رسیدند. آن‌ها روی ۲۰۰ دمو برای نان تست، ۲۰۰ دمو برای مکعب و ۱۸۰ دمو برای فنجان (هر کدام حدود ۳۰ ثانیه) آموزش دیدند و روی ۵۰، ۵۰ و ۳۶ آزمایش برای هر روش ارزیابی شدند.

وظایف دو-بازویی عبارت بودند از:

  • برشته کردن نان تست.
  • تکمیل لایه نهایی یک مکعب روبیک ۲x۲.
  • مرتب‌سازی فنجان‌ها بر اساس رنگ.

مدل‌های تخصصی در مقابل مدل‌های یکپارچه

تیم همچنین یک چک‌پوینت یکپارچه واحد را آزمایش کرد که روی تولید سیاست (Policy)، IDM و FDM آموزش دیده بود. این مدل یکپارچه ۶۰ درصد آموزش را به تولید مشترک ویدیو-عمل روی دموها، ۲۰ درصد به IDM زمینه محلی و ۲۰ درصد به FDM زمینه محلی اختصاص داد. در بخش دینامیک، نیمی از نمونه‌ها دمو و نیمی دیگر ضدواقعی بودند.

در حالی که مدل یکپارچه به موفقیت ۹۲.۸ درصدی در LIBERO-Long رسید (و از موفقیت ۸۸.۰ درصدی سیستم UVA پیشی گرفت)، مشخص شد که تخصص‌گرایی برنده است. مدل‌های سیاست اختصاصی، موفقیت در وظایف بالاتری را حفظ کردند و مدل‌های دینامیک که به‌طور جداگانه آموزش دیده بودند، پیش‌بینی‌های دقیق‌تری از ویدیوهای ضدواقعی و موقعیت مجری نهایی ارائه دادند. با این حال، مدل یکپارچه دقیق‌ترین بازسازی‌ها را روی دموهای واقعی ارائه کرد.

تأثیر پیش‌آموزش و MoT

پیش‌آموزش مخصوص رباتیک حیاتی بود. پیش‌آموزش علی ویدیو-ربات، موفقیت در LIBERO-Long را نسبت به مقداردهی اولیه Wan2.2 اصلی، برای VTA حدود ۲۹.۴ واحد و Joint حدود ۳۴.۴ واحد بهبود بخشید. علاوه بر این، معماری MoT (متخصصان مجزا) در مقایسه با یک DiT مشترک که هر دو مودالیته را پردازش می‌کرد، موفقیت VTA را ۵.۰ واحد و Joint را ۳.۰ واحد افزایش داد.

این تغییر به سمت مدل‌های دنیای ترکیب‌پذیر، معیار یادگیری رباتیک را تغییر می‌دهد. به‌جای آموزش یک مدل جدید برای هر وظیفه، توسعه‌دهندگان اکنون می‌توانند «موتور فیزیک» (IDM/FDM) را به‌عنوان یک دارایی قابل استفاده مجدد در نظر بگیرند. این کار به‌طور چشمگیری مقدار داده‌های مورد نیاز برای آموزش یک مهارت جدید به ربات را کاهش می‌دهد، زیرا تنها هدف بصری سطح بالا باید آموخته شود. این رویکرد در واقع گامی در جهت استفاده از مدل‌های دنیای مجازی برای غلبه بر محدودیت‌های فیزیکی است، مشابه آنچه در بررسی استفاده از داده‌های بازی‌های ویدئویی برای آموزش هوش مصنوعی فیزیکی و خودروهای خودران مشاهده شد.

برای متخصصان، این بدان معناست که تمرکز از جمع‌آوری دموهای بیشتر به جمع‌آوری «داده‌های شکست» تغییر می‌کند. توانایی شبیه‌سازی و یادگیری از آنچه «نباید» انجام داد، اکنون به اندازه دانستن مسیر درست ارزشمند است.

برای بررسی پیاده‌سازی، مخزن OpenWAM کد کامل آموزش و ارزیابی را به همراه وزن‌های مدل ویدیویی پیش‌آموز شده برای انطباق توسط جامعه علمی فراهم کرده است.

گام بعدی شما

  • بررسی مخزن OpenWAM برای دسترسی به کدهای آموزش و وزن‌های مدل پیش‌آموز شده.
  • تحلیل داده‌های ضدواقعی (Counterfactuals) برای بهبود استواری مدل‌های کنترلی در پروژه‌های رباتیک.
  • آزمایش رویکرد VTA در مقابل Joint برای تشخیص بهینه‌ترین ترتیب استنتاج در وظایف بصری-حرکتی.

اما تأثیر این معماری بر کاهش هزینه‌های سخت‌افزاری استنتاج حتی چشمگیرتر است — به تحلیل ما درباره بهینه‌سازی‌های لایه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی استنفورد، ثابت می‌کند که جداسازی ادراک از اجرا، نرخ موفقیت ربات‌ها را در محیط‌های متغیر به‌شدور افزایش می‌دهد. این تغییر باعث می‌شود نیاز به داده‌های آموزشی حجیم برای هر وظیفه جدید به‌شدت کاهش یابد.

تأثیر برای ایران

این پژوهش بیشتر برای محققان رباتیک و مدل‌های بنیادی در دانشگاه‌های ایران اهمیت دارد تا بازار مصرف؛ چراکه مسیرهای جدیدی برای آموزش ربات‌ها با داده‌های کمتر باز می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenWAM بر «داده‌های شکست» به‌جای «دموهای موفق»، پارادایم آموزش رباتیک را از تقلید ساده به درک عمیق علت و معلول تغییر می‌دهد. این رویکرد نشان می‌دهد که برای رسیدن به استقلال واقعی ربات‌ها، مدل باید بداند چه کارهایی را «نباید» انجام دهد. در واقع، تبدیل مدل‌های دینامیک به ماژول‌های قابل استفاده مجدد، گامی بزرگ به سوی ایجاد یک «سیستم‌عامل فیزیکی» برای هوش مصنوعی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.