تصور کنید رباتی بتواند تنها با تماشای ویدیوهای یوتیوب یا دوربینهای شخصی، مهارتهای پیچیدهٔ انسانی را یاد بگیرد و بدون نیاز به آموزشهای دستی، آنها را اجرا کند. این رویای دیرینهٔ رباتیک اکنون با معرفی Dyna-2 به یک واقعیت ریاضی تبدیل شده است.
Dyna Robotics مدلی را عرضه کرده است که روی بیش از یک میلیون ساعت ویدیو از دید اولشخص انسانها — معادل ۱۷۰ سال تجربهٔ بیداری — پیشآموزش (Pre-training) دیده است تا گلوگاه مزمن کمبود دادههای برچسبدار در رباتیک را از بین ببرد. طبق گزارش marktechpost.com، این مدل اکنون میتواند دانش جهان را از ویدیوهای معمولی استخراج کرده و به حرکات فیزیکی تبدیل کند.
همانطور که در تحلیل قبلی ما دربارهی یادگیری فیزیک از ویدیوهای انسانی اشاره کردیم، Dyna-2 گامی فراتر نهاده و ثابت کرده است که ویدیوهای انسانی میتوانند جایگزین آموزشهای اختصاصی ربات شوند. این رویکرد در واقع پاسخی به چالشهای مقایسه ویدیوهای انسانی در برابر آموزشهای دستی است که پیشتر بررسی کرده بودیم. در چشمانداز فعلی، اکثر مدلها برای تولید داده به کنترل از راه دور (Teleoperation) متکی هستند؛ فرآیندی که بسیار کند است و مقیاسپذیری ندارد. Dyna-2 این پارادایم را تغییر داده و ویدیوهای انسانی را به منبع اصلی دانش جهان تبدیل کرده است.
معماری فنی
این مدل از نظر معماری یک ترکیب خبرهها (Mixture of Experts) است که از یک ستون فقرات مدل انتشار (Diffusion Model) ویدیویی استفاده میکند. Dyna-2 توکنهای ویدیو و اکشن را بهصورت مجزا از طریق لایههای ترنسفورمر (Transformer) پردازش میکند، در حالی که دادههای حس proprioception مستقیماً به ترنسفورمر اکشن تغذیه میشوند.
در این ساختار، توکنهای ویدیو از ماسکگذاری علی (Causal Masking) استفاده میکنند، اما توکنهای اکشن از خودتوجهی (Self-attention) دوطرفه بهره میبرند. برای تضمین عملکرد در لحظه، ترنسفورمر اکشن کمعمقتر طراحی شده تا تأخیر (Latency) را بدون کاهش دقت کم کند. از آنجا که شبکه اکشن هرگز ورودیهای نویزی ویدیو را نمیگیرد، سیاست مدل در زمان استنتاج (Inference) واکنشی باقی میماند و سعی در پیشبینی آینده نمیکند.
قوانین مقیاسپذیری و عملکرد
تیم Dyna Robotics یک «نردبان داده» را با زیرمجموعههای ۱ هزار، ۱۰ هزار، ۱۰۰ هزار و ۱ میلیون ساعت آزمایش کرد. آنها برای جلوگیری از اثر توزیع دادهها، نسبتهای یکسانی از هر منبع را حفظ کردند و از یک مجموعه اعتبارسنجی (Validation set) ۱۰۰ ساعته برای امتیازدهی استفاده کردند.
بر اساس مستندات فنی، سه نتیجه کلیدی به دست آمد:
- مقیاسپذیری دادههای انسانی: تمام معیارهای اصلی بهصورت یکنواخت بهبود یافتند و از قوانین مقیاسپذیری (Scaling Laws) پیروی کردند. در طول این نردبان، صحت (Accuracy) در سطح ۰.۱ حدود ۵۱٪ افزایش یافت.
- انتقال Zero-shot: این قانون حتی برای دادههای رباتیکی که مدل هرگز ندیده بود نیز صادق بود. در ۳۹ تکلیف مختلف، میانگین مربعات خطا (MSE) در حالت Zero-shot از یک قانون توانی پیروی کرد و یک نقطه عطف مشخص بین ۱۰ هزار و ۱۰۰ هزار ساعت مشاهده شد.
- تعمیمیافتگی ویدیو-محور: حذف نویز همزمان ویدیو و اکشن، در تمام ۳۹ تکلیف بر آموزشهای صرفاً اکشنمحور پیروز شد. با ثابت نگه داشتن دادههای اکشن در ۵۰ هزار ساعت و افزودن ویدیوها، MSE ربات از ۰.۳۴۰ به ۰.۱۲۰ کاهش یافت.

آزمایش روی ربات و کاربردها
هر پله از نردبان داده روی ۱۴ تکلیف صنعتی با حداکثر ۱۰ ساعت داده رباتیک تنظیم دقیق (Fine-tuning) شد. این آزمایشها روی سه بدنه مختلف شامل بازوهای ۶ درجه آزادی (6-DOF)، دستهای چابک ۲۰ درجه آزادی و یک نمونه اولیه نیمهانسانی انجام شد.
این تکالیف شامل کارهای واقعی صنعتی بود، از جمله:
- پاکسازی سینی زباله و برداشتن غذا
- آمادهسازی کیتهای کمکهای اولیه
- گره زدن طناب و آمادهسازی چوبلباسی
- برداشتن نوشیدنیهای هدفمند از یخچال
امتیازات میانگین از ۲۰٪ در پایینترین پله به ۵۳٪ در مدل یک میلیون ساعتی رسید. در تکلیف «چرخاندن کلید صندوق»، نرخ موفقیت از ۰٪ (در ۱۰۰ هزار ساعت) به ۹۰٪ (در یک میلیون ساعت) جهش کرد. حتی در «باز کردن درب بطری»، مدل با تنها ۱۰ دقیقه نمایش، به صحت ۵۰٪ رسید.
استقرار در دنیای واقعی
در مقایسه با نسل قبلی یعنی Dyna-1، نسخه اولیه Dyna-2 در هفت تکلیف ترکیبی به نرخ موفقیت ۱.۵۵ برابر بیشتر دست یافت. در محیطهای عملیاتی مشتریان، Dyna-2 در ۸۷٪ موارد معیارهای پذیرش را پاس کرد، در حالی که این رقم برای Dyna-1 تنها ۴۶٪ بود.
طبق اعلام شرکت در ۱۰ اوت ۲۰۲۶، رباتهای Dyna-1 هماکنون در هتلها، رستورانها و خشکشوییها فعال هستند. هدف این فناوری، اپراتورهای خدمات میانبازار و شرکتهای چندسایتی است که کارهای تکراری در حوزههای پذیرایی، مونتاژ سبک و نظافت صنعتی انجام میدهند.
با این حال، Dyna-2 بهصورت وزنهای باز (Open Weights) یا API منتشر نشده است و استقرار آن مستلزم خرید سلولهای رباتیک تحت مدیریت شرکت است. این مدل برای سازندگان مستقل یا آزمایشگاههای تحقیقاتی که به استنتاج محلی نیاز دارند، طراحی نشده است.
این تحول نشان میدهد که تعمیمپذیری بین بدنههای مختلف رباتیک، بیش از آنکه به حجم دادههای اکشن وابسته باشد، توسط آموزش مشترک با ویدیو هدایت میشود. این رویکرد شباهتهای ساختاری با تلاشهای گوگل برای دستیابی به AGI فیزیکی دارد که در آن ادغام بینایی و اکشن در اولویت قرار گرفته است. با جداسازی درک جهان (ویدیو) از اجرای خاص (اکشن)، Dyna Robotics مسیری ایجاد کرده تا رباتها ابتدا با تماشای انسان «بفهمند» و سپس با کمترین داده رباتیک، مهارت را اصلاح کنند.
برای متخصصان این حوزه، مهمترین دستاورد، خط لوله distillation است که زمان نمونهگیری ویدیو را از ۱۰,۲۰۳ میلیثانیه به ۱۱۰ میلیثانیه روی یک GPU H100 کاهش داده و مدلهای عظیم جهانی را برای سیاستهای واکنشی در لحظه (Real-time) کاربردی کرده است.
گام بعدی شما
- بررسی مقایسهای بین مدلهای VLA (Vision-Language-Action) و مدلهای WAM برای درک تفاوت در استنتاج حرکتی.
- دنبال کردن گزارشهای استقرار Dyna-2 در محیطهای صنعتی برای سنجش نرخ خطای واقعی در مقیاس تجاری.
- مطالعه مقالات مربوط به Flow Matching در مدلهای انتشار برای درک نحوه تبدیل ویدیو به اکشن.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو