پرش به محتوای اصلی
پرش به محتوای مقاله

۱۷۰ سال تجربهٔ انسانی؛ Dyna-2 قوانین مقیاس‌پذیری رباتیک را بازنویسی کرد

·۲۲ مرداد ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
معرفی Dyna-2: مدل جهان-عمل رباتیک با پیش‌آموزش روی یک میلیون ساعت ویدیوی انسانی
معرفی Dyna-2: مدل جهان-عمل رباتیک با پیش‌آموزش روی یک میلیون ساعت ویدیوی انسانی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات ریاضی قوانین مقیاس‌پذیری (Scaling Laws) برای داده‌های ویدئویی انسانی در رباتیک؛ یعنی هرچه ویدیوهای انسانی بیشتری به مدل بدهیم، عملکرد ربات در کارهای دیده‌نشده به‌صورت پیش‌بینی‌پذیر بهبود می‌یابد.

تصور کنید رباتی بتواند تنها با تماشای ویدیوهای یوتیوب یا دوربین‌های شخصی، مهارت‌های پیچیدهٔ انسانی را یاد بگیرد و بدون نیاز به آموزش‌های دستی، آن‌ها را اجرا کند. این رویای دیرینهٔ رباتیک اکنون با معرفی Dyna-2 به یک واقعیت ریاضی تبدیل شده است.

Dyna Robotics مدلی را عرضه کرده است که روی بیش از یک میلیون ساعت ویدیو از دید اول‌شخص انسان‌ها — معادل ۱۷۰ سال تجربهٔ بیداری — پیش‌آموزش (Pre-training) دیده است تا گلوگاه مزمن کمبود داده‌های برچسب‌دار در رباتیک را از بین ببرد. طبق گزارش marktechpost.com، این مدل اکنون می‌تواند دانش جهان را از ویدیوهای معمولی استخراج کرده و به حرکات فیزیکی تبدیل کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی یادگیری فیزیک از ویدیوهای انسانی اشاره کردیم، Dyna-2 گامی فراتر نهاده و ثابت کرده است که ویدیوهای انسانی می‌توانند جایگزین آموزش‌های اختصاصی ربات شوند. این رویکرد در واقع پاسخی به چالش‌های مقایسه ویدیوهای انسانی در برابر آموزش‌های دستی است که پیش‌تر بررسی کرده بودیم. در چشم‌انداز فعلی، اکثر مدل‌ها برای تولید داده به کنترل از راه دور (Teleoperation) متکی هستند؛ فرآیندی که بسیار کند است و مقیاس‌پذیری ندارد. Dyna-2 این پارادایم را تغییر داده و ویدیوهای انسانی را به منبع اصلی دانش جهان تبدیل کرده است.

معماری فنی

این مدل از نظر معماری یک ترکیب خبره‌ها (Mixture of Experts) است که از یک ستون فقرات مدل انتشار (Diffusion Model) ویدیویی استفاده می‌کند. Dyna-2 توکن‌های ویدیو و اکشن را به‌صورت مجزا از طریق لایه‌های ترنسفورمر (Transformer) پردازش می‌کند، در حالی که داده‌های حس proprioception مستقیماً به ترنسفورمر اکشن تغذیه می‌شوند.

در این ساختار، توکن‌های ویدیو از ماسک‌گذاری علی (Causal Masking) استفاده می‌کنند، اما توکن‌های اکشن از خودتوجهی (Self-attention) دوطرفه بهره می‌برند. برای تضمین عملکرد در لحظه، ترنسفورمر اکشن کم‌عمق‌تر طراحی شده تا تأخیر (Latency) را بدون کاهش دقت کم کند. از آنجا که شبکه اکشن هرگز ورودی‌های نویزی ویدیو را نمی‌گیرد، سیاست مدل در زمان استنتاج (Inference) واکنشی باقی می‌ماند و سعی در پیش‌بینی آینده نمی‌کند.

قوانین مقیاس‌پذیری و عملکرد

تیم Dyna Robotics یک «نردبان داده» را با زیرمجموعه‌های ۱ هزار، ۱۰ هزار، ۱۰۰ هزار و ۱ میلیون ساعت آزمایش کرد. آن‌ها برای جلوگیری از اثر توزیع داده‌ها، نسبت‌های یکسانی از هر منبع را حفظ کردند و از یک مجموعه اعتبارسنجی (Validation set) ۱۰۰ ساعته برای امتیازدهی استفاده کردند.

بر اساس مستندات فنی، سه نتیجه کلیدی به دست آمد:

  • مقیاس‌پذیری داده‌های انسانی: تمام معیارهای اصلی به‌صورت یکنواخت بهبود یافتند و از قوانین مقیاس‌پذیری (Scaling Laws) پیروی کردند. در طول این نردبان، صحت (Accuracy) در سطح ۰.۱ حدود ۵۱٪ افزایش یافت.
  • انتقال Zero-shot: این قانون حتی برای داده‌های رباتیکی که مدل هرگز ندیده بود نیز صادق بود. در ۳۹ تکلیف مختلف، میانگین مربعات خطا (MSE) در حالت Zero-shot از یک قانون توانی پیروی کرد و یک نقطه عطف مشخص بین ۱۰ هزار و ۱۰۰ هزار ساعت مشاهده شد.
  • تعمیم‌یافتگی ویدیو-محور: حذف نویز هم‌زمان ویدیو و اکشن، در تمام ۳۹ تکلیف بر آموزش‌های صرفاً اکشن‌محور پیروز شد. با ثابت نگه داشتن داده‌های اکشن در ۵۰ هزار ساعت و افزودن ویدیوها، MSE ربات از ۰.۳۴۰ به ۰.۱۲۰ کاهش یافت.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

آزمایش روی ربات و کاربردها

هر پله از نردبان داده روی ۱۴ تکلیف صنعتی با حداکثر ۱۰ ساعت داده رباتیک تنظیم دقیق (Fine-tuning) شد. این آزمایش‌ها روی سه بدنه مختلف شامل بازوهای ۶ درجه آزادی (6-DOF)، دست‌های چابک ۲۰ درجه آزادی و یک نمونه اولیه نیمه‌انسانی انجام شد.

این تکالیف شامل کارهای واقعی صنعتی بود، از جمله:

  • پاک‌سازی سینی زباله و برداشتن غذا
  • آماده‌سازی کیت‌های کمک‌های اولیه
  • گره زدن طناب و آماده‌سازی چوب‌لباسی
  • برداشتن نوشیدنی‌های هدفمند از یخچال

امتیازات میانگین از ۲۰٪ در پایین‌ترین پله به ۵۳٪ در مدل یک میلیون ساعتی رسید. در تکلیف «چرخاندن کلید صندوق»، نرخ موفقیت از ۰٪ (در ۱۰۰ هزار ساعت) به ۹۰٪ (در یک میلیون ساعت) جهش کرد. حتی در «باز کردن درب بطری»، مدل با تنها ۱۰ دقیقه نمایش، به صحت ۵۰٪ رسید.

استقرار در دنیای واقعی

در مقایسه با نسل قبلی یعنی Dyna-1، نسخه اولیه Dyna-2 در هفت تکلیف ترکیبی به نرخ موفقیت ۱.۵۵ برابر بیشتر دست یافت. در محیط‌های عملیاتی مشتریان، Dyna-2 در ۸۷٪ موارد معیارهای پذیرش را پاس کرد، در حالی که این رقم برای Dyna-1 تنها ۴۶٪ بود.

طبق اعلام شرکت در ۱۰ اوت ۲۰۲۶، ربات‌های Dyna-1 هم‌اکنون در هتل‌ها، رستوران‌ها و خشک‌شویی‌ها فعال هستند. هدف این فناوری، اپراتورهای خدمات میان‌بازار و شرکت‌های چندسایتی است که کارهای تکراری در حوزه‌های پذیرایی، مونتاژ سبک و نظافت صنعتی انجام می‌دهند.

با این حال، Dyna-2 به‌صورت وزن‌های باز (Open Weights) یا API منتشر نشده است و استقرار آن مستلزم خرید سلول‌های رباتیک تحت مدیریت شرکت است. این مدل برای سازندگان مستقل یا آزمایشگاه‌های تحقیقاتی که به استنتاج محلی نیاز دارند، طراحی نشده است.

این تحول نشان می‌دهد که تعمیم‌پذیری بین بدنه‌های مختلف رباتیک، بیش از آنکه به حجم داده‌های اکشن وابسته باشد، توسط آموزش مشترک با ویدیو هدایت می‌شود. این رویکرد شباهت‌های ساختاری با تلاش‌های گوگل برای دستیابی به AGI فیزیکی دارد که در آن ادغام بینایی و اکشن در اولویت قرار گرفته است. با جداسازی درک جهان (ویدیو) از اجرای خاص (اکشن)، Dyna Robotics مسیری ایجاد کرده تا ربات‌ها ابتدا با تماشای انسان «بفهمند» و سپس با کمترین داده رباتیک، مهارت را اصلاح کنند.

برای متخصصان این حوزه، مهم‌ترین دستاورد، خط لوله distillation است که زمان نمونه‌گیری ویدیو را از ۱۰,۲۰۳ میلی‌ثانیه به ۱۱۰ میلی‌ثانیه روی یک GPU H100 کاهش داده و مدل‌های عظیم جهانی را برای سیاست‌های واکنشی در لحظه (Real-time) کاربردی کرده است.

گام بعدی شما

  • بررسی مقایسه‌ای بین مدل‌های VLA (Vision-Language-Action) و مدل‌های WAM برای درک تفاوت در استنتاج حرکتی.
  • دنبال کردن گزارش‌های استقرار Dyna-2 در محیط‌های صنعتی برای سنجش نرخ خطای واقعی در مقیاس تجاری.
  • مطالعه مقالات مربوط به Flow Matching در مدل‌های انتشار برای درک نحوه تبدیل ویدیو به اکشن.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های ویدئویی، هزینه و زمان آموزش ربات‌ها را به‌شدت کاهش می‌دهد. این یعنی ربات‌های صنعتی می‌توانند سریع‌تر از هر زمان دیگری برای تکالیف جدید آماده شوند و وابستگی به Teleoperation گران‌قیمت از بین برود.

تأثیر برای ایران

به‌دلیل مدل تجاری بسته و نیاز به خرید سخت‌افزار اختصاصی، دسترسی به Dyna-2 برای توسعه‌دهندگان ایرانی محدود است. با این حال، متدولوژی استفاده از ویدیو برای آموزش ربات، فرصتی برای پژوهشگران داخلی در حوزه یادگیری انتقالی است.

·نگاه ما
تحریریه دات‌هوش

جداسازی «درک جهان» از «اجرای حرکت» بزرگ‌ترین دستاورد Dyna-2 است. این رویکرد فرض قدیمی را که ربات برای یادگیری هر حرکت به هزاران نمونه از همان حرکت نیاز دارد، می‌شکند و نشان می‌دهد که داده‌های بصری انسانی می‌توانند به عنوان یک «پیش‌فرض فیزیکی» عمل کنند. در واقع، ربات دیگر از صفر یاد نمی‌گیرد که اشیاء چگونه حرکت می‌کنند، بلکه فقط یاد می‌گیرد که بدن خودش را چگونه با آن دانش بصری هماهنگ کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.