پرش به محتوای اصلی
پرش به محتوای مقاله

ویدیوهای انسانی در برابر آموزش دستی در یادگیری ربات‌ها

·۱۹ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
ربات‌های داینا با یک میلیون ساعت ویدیوی انسانی، ربات داینا-۲ را بدون داده رباتی آموزش دادند
ربات‌های داینا با یک میلیون ساعت ویدیوی انسانی، ربات داینا-۲ را بدون داده رباتی آموزش دادند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن یادگیری فیزیک جهان از یادگیری کنترل سخت‌افزار؛ به گونه‌ای که ربات با تماشای ویدیوهای انسانی، شهود فیزیکی کسب می‌کند و برای مهارت‌های خاص تنها به چند دقیقه داده محلی نیاز دارد.

تصور کنید رباتی که برای باز کردن درِ یک بطری تنها به ۱۳ دقیقه آموزش نیاز دارد، چون پیش از آن میلیون‌ها ساعت رفتار انسان‌ها را تماشا کرده است. Dyna Robotics مدعی است مدل جدیدش یعنی DYNA-2 بزرگ‌ترین گلوگاه صنعت رباتیک — یعنی فرآیند کند و هزینه‌بر هدایت دستی ربات‌ها توسط انسان (Teleoperation) — را دور زده است.

این تحول در حالی رخ می‌دهد که صنعت برای مقیاس‌بندی سیاست‌های رباتیک عمومی در تکاپو است. همان‌طور که در تحلیل قبلی ما درباره‌ی مدل DreamDojo انویدیا اشاره کردیم، تلاش‌ها برای ساخت مدل‌های جهان (World Models) در جریان بود، اما DYNA-2 این رویکرد را ۱۰ برابر گسترش داده است. این رویکرد یادگیری از مشاهده، یادآور تلاش‌های گوگل برای ادغام بینایی و اکشن در ربات‌های پیچیده است که گامی بلند به سوی AGI فیزیکی محسوب می‌شد. این مدل با هوش مصنوعی زاینده (Generative AI) — شبیه به هنرمندی که با دیدن هزاران تابلو، یاد می‌گیرد خودش هم نقاشی بکشد — شهود فیزیکی را از مشاهده انسان به سخت‌افزار ربات منتقل می‌کند.

به گزارش unite.ai، معماری DYNA-2 یک «مدل جهان-اکشن» (World-Action Model) مبتنی بر تولید ویدیو است. برخلاف مدل‌های سنتی VLA، این سیستم در مرحله پیش‌آموزش (Pre-training) — یعنی همان مرحله‌ای که مدل مثل یک کودک دنیا را می‌شناسد — هم‌زمان فریم بعدی ویدیو و اقدام بعدی ربات را پیش‌بینی می‌کند. این استراتژی یادگیری از داده‌های بصری، مشابه رویکرد مدل Pantograph در یادگیری از ویدیوهای اینترنتی است که نشان داد تماشای محتوا می‌تواند جایگزین برچسب‌گذاری دستی داده‌ها شود.

اعداد و ارقام عملکرد

  • مقیاس پیش‌آموزش: بیش از ۱ میلیون ساعت ویدیو از زاویه دید انسان (تقریباً ۱۷۰ سال تجربه بیداری).
  • نرخ موفقیت: موفقیت در کارهای تولیدی با دقت بالا، تنها با تکیه بر مقیاس پیش‌آموزش از ۲۰٪ به ۸۰ تا ۹۰٪ رسید.
  • کارایی: تنها ۱۳ دقیقه داده برای آموزش دست‌های پنج‌انگشتی جهت باز کردن درِ بطری کافی بود.
  • پیروی از دستورات: الگوریتم آموزش مشترک ویدیو، امتیازات مربوط به حرکات متمایز را ۱۳۳٪ افزایش داد.

در ارزیابی‌های رودررو، DYNA-2 تعداد تکالیفی را که در مقایسه با مدل تجاری DYNA-1 انجام داد، ۱.۵۵ برابر افزایش داد. طبق اعلام این شرکت، در استقرار واقعی، نرخ موفقیت DYNA-2 به ۸۷٪ رسید، در حالی که این عدد برای نسل اول تنها ۴۶٪ بود. نکته حیاتی این است که DYNA-2 هنگام خرد کردن مواد غذایی یا پاک‌سازی محیط، در صورت بروز اختلال فیزیکی، بدون نیاز به بازنشانی دستی خود را بازیابی کرد؛ جایی که مدل‌های پایه VLA شکست خوردند.

این قابلیت‌ها بر یک زیربنای تجاری محکم استوار است. ربات‌های Dyna در حال حاضر در هتل‌ها، رستوران‌ها و باشگاه‌های ورزشی فعال‌اند. مدل DYNA-1 در حال حاضر می‌تواند بیش از ۴۰ پیراهن را در ساعت با نرخ موفقیت بالای ۹۹٪ تا ۲۴ ساعت متوالی تا کند. این حضور در بازار، یک چرخه داده ایجاد کرده که تحقیقات آن‌ها را تغذیه می‌کند.

برای کسب‌وکارهای اتوماسیون، این یعنی هزینه استقرار ربات‌ها در محیط‌های جدید به‌شدت کاهش می‌یابد. اگر این منحنی رشد ادامه یابد، مانع ورود به این صنعت دیگر تعداد تجهیزات هدایت دستی نیست، بلکه میزان ویدیوهای انسانی است که یک شرکت می‌تواند جمع‌آوری کند.

شرکت Dyna با جداسازی «یادگیری نحوه کارکرد جهان» از «یادگیری نحوه حرکت یک بازوی خاص»، روی این شرط‌بندی کرده است که هوش رباتیک نیز از همان قوانین مقیاس‌پذیری (Scaling Laws) — یعنی همان قانونی که می‌گوید هرچه داده و محاسبات بیشتر شود، مدل باهوش‌تر می‌شود — پیروی می‌کند. هدف آن‌ها افزایش داده‌های آموزشی از ۱ میلیون به ۱۰ میلیون ساعت است. در این مسیر، استفاده از محیط‌های شبیه‌سازی شده برای تسریع یادگیری، مشابه پروژه Newton انویدیا است که هزاران محیط موازی را برای آموزش هوش مصنوعی فیزیکی فراهم می‌کند.

اکنون پرسش مهندسی اصلی این است که آیا این افزایش ۱۰ برابری داده، بازدهی خطی دارد یا نمایی. اگر چنین باشد، آموزش دستی ربات‌ها به یک محدودیت قدیمی و منسوخ تبدیل خواهد شد.

گام بعدی شما

  • بررسی قابلیت‌های مدل‌های World-Action در مقابل VLA برای کاهش هزینه‌های استقرار.
  • تحلیل میزان دسترسی به مجموعه‌داده‌های ویدیوهای انسانی (Egocentric) برای آموزش مدل‌های محلی.
  • رصد نتایج احتمالی بازتولید این مدل توسط پروژه‌های متن‌باز.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های انسانی، هزینه ورود به بازار اتوماسیون را به‌شدت کاهش می‌دهد. انتقال یادگیری از محیط‌های شبیه‌سازی شده به مشاهده واقعی، سرعت استقرار ربات‌ها در صنایع خدماتی را چندین برابر می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک اهمیت دارد تا بازار مصرف ایران؛ چرا که دسترسی به سخت‌افزارهای Dyna Robotics در حال حاضر برای کاربران ایرانی مقدور نیست.

·نگاه ما
تحریریه دات‌هوش

جایگزینی داده‌های گران‌قیمت رباتیک با ویدیوهای انسانی، پارادایم آموزش را از «تولید داده» به «استخراج داده» تغییر می‌دهد. این رویکرد نشان می‌دهد که شهود فیزیکی (Physical Intuition) را می‌توان به عنوان یک لایه مشترک بین گونه‌ها مدل کرد و سپس آن را روی سخت‌افزارهای مختلف تنظیم کرد. در واقع، ربات‌ها در حال یادگیری «مفهوم حرکت» هستند، نه فقط «ترتیب دستورات».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.