پرش به محتوای اصلی
پرش به محتوای مقاله

مدل DreamDojo انویدیا با ۴۴ هزار ساعت ویدیو، حس مشترک فیزیکی را به ربات‌ها آموخت

·۱۱ مرداد ۱۴۰۵۱۹ دقیقه مطالعه۳ بازدید
شماره ۷۷ خبرنامه FutureX · Physical AI Daily — ۰۳ اوت
شماره ۷۷ خبرنامه FutureX · Physical AI Daily — ۰۳ اوت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از «عملیات نهان» برای تبدیل ویدیوهای انسانی به دستورات رباتیک، بدون نیاز به برچسب‌گذاری دستی؛ این یعنی تبدیل کل اینترنت به یک محیط آموزشی برای سخت‌افزارها.

تصور کنید رباتی که هرگز آموزش ندیده‌اند چطور تخم‌مرغ بزند، تنها با تماشای هزاران ساعت ویدیو از آشپزخانه‌های واقعی، مهارت این کار را به دست آورد. این دیگر یک تخیل نیست، بلکه هدف نهایی مدل‌های جهانی است که می‌خواهند فاصله بین «دیدن» و «انجام دادن» را پر کنند.

انویدیا (NVIDIA) با معرفی DreamDojo، گامی بلند برای رسیدن به این هدف برداشته است. این سیستم از یک خودرمزگذار وردشی (VAE) — شبیه به یک فشرده‌ساز هوشمند که جزئیات اضافی تصویر را می‌زداید و فقط هسته اصلی حرکت را نگه می‌دارد — با ۷۰۰ میلیون پارامتر استفاده می‌کند تا ربات‌ها بتوانند «عقل سلیم فیزیکی» را از ویدیوهای خام انسانی یاد بگیرند. طبق اعلام تیم GEAR در انویدیا، این مدل ۴۴,۷۱۱ ساعت ویدیو از زاویه دید اول شخص را پردازش می‌کند تا ربات‌ها بدون نیاز به دستورات صریح، متوجه شوند در دنیای واقعی چه اتفاقی در حال رخ دادن است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بنیادی اشاره کردیم، بزرگ‌ترین چالش هوش مصنوعی تجسم‌یافته، تبدیل پیش‌بینی فریم بعدی ویدیو به حرکت واقعی مفاصل ربات بود. انویدیا با استفاده از «عملیات نهان پیوسته» به عنوان برچسب جایگزین، کتابخانه عظیم ویدیوهای اینترنت را به یک دفترچه راهنمای آموزشی برای ماشین‌ها تبدیل کرده است. این رویکرد یادگیری از طریق مشاهده، تکامل یافته‌ی پروژه Newton است که با شبیه‌سازی هزاران محیط موازی، بستری برای توسعه هوش مصنوعی فیزیکی فراهم کرده بود.

به نقل از مقاله arXiv 2602.06949، معماری DreamDojo از یک خط لوله سه‌مرحله‌ای تشکیل شده است: پیش‌آموزش روی ویدیوهای انسانی، آموزش تکمیلی روی بدنه ربات‌هایی مثل Fourier GR-1 و Unitree G1، و در نهایت یک فرآیند چهارمرحله‌ای برای پالایش داده‌ها. این مدل روی یک پردازنده H100 با سرعت ۱۰.۸۱ فریم بر ثانیه اجرا می‌شود که امکان کنترل ربات در لحظه از طریق هدست‌های VR را فراهم می‌کند.

تنوع داده‌های این مدل خیره‌کننده است:

  • ۴۴,۷۱۱ ساعت ویدیو اول‌شخص
  • ۹,۸۶۹ دسته‌بندی صحنه
  • ۶,۰۱۵ تکلیف مجزا
  • ۴۳,۲۳۷ شیء منحصر‌به‌فرد

انویدیا ادعا می‌کند این حجم از داده ۹۶ برابر بیشتر از مجموعه‌های مشابه قبلی است. آزمایش‌ها نشان می‌دهد این روش تقریباً به دقت آموزش‌های گران‌قیمت آزمایشگاهی رسیده است (۲۰.۸۳ در برابر ۲۱.۰۲ در معیار PSNR).

در سوی دیگر، شیائومی (Xiaomi) مسیر متفاوتی را طی کرده است. آن‌ها به جای ویدیوهای عمومی، ۱۰۰ هزار ساعت مسیر حرکت واقعی را با استفاده از گیره‌های دستی UMI در محیط‌هایی مثل سوپرمارکت‌ها و دفاتر اداری جمع‌آوری کردند. برای برچسب‌گذاری این حجم عظیم، آن‌ها از مدل Qwen3.5-27B استفاده کردند تا توصیفات تغییرات صحنه را به‌صورت خودکار تولید کند؛ فرآیندی که تنها در دو هفته تکمیل شد.

مدل شیائومی از معماری MoT استفاده می‌کند که Qwen3-VL را با یک ترنسفورمر انتشار (Diffusion Transformer) — شبیه به هنرمندی که ابتدا یک صفحه پر از نویز می‌بیند و کم‌کم آن را به یک تصویر دقیق تبدیل می‌کند — ترکیب می‌کند. گزارش‌ها حاکی از آن است که با افزایش حجم داده و پارامترها، عملکرد ربات در محیط‌های ناشناخته به‌طور چشم‌گیری بهبود می‌یابد.

فراتر از جابه‌جایی اشیا، تیم Qwen با پروژه Qwen-AgentWorld در حال مدل‌سازی پاسخ محیط به اقدامات عامل‌ها است. این مدل که در دو اندازه ۳۵ میلیارد و ۳۹۷ میلیارد پارامتری عرضه شده، محیط‌های گرافیکی (GUI) را به جای پیکسل، از طریق درخت‌های دسترسی به متن تبدیل می‌کند تا به عنوان یک شبیه‌ساز مقیاس‌پذیر برای یادگیری تقویتی عمل کند.

هم‌زمان، پژوهشگران دانشگاه RWTH Aachen و دانشگاه Delft در مقاله‌ای ارسالی به IEEE T-ITS هشدار داده‌اند که هدف مدل‌های جهانی نباید صرفاً تولید فریم‌های واقع‌گرایانه باشد، بلکه باید بر «قابلیت اعتماد به تصمیم» تمرکز کنند. آن‌ها معیارهایی مثل «شکاف ایمنی حلقه-بسته» و «هزینه استدلال محتاطانه» را پیشنهاد داده‌اند تا مدل‌هایی که فقط آب‌وهوا یا نور را تغییر می‌دهند (بدون یادگیری تکامل زمانی)، از مدل‌های جهانی واقعی تفکیک شوند. برای استانداردسازی، جدول رده‌بندی WorldScore اکنون ۳۴ مدل مختلف را در سه محور کنترل‌پذیری، کیفیت و دینامیک می‌سنجد.

در حالی که نرم‌افزارها مقیاس‌پذیر می‌شوند، ساختار صنعتی رباتیک در اروپا تغییر می‌کند. شرکت Humanoid (یا SKL Robotics در بریتانیا) با جذب ۱۵۲ میلیون دلار سرمایه در راند Series A، به ارزش ۱.۳۵ میلیارد دلار رسید. برخلاف مدل آمریکایی که بر پایه سرمایه‌گذاران خطرپذیر است، Humanoid مستقیماً با زنجیره تأمین ادغام شده است؛ به‌طوری که Bosch تولیدات سخت‌افزاری را بر عهده دارد و Schaeffler هزاران واحد را در کارخانه‌های خود مستقر می‌کند.

پلتفرم HMND-01 Alpha برای فرار از تله «فقط دوپا»، هر دو نسخه چرخ‌دار و دوپا را ارائه می‌دهد. این شرکت از ۳۴,۰۰۰ پیش‌سفارش خبر داده است که درآمد سالانه ۲.۴ میلیارد دلاری را پیش‌بینی می‌کند، هرچند این اعداد هنوز در حد اظهارات مدیریتی است.

در لایه زیرساختی، دیزنی از طریق شتاب‌دهنده خود از شرکت‌های Physical Intelligence (PI) و FieldAI حمایت می‌کند. در حالی که PI بر روی «چه کاری باید انجام شود» تمرکز دارد، FieldAI با استفاده از مدل‌های بنیادی میدانی (FFM)، تصمیمات قابل‌اعتماد در محیط‌های بدون نقشه و GPS را ممکن می‌کند. این شرکت در اوت ۲۰۲۵ با ۴۰۵ میلیون دلار سرمایه از جمله از طرف اینتل و سامسونگ تأسیس شد تا شکاف بین موتور فیزیک Newton و ربات‌های پارک‌های دیزنی مثل Olaf را پر کند.

در آسیا، هیوندای (Hyundai) با ادغام مرکز AVP و شرکت 42dot، استراتژی خود را به سمت تبدیل شدن به یک «شرکت راهکارهای هوش مصنوعی فیزیکی» تغییر داده است. این گروه که مالک Boston Dynamics است، نقشه راه کامل خود را در ۲۶ اوت ۲۰۲۰۶ در سئول معرفی خواهد کرد.

هزینه‌های سخت‌افزاری نیز در نقطه شکست قرار دارند. تخمین زده می‌شود هزینه مواد اولیه (BOM) برای یک ربات انسان‌نما از ۱۳۰ هزار دلار در سال ۲۰۲۳ به ۳۰ تا ۴۶ هزار دلار در جولای ۲۰۲۶ کاهش یافته است. در چین، نرخ بومی‌سازی قطعات کلیدی بین ۷۵ تا ۸۵ درصد گزارش شده است.

روندهای کلیدی قطعات:

  • پیچ‌های غلتان سیاره‌ای: گران‌ترین بخش (۲۲٪ هزینه) که بومی‌سازی آن در چین قیمت را از ۱۰ هزار یوان به ۲ هزار یوان می‌رساند.
  • کاهنده‌های هارمونیک: شرکت LEADERDRIVE قراردادی برای تأمین ۱۱۰ هزار واحد برای Unitree بسته است و هدف نهایی کاهش قیمت به ۴۰۰-۵۰۰ یوان است.
  • موتورهای بدون هسته: شرکت Zhongshen Dynamics سفارشات ۱ میلیون واحدی برای نیمه اول ۲۰۲۶ دارد.
  • دست‌های ماهر: دست UDH-3-7 شرکت Dahuan با توان بلند کردن ۱۵ کیلوگرم روی ربات‌های Geek+ نصب شده است.

تجاری‌سازی در اشکال مختلف در حال ظهور است. شرکت Stardust Intelligence مدل Lumo-2 را برای محیط‌های خانگی معرفی کرد که ادعا می‌کند استنتاج آن ۲.۷۱ برابر سریع‌تر است و کارهایی مثل سرخ کردن تخم‌مرغ و بستن بند کفش را انجام می‌دهد. همچنین DeepRobotics AI با مدل PhysBrain توانست در آزمون WidowX به نرخ موفقیت ۸۰.۲٪ برسد. این تلاش‌ها برای یکپارچگی عملیاتی، یادآور مدل LingBot-VLA 2.0 است که توانست با یک مغز واحد، ۲۰ بدنه رباتیک مختلف را کنترل کند.

همکاری‌های صنعتی دیگر شامل:

  • انویدیا و Kawasaki: ساخت کشتی‌سازی دیجیتال برای جوشکاری و رنگ‌آمیزی.
  • Magic Atom: احداث خط تولید برای ۹,۰۰۰ ربات چهارپای کوچک در سال.
  • Shiyue Technology: قرارداد با زیرمجموعه CRRC برای تجهیزات تولید پیشرفته.
  • SK Telecom: همکاری با ۸ استارتاپ برای تولید داده‌های آموزشی مدل‌های بنیادی در لجستیک.

با این حال، استقرار با اصطکاک‌های قانونی روبروست. در چین، وزارت صنعت و فناوری نصب «چراغ‌های راهنمای آبی» در خودروهای خودران را ممنوع کرد زیرا با استانداردهای GB 4785-2019 سازگار نیست و باعث خیرگی شبانه می‌شود. در آمریکا، شهردار سان‌فرانسیسکو از Waymo خواسته است تا پیش از گسترش، چهار آزمون اضطراری از جمله مدیریت خودروهای خراب شده را پاس کند.

در عین حال، پروژه ربات‌های DoorDash در فینیکس نشان داد که مشکل «متر آخر» همچنان پابرجاست؛ شرکت همچنان به انسان‌ها ۵ دلار پرداخت می‌کند تا بسته‌ها را در پارکینگ داخل ربات‌ها بگذارند. در سئول، سرویس تاکسی رباتیک Kakao Mobility در منطقه گانگنام پس از پولی شدن در ماه آوریل، به بیش از ۱,۰۰۰ سفر رسید، هرچند میانگین سفر هر خودرو تنها ۶ مورد در روز است.

در نهایت، Unitree مدل چرخ‌دار AS2-W را معرفی کرد که توان عبور از موانع ۸۰ سانتی‌متری را دارد. نسخه مسلح این پلتفرم در رزمایش نظامی «Steppe Partner 2026» بین چین و مغولستان برای شناسایی و پشتیبانی آتش دیده شد.

این چرخش به سمت مدل‌های «جهان-عمل» نشان می‌دهد که عصر بعدی هوش مصنوعی، نه درباره چت کردن، بلکه درباره ترجمه بی‌نقص ادراک بصری به گشتاور فیزیکی است. برنده‌های این میدان کسانی خواهند بود که بتوانند مجموعه‌داده‌های عظیم ویدیو را با زنجیره تأمین سخت‌افزاری ارزان و بومی ترکیب کنند.

گام بعدی شما

  • اگر توسعه‌دهنده رباتیک هستید، مستندات مدل‌های WorldScore را برای ارزیابی مدل‌های جهانی خود بررسی کنید.
  • برای تحلیل هزینه‌های سخت‌افزاری، روند قیمت کاهش‌یافته قطعات مانند کاهنده‌های هارمونیک را دنبال کنید.
  • مدل‌های بازمتن Qwen-AgentWorld را برای شبیه‌سازی محیط‌های GUI در عامل‌های خود امتحان کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار داده‌های عظیم ویدیو، هزینه آموزش ربات‌ها را به شدت کاهش می‌دهد. نتیجه آن، خروج ربات‌های انسان‌نما از محیط‌های کنترل‌شده آزمایشگاهی و ورود آن‌ها به کف کارخانه‌ها و خانه‌هاست.

تأثیر برای ایران

این پیشرفت‌ها بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک اهمیت دارد؛ اما دسترسی به سخت‌افزارهای مورد نیاز (مانند H100) برای تیم‌های ایرانی همچنان با محدودیت‌های شدید تحریمی همراه است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «تولید تصویر واقع‌گرایانه» به «پیش‌بینی اثر عمل» تغییر کرده است. انویدیا با حذف نیاز به برچسب‌های دستی، در واقع «داده‌های بدون نظارت» را به سوخت اصلی رباتیک تبدیل کرد. این یعنی ربات‌ها دیگر نیازی ندارند هر حرکت را یک بار توسط انسان یاد بگیرند، بلکه می‌توانند از تماشای جهان، قوانین فیزیک را استخراج کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.