تصور کنید رباتی که هرگز آموزش ندیدهاند چطور تخممرغ بزند، تنها با تماشای هزاران ساعت ویدیو از آشپزخانههای واقعی، مهارت این کار را به دست آورد. این دیگر یک تخیل نیست، بلکه هدف نهایی مدلهای جهانی است که میخواهند فاصله بین «دیدن» و «انجام دادن» را پر کنند.
انویدیا (NVIDIA) با معرفی DreamDojo، گامی بلند برای رسیدن به این هدف برداشته است. این سیستم از یک خودرمزگذار وردشی (VAE) — شبیه به یک فشردهساز هوشمند که جزئیات اضافی تصویر را میزداید و فقط هسته اصلی حرکت را نگه میدارد — با ۷۰۰ میلیون پارامتر استفاده میکند تا رباتها بتوانند «عقل سلیم فیزیکی» را از ویدیوهای خام انسانی یاد بگیرند. طبق اعلام تیم GEAR در انویدیا، این مدل ۴۴,۷۱۱ ساعت ویدیو از زاویه دید اول شخص را پردازش میکند تا رباتها بدون نیاز به دستورات صریح، متوجه شوند در دنیای واقعی چه اتفاقی در حال رخ دادن است.
همانطور که در تحلیلهای پیشین ما دربارهی مدلهای بنیادی اشاره کردیم، بزرگترین چالش هوش مصنوعی تجسمیافته، تبدیل پیشبینی فریم بعدی ویدیو به حرکت واقعی مفاصل ربات بود. انویدیا با استفاده از «عملیات نهان پیوسته» به عنوان برچسب جایگزین، کتابخانه عظیم ویدیوهای اینترنت را به یک دفترچه راهنمای آموزشی برای ماشینها تبدیل کرده است. این رویکرد یادگیری از طریق مشاهده، تکامل یافتهی پروژه Newton است که با شبیهسازی هزاران محیط موازی، بستری برای توسعه هوش مصنوعی فیزیکی فراهم کرده بود.
به نقل از مقاله arXiv 2602.06949، معماری DreamDojo از یک خط لوله سهمرحلهای تشکیل شده است: پیشآموزش روی ویدیوهای انسانی، آموزش تکمیلی روی بدنه رباتهایی مثل Fourier GR-1 و Unitree G1، و در نهایت یک فرآیند چهارمرحلهای برای پالایش دادهها. این مدل روی یک پردازنده H100 با سرعت ۱۰.۸۱ فریم بر ثانیه اجرا میشود که امکان کنترل ربات در لحظه از طریق هدستهای VR را فراهم میکند.
تنوع دادههای این مدل خیرهکننده است:
- ۴۴,۷۱۱ ساعت ویدیو اولشخص
- ۹,۸۶۹ دستهبندی صحنه
- ۶,۰۱۵ تکلیف مجزا
- ۴۳,۲۳۷ شیء منحصربهفرد
انویدیا ادعا میکند این حجم از داده ۹۶ برابر بیشتر از مجموعههای مشابه قبلی است. آزمایشها نشان میدهد این روش تقریباً به دقت آموزشهای گرانقیمت آزمایشگاهی رسیده است (۲۰.۸۳ در برابر ۲۱.۰۲ در معیار PSNR).
در سوی دیگر، شیائومی (Xiaomi) مسیر متفاوتی را طی کرده است. آنها به جای ویدیوهای عمومی، ۱۰۰ هزار ساعت مسیر حرکت واقعی را با استفاده از گیرههای دستی UMI در محیطهایی مثل سوپرمارکتها و دفاتر اداری جمعآوری کردند. برای برچسبگذاری این حجم عظیم، آنها از مدل Qwen3.5-27B استفاده کردند تا توصیفات تغییرات صحنه را بهصورت خودکار تولید کند؛ فرآیندی که تنها در دو هفته تکمیل شد.
مدل شیائومی از معماری MoT استفاده میکند که Qwen3-VL را با یک ترنسفورمر انتشار (Diffusion Transformer) — شبیه به هنرمندی که ابتدا یک صفحه پر از نویز میبیند و کمکم آن را به یک تصویر دقیق تبدیل میکند — ترکیب میکند. گزارشها حاکی از آن است که با افزایش حجم داده و پارامترها، عملکرد ربات در محیطهای ناشناخته بهطور چشمگیری بهبود مییابد.
فراتر از جابهجایی اشیا، تیم Qwen با پروژه Qwen-AgentWorld در حال مدلسازی پاسخ محیط به اقدامات عاملها است. این مدل که در دو اندازه ۳۵ میلیارد و ۳۹۷ میلیارد پارامتری عرضه شده، محیطهای گرافیکی (GUI) را به جای پیکسل، از طریق درختهای دسترسی به متن تبدیل میکند تا به عنوان یک شبیهساز مقیاسپذیر برای یادگیری تقویتی عمل کند.
همزمان، پژوهشگران دانشگاه RWTH Aachen و دانشگاه Delft در مقالهای ارسالی به IEEE T-ITS هشدار دادهاند که هدف مدلهای جهانی نباید صرفاً تولید فریمهای واقعگرایانه باشد، بلکه باید بر «قابلیت اعتماد به تصمیم» تمرکز کنند. آنها معیارهایی مثل «شکاف ایمنی حلقه-بسته» و «هزینه استدلال محتاطانه» را پیشنهاد دادهاند تا مدلهایی که فقط آبوهوا یا نور را تغییر میدهند (بدون یادگیری تکامل زمانی)، از مدلهای جهانی واقعی تفکیک شوند. برای استانداردسازی، جدول ردهبندی WorldScore اکنون ۳۴ مدل مختلف را در سه محور کنترلپذیری، کیفیت و دینامیک میسنجد.
در حالی که نرمافزارها مقیاسپذیر میشوند، ساختار صنعتی رباتیک در اروپا تغییر میکند. شرکت Humanoid (یا SKL Robotics در بریتانیا) با جذب ۱۵۲ میلیون دلار سرمایه در راند Series A، به ارزش ۱.۳۵ میلیارد دلار رسید. برخلاف مدل آمریکایی که بر پایه سرمایهگذاران خطرپذیر است، Humanoid مستقیماً با زنجیره تأمین ادغام شده است؛ بهطوری که Bosch تولیدات سختافزاری را بر عهده دارد و Schaeffler هزاران واحد را در کارخانههای خود مستقر میکند.
پلتفرم HMND-01 Alpha برای فرار از تله «فقط دوپا»، هر دو نسخه چرخدار و دوپا را ارائه میدهد. این شرکت از ۳۴,۰۰۰ پیشسفارش خبر داده است که درآمد سالانه ۲.۴ میلیارد دلاری را پیشبینی میکند، هرچند این اعداد هنوز در حد اظهارات مدیریتی است.
در لایه زیرساختی، دیزنی از طریق شتابدهنده خود از شرکتهای Physical Intelligence (PI) و FieldAI حمایت میکند. در حالی که PI بر روی «چه کاری باید انجام شود» تمرکز دارد، FieldAI با استفاده از مدلهای بنیادی میدانی (FFM)، تصمیمات قابلاعتماد در محیطهای بدون نقشه و GPS را ممکن میکند. این شرکت در اوت ۲۰۲۵ با ۴۰۵ میلیون دلار سرمایه از جمله از طرف اینتل و سامسونگ تأسیس شد تا شکاف بین موتور فیزیک Newton و رباتهای پارکهای دیزنی مثل Olaf را پر کند.
در آسیا، هیوندای (Hyundai) با ادغام مرکز AVP و شرکت 42dot، استراتژی خود را به سمت تبدیل شدن به یک «شرکت راهکارهای هوش مصنوعی فیزیکی» تغییر داده است. این گروه که مالک Boston Dynamics است، نقشه راه کامل خود را در ۲۶ اوت ۲۰۲۰۶ در سئول معرفی خواهد کرد.
هزینههای سختافزاری نیز در نقطه شکست قرار دارند. تخمین زده میشود هزینه مواد اولیه (BOM) برای یک ربات انساننما از ۱۳۰ هزار دلار در سال ۲۰۲۳ به ۳۰ تا ۴۶ هزار دلار در جولای ۲۰۲۶ کاهش یافته است. در چین، نرخ بومیسازی قطعات کلیدی بین ۷۵ تا ۸۵ درصد گزارش شده است.
روندهای کلیدی قطعات:
- پیچهای غلتان سیارهای: گرانترین بخش (۲۲٪ هزینه) که بومیسازی آن در چین قیمت را از ۱۰ هزار یوان به ۲ هزار یوان میرساند.
- کاهندههای هارمونیک: شرکت LEADERDRIVE قراردادی برای تأمین ۱۱۰ هزار واحد برای Unitree بسته است و هدف نهایی کاهش قیمت به ۴۰۰-۵۰۰ یوان است.
- موتورهای بدون هسته: شرکت Zhongshen Dynamics سفارشات ۱ میلیون واحدی برای نیمه اول ۲۰۲۶ دارد.
- دستهای ماهر: دست UDH-3-7 شرکت Dahuan با توان بلند کردن ۱۵ کیلوگرم روی رباتهای Geek+ نصب شده است.
تجاریسازی در اشکال مختلف در حال ظهور است. شرکت Stardust Intelligence مدل Lumo-2 را برای محیطهای خانگی معرفی کرد که ادعا میکند استنتاج آن ۲.۷۱ برابر سریعتر است و کارهایی مثل سرخ کردن تخممرغ و بستن بند کفش را انجام میدهد. همچنین DeepRobotics AI با مدل PhysBrain توانست در آزمون WidowX به نرخ موفقیت ۸۰.۲٪ برسد. این تلاشها برای یکپارچگی عملیاتی، یادآور مدل LingBot-VLA 2.0 است که توانست با یک مغز واحد، ۲۰ بدنه رباتیک مختلف را کنترل کند.
همکاریهای صنعتی دیگر شامل:
- انویدیا و Kawasaki: ساخت کشتیسازی دیجیتال برای جوشکاری و رنگآمیزی.
- Magic Atom: احداث خط تولید برای ۹,۰۰۰ ربات چهارپای کوچک در سال.
- Shiyue Technology: قرارداد با زیرمجموعه CRRC برای تجهیزات تولید پیشرفته.
- SK Telecom: همکاری با ۸ استارتاپ برای تولید دادههای آموزشی مدلهای بنیادی در لجستیک.
با این حال، استقرار با اصطکاکهای قانونی روبروست. در چین، وزارت صنعت و فناوری نصب «چراغهای راهنمای آبی» در خودروهای خودران را ممنوع کرد زیرا با استانداردهای GB 4785-2019 سازگار نیست و باعث خیرگی شبانه میشود. در آمریکا، شهردار سانفرانسیسکو از Waymo خواسته است تا پیش از گسترش، چهار آزمون اضطراری از جمله مدیریت خودروهای خراب شده را پاس کند.
در عین حال، پروژه رباتهای DoorDash در فینیکس نشان داد که مشکل «متر آخر» همچنان پابرجاست؛ شرکت همچنان به انسانها ۵ دلار پرداخت میکند تا بستهها را در پارکینگ داخل رباتها بگذارند. در سئول، سرویس تاکسی رباتیک Kakao Mobility در منطقه گانگنام پس از پولی شدن در ماه آوریل، به بیش از ۱,۰۰۰ سفر رسید، هرچند میانگین سفر هر خودرو تنها ۶ مورد در روز است.
در نهایت، Unitree مدل چرخدار AS2-W را معرفی کرد که توان عبور از موانع ۸۰ سانتیمتری را دارد. نسخه مسلح این پلتفرم در رزمایش نظامی «Steppe Partner 2026» بین چین و مغولستان برای شناسایی و پشتیبانی آتش دیده شد.
این چرخش به سمت مدلهای «جهان-عمل» نشان میدهد که عصر بعدی هوش مصنوعی، نه درباره چت کردن، بلکه درباره ترجمه بینقص ادراک بصری به گشتاور فیزیکی است. برندههای این میدان کسانی خواهند بود که بتوانند مجموعهدادههای عظیم ویدیو را با زنجیره تأمین سختافزاری ارزان و بومی ترکیب کنند.
گام بعدی شما
- اگر توسعهدهنده رباتیک هستید، مستندات مدلهای WorldScore را برای ارزیابی مدلهای جهانی خود بررسی کنید.
- برای تحلیل هزینههای سختافزاری، روند قیمت کاهشیافته قطعات مانند کاهندههای هارمونیک را دنبال کنید.
- مدلهای بازمتن Qwen-AgentWorld را برای شبیهسازی محیطهای GUI در عاملهای خود امتحان کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو