۴ میلیارد پارامتر؛ تمام چیزی است که یک ربات برای استدلال و اقدام در لحظه، بدون وابستگی به ابر، نیاز دارد. در ۲۰ ژوئیه ۲۰۲۶، انویدیا (NVIDIA) مدل Cosmos 3 Edge را معرفی کرد؛ مدلی باز که بهطور خاص برای سیستمهایی با حافظه محدود در کارخانهها، بیمارستانها و انبارها طراحی شده است.
هوش مصنوعی فیزیکی به چیزی فراتر از تشخیص اشیا نیاز دارد؛ این حوزه نیازمند یک مدل جهانی (World Model) است — شبیه به نقشهای ذهنی که نه تنها مکانها، بلکه نحوه تغییر محیط در طول زمان را هم میشناسد — تا بفهمد محیط چگونه تغییر میکند. برای اینکه رباتی بتواند جسمی را بردارد، باید حرکت گیره و تماس فیزیکی حاصل از آن را شبیهسازی کند. در حالی که مدلهای بینایی-زبانی (VLM) بر توصیف تمرکز دارند، مدلهای جهانی بر پیشبینی و اقدام متمرکز هستند.
درک مدلسازی جهانی
یک مدل جهانی یاد میگیرد اشیا، حرکت و روابط فضایی را نمایش دهد. این قابلیت به ماشین اجازه میدهد پیشبینی کند چه اتفاقی خواهد افتاد و هر اقدام خاص، چه تأثیری بر دنیای فیزیکی میگذارد.
فرآیند رسیدن ربات به یک شیء را در نظر بگیرید. تشخیص شیء تنها گام اول است. ربات باید مکان دقیق شیء را درک کند، نحوه حرکت گیره خود را رصد کند و پیشبینی کند وقتی تماس برقرار میشود چه اتفاقی میافتد. یک مدل جهانی سیستم را قادر میسازد تا اقدامی را که باعث یک تغییر خاص شده است استنتاج کند یا اقدامی را تولید کند که به احتمال زیاد منجر به تکمیل موفقیتآمیز وظیفه میشود.
به نقل از مستندات رسمی در Hugging Face، مدل Cosmos 3 Edge بهعنوان یک مدل اقدام جهانی (WAM) پسآموزشدیده عمل میکند. این مدل مشاهدات را با رزولوشن ۶۴۰×۳۶۰ پردازش کرده و روی سختافزار Jetson Thor میتواند ۳۲ اقدام را در هر بار استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی به جای دورهی آموزش آن — ایجاد کند. این سازوکار کنترل در لحظه با نرخ ۱۵ هرتز را ممکن میکند و شکاف بین استدلال سطح بالا و اجرای مکانیکی سطح پایین را میپرد.
معماری برج دوقلو
این مدل از یک نمایش مشترک در دو برج ترنسفورمر متمایز استفاده میکند:
- برج خودبازگشتی (Autoregressive Tower): توکنهای بینایی و متن را برای درک و استدلال سطح بالا پردازش میکند.
- برج انتشار (Diffusion Tower): توکنهای بینایی، صوتی و اقدامی را برای پیشبینی، تولید و شبیهسازی عصبی پردازش میکند.
این دو برج لایههای نرمالسازی و پرسپترونهای چندلایه (MLP) مجزایی دارند. با این حال، آنها لایههای توجه (Attention) چندوجهی مشترکی دارند که اطلاعات را در زبان، ویدیو، صوت و اقدام همراستا میکند. این معماری به مدل اجازه میدهد پیش از تولید خروجی، درباره صحنه استدلال کند.
بسته به وظیفه خاص، Cosmos 3 خروجیهای متفاوتی تولید میکند. این مدل میتواند توکنهای استدلالی را از برج خودبازگشتی یا توکنهای ویدئویی و اقدامی بدون نویز (Denoised) را از برج انتشار تولید کند. الگوهای توجه نیز سازگار شدهاند: زبان از «توجه علی» (Causal Attention) استفاده میکند که در آن هر توکن به توکنهای قبلی توجه دارد، در حالی که توکنهای انتشار بهطور گستردهتر به بافت available توجه میکنند تا از پیشبینی منسجم پشتیبانی شود.

نمایش مشترک اقدامات
یکی از بزرگترین چالشهای رباتیک این است که ماشینهای مختلف «زبانهای حرکتی» متفاوتی دارند. بر اساس گزارشهای فنی، هر سختافزار اقدامات را متفاوت توصیف میکند:
- وسایل نقلیه: اقدام را از طریق موقعیت خود (Ego Pose) و حرکت نمایش میدهند.
- دوربینها: از حرکت دوربین استفاده میکنند.
- بازوهای رباتیک: موقعیت مجری نهایی (End Effector) را ملاک قرار میدهند.
- گیرهها: باید وضعیت چنگزدن (Grasp State) را نمایش دهند.
Cosmos 3 این مشکل را با نگاشت تمام این سختافزارها به یک نمایش مشترک از اقدامات حل میکند. اقدامات بهصورت بردارهای هندسی فشرده کدگذاری میشوند که انتقال، چرخش و وضعیت دستکاری را ثبت میکنند.
این نگاشت، پیکسلها را مستقیماً به حرکت فیزیکی متصل میکند. وقتی مدل ویدیویی از یک نتیجه پیشبینیشده تولید میکند، این ویدیو صرفاً یک حدس بصری نیست، بلکه نمایش مستندی از تغییر جهان در پاسخ به یک ورودی کنترلی است. این امر به توسعهدهندگان دادههای آموزشی فراهم میکند که بر پایه حرکت، کنترل و رابطه علت و معلولی استوار است.

حالت سیاستگذاری و یادگیری
در «حالت سیاست» (Policy Mode)، مدل یک اقدام را همراه با نتیجه بصری مورد انتظارش پیشبینی میکند. این یک حلقه ایجاد میکند که در آن وضعیت فعلی ورودی است و اقدام و نتیجه بصری، خروجیها هستند. چون جریان اقدام میتواند در هر دو جهت از مدل عبور کند، Cosmos 3 Edge میتواند یا اثرات یک اقدام را پیشبینی کند یا اقدامی را از روی اثرات مشاهدهشده استنتاج نماید.
برای تسریع پذیرش، انویدیا نسخه Cosmos 3 Edge Policy (DROID) را عرضه کرد؛ یک سیاست دستکاری رباتیک که روی مجموعه داده DROID بهطور خاص برای وظایف برداشتن و گذاشتن (Pick-and-place) تنظیم شده است. این عرضه شامل اسکریپتهای پسآموزش همراه است تا به توسعهدهندگان در تطبیق مدل کمک کند.

استقرار و عملکرد
توسعهدهندگان میتوانند این مدلها را با خوشهای کوچک از H100ها یا یک ایستگاه NVIDIA DGX از طریق تنظیم دقیق (Fine-tuning) — شبیه به وقتی به یک پزشک عمومی، تخصص پوست میدهیم تا در یک حوزه دقیق شود — بهینه کنند. برای افزایش کارایی، شرکت نسخه Cosmos 3 Super 4-Step Distillation را ارائه داده است.
این نسخه یک مدل تقطیرشده با تطبیق توزیع برای مدل 64B است که تعداد مراحل حذف نویز در مدل انتشار را از ۳۵ تا ۵۰ مرحله به تنها ۴ مرحله کاهش داده است. نتیجه این کار، افزایش سرعت استنتاج تا ۲۵ برابر است، در حالی که کیفیت و دقت خروجی حفظ شده است.
Cosmos 3 Edge با طیف وسیعی از سختافزارها سازگار است:
- پردازندههای گرافیکی RTX PRO و GeForce RTX
- سیستمهای NVIDIA DGX
- ماژولهای NVIDIA Jetson (از جمله مدلهای جدید T2000 و T3000)
در مقایسه مستقیم، Cosmos 3 Edge در بنچمارک VANTAGE-Bench برای تحلیلهای بینایی، در میان مدلهای هماندازه (۴ میلیارد پارامتری) رتبه اول را کسب کرد. این مدل در حال حاضر پیشروترین (SOTA) ابزار برای یادگیری سیاست رباتیک و زیرساختهای هوشمند است.
این چرخش نشان میدهد که «مغز» هوش مصنوعی فیزیکی از مراکز داده عظیم به لبه شبکه نقل مکان میکند. انویدیا با یکپارچه کردن استدلال و اقدام در یک مدل ۴ میلیاردی، هزینه استقرار عاملهای خودمختاری را که نباید با قطع اتصال از ابر از کار بیفتند، کاهش داده است.
برای توسعهدهندگان، اثر ثانویه این تحول، دموکراتیزه شدن دادههای آموزشی مصنوعی با دقت بالاست. چون مدل میتواند «نتیجه بصری» یک اقدام را شبیهسازی کند، میتوان از آن برای تولید دادههای آموزشی برای رباتهای دیگر استفاده کرد، بدون اینکه نیاز به میلیونها بار آزمون و خطا در دنیای واقعی باشد.
انویدیا قصد دارد این نقاط بازرسی را با استفاده از چارچوبهایی مانند vLLM بهینه کند تا محاسبات مورد نیاز برای ساخت مدلهای پاییندستی کاهش یابد. بهروزرسانیهای آینده بر تولید تعاملی جهان، شبیهسازی سناریوهای رانندگی و سیاستهای پیچیدهتر رباتیک تمرکز خواهند داشت.
گام بعدی شما
- بررسی مستندات Cosmos 3 در Hugging Face برای اجرای مدل روی سختافزارهای Jetson.
- آزمایش نسخه DROID برای تسکهای ساده برداشتن و گذاشتن در محیطهای شبیهساز.
- مطالعه متدهای distillation انویدیا برای تبدیل مدلهای بزرگ به نسخههای سریعتر برای لبه.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — برای درک قدرت پردازشی مورد نیاز، به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو