پرش به محتوای اصلی
پرش به محتوای مقاله

«پیش‌بینی اقدامات فیزیکی»؛ هدف جدید انویدیا در مدل Cosmos 3 Edge

·۲۹ تیر ۱۴۰۵۶ دقیقه مطالعه
لوگوی Cosmos 3 Edge: طرحی مدرن با نماد سه‌بعدی و رنگ‌های آبی-نارنجی که سرعت و نوآوری را نشان می‌دهد.
لوگوی Cosmos 3 Edge: طرحی مدرن با نماد سه‌بعدی و رنگ‌های آبی-نارنجی که سرعت و نوآوری را نشان می‌دهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین مدل ۴ میلیاردی که توانایی شبیه‌سازی بصری اثرات اقدام (World Modeling) را در لبه شبکه فراهم کرده و سرعت استنتاج را از طریق تقطیر ۴ مرحله‌ای تا ۲۵ برابر افزایش داده است.

۴ میلیارد پارامتر؛ تمام چیزی است که یک ربات برای استدلال و اقدام در لحظه، بدون وابستگی به ابر، نیاز دارد. در ۲۰ ژوئیه ۲۰۲۶، انویدیا (NVIDIA) مدل Cosmos 3 Edge را معرفی کرد؛ مدلی باز که به‌طور خاص برای سیستم‌هایی با حافظه محدود در کارخانه‌ها، بیمارستان‌ها و انبارها طراحی شده است.

هوش مصنوعی فیزیکی به چیزی فراتر از تشخیص اشیا نیاز دارد؛ این حوزه نیازمند یک مدل جهانی (World Model) است — شبیه به نقشه‌ای ذهنی که نه تنها مکان‌ها، بلکه نحوه تغییر محیط در طول زمان را هم می‌شناسد — تا بفهمد محیط چگونه تغییر می‌کند. برای اینکه رباتی بتواند جسمی را بردارد، باید حرکت گیره و تماس فیزیکی حاصل از آن را شبیه‌سازی کند. در حالی که مدل‌های بینایی-زبانی (VLM) بر توصیف تمرکز دارند، مدل‌های جهانی بر پیش‌بینی و اقدام متمرکز هستند.

درک مدل‌سازی جهانی

یک مدل جهانی یاد می‌گیرد اشیا، حرکت و روابط فضایی را نمایش دهد. این قابلیت به ماشین اجازه می‌دهد پیش‌بینی کند چه اتفاقی خواهد افتاد و هر اقدام خاص، چه تأثیری بر دنیای فیزیکی می‌گذارد.

فرآیند رسیدن ربات به یک شیء را در نظر بگیرید. تشخیص شیء تنها گام اول است. ربات باید مکان دقیق شیء را درک کند، نحوه حرکت گیره خود را رصد کند و پیش‌بینی کند وقتی تماس برقرار می‌شود چه اتفاقی می‌افتد. یک مدل جهانی سیستم را قادر می‌سازد تا اقدامی را که باعث یک تغییر خاص شده است استنتاج کند یا اقدامی را تولید کند که به احتمال زیاد منجر به تکمیل موفقیت‌آمیز وظیفه می‌شود.

به نقل از مستندات رسمی در Hugging Face، مدل Cosmos 3 Edge به‌عنوان یک مدل اقدام جهانی (WAM) پس‌آموزش‌دیده عمل می‌کند. این مدل مشاهدات را با رزولوشن ۶۴۰×۳۶۰ پردازش کرده و روی سخت‌افزار Jetson Thor می‌تواند ۳۲ اقدام را در هر بار استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی به جای دوره‌ی آموزش آن — ایجاد کند. این سازوکار کنترل در لحظه با نرخ ۱۵ هرتز را ممکن می‌کند و شکاف بین استدلال سطح بالا و اجرای مکانیکی سطح پایین را می‌پرد.

معماری برج دوقلو

این مدل از یک نمایش مشترک در دو برج ترنسفورمر متمایز استفاده می‌کند:

  • برج خودبازگشتی (Autoregressive Tower): توکن‌های بینایی و متن را برای درک و استدلال سطح بالا پردازش می‌کند.
  • برج انتشار (Diffusion Tower): توکن‌های بینایی، صوتی و اقدامی را برای پیش‌بینی، تولید و شبیه‌سازی عصبی پردازش می‌کند.

این دو برج لایه‌های نرمال‌سازی و پرسپترون‌های چندلایه (MLP) مجزایی دارند. با این حال، آن‌ها لایه‌های توجه (Attention) چندوجهی مشترکی دارند که اطلاعات را در زبان، ویدیو، صوت و اقدام هم‌راستا می‌کند. این معماری به مدل اجازه می‌دهد پیش از تولید خروجی، درباره صحنه استدلال کند.

بسته به وظیفه خاص، Cosmos 3 خروجی‌های متفاوتی تولید می‌کند. این مدل می‌تواند توکن‌های استدلالی را از برج خودبازگشتی یا توکن‌های ویدئویی و اقدامی بدون نویز (Denoised) را از برج انتشار تولید کند. الگوهای توجه نیز سازگار شده‌اند: زبان از «توجه علی» (Causal Attention) استفاده می‌کند که در آن هر توکن به توکن‌های قبلی توجه دارد، در حالی که توکن‌های انتشار به‌طور گسترده‌تر به بافت available توجه می‌کنند تا از پیش‌بینی منسجم پشتیبانی شود.

لوگوی Cosmos 3 Edge: نمادی از اتصال هوشمند و مرزهای نوین فناوری

نمایش مشترک اقدامات

یکی از بزرگ‌ترین چالش‌های رباتیک این است که ماشین‌های مختلف «زبان‌های حرکتی» متفاوتی دارند. بر اساس گزارش‌های فنی، هر سخت‌افزار اقدامات را متفاوت توصیف می‌کند:

  • وسایل نقلیه: اقدام را از طریق موقعیت خود (Ego Pose) و حرکت نمایش می‌دهند.
  • دوربین‌ها: از حرکت دوربین استفاده می‌کنند.
  • بازوهای رباتیک: موقعیت مجری نهایی (End Effector) را ملاک قرار می‌دهند.
  • گیره‌ها: باید وضعیت چنگ‌زدن (Grasp State) را نمایش دهند.

Cosmos 3 این مشکل را با نگاشت تمام این سخت‌افزارها به یک نمایش مشترک از اقدامات حل می‌کند. اقدامات به‌صورت بردارهای هندسی فشرده کدگذاری می‌شوند که انتقال، چرخش و وضعیت دست‌کاری را ثبت می‌کنند.

این نگاشت، پیکسل‌ها را مستقیماً به حرکت فیزیکی متصل می‌کند. وقتی مدل ویدیویی از یک نتیجه پیش‌بینی‌شده تولید می‌کند، این ویدیو صرفاً یک حدس بصری نیست، بلکه نمایش مستندی از تغییر جهان در پاسخ به یک ورودی کنترلی است. این امر به توسعه‌دهندگان داده‌های آموزشی فراهم می‌کند که بر پایه حرکت، کنترل و رابطه علت و معلولی استوار است.

لوگوی Cosmos 3 Edge: نمادی از اتصال هوشمند و مرزهای نوین فناوری

حالت سیاست‌گذاری و یادگیری

در «حالت سیاست» (Policy Mode)، مدل یک اقدام را همراه با نتیجه بصری مورد انتظارش پیش‌بینی می‌کند. این یک حلقه ایجاد می‌کند که در آن وضعیت فعلی ورودی است و اقدام و نتیجه بصری، خروجی‌ها هستند. چون جریان اقدام می‌تواند در هر دو جهت از مدل عبور کند، Cosmos 3 Edge می‌تواند یا اثرات یک اقدام را پیش‌بینی کند یا اقدامی را از روی اثرات مشاهده‌شده استنتاج نماید.

برای تسریع پذیرش، انویدیا نسخه Cosmos 3 Edge Policy (DROID) را عرضه کرد؛ یک سیاست دست‌کاری رباتیک که روی مجموعه داده DROID به‌طور خاص برای وظایف برداشتن و گذاشتن (Pick-and-place) تنظیم شده است. این عرضه شامل اسکریپت‌های پس‌آموزش همراه است تا به توسعه‌دهندگان در تطبیق مدل کمک کند.

لوگوی Cosmos 3 Edge: طرحی مدرن با نماد سه‌بعدی و رنگ‌های آبی-نارنجی که سرعت و نوآوری را نشان می‌دهد.

استقرار و عملکرد

توسعه‌دهندگان می‌توانند این مدل‌ها را با خوشه‌ای کوچک از H100ها یا یک ایستگاه NVIDIA DGX از طریق تنظیم دقیق (Fine-tuning) — شبیه به وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا در یک حوزه دقیق شود — بهینه کنند. برای افزایش کارایی، شرکت نسخه Cosmos 3 Super 4-Step Distillation را ارائه داده است.

این نسخه یک مدل تقطیرشده با تطبیق توزیع برای مدل 64B است که تعداد مراحل حذف نویز در مدل انتشار را از ۳۵ تا ۵۰ مرحله به تنها ۴ مرحله کاهش داده است. نتیجه این کار، افزایش سرعت استنتاج تا ۲۵ برابر است، در حالی که کیفیت و دقت خروجی حفظ شده است.

Cosmos 3 Edge با طیف وسیعی از سخت‌افزارها سازگار است:

  • پردازنده‌های گرافیکی RTX PRO و GeForce RTX
  • سیستم‌های NVIDIA DGX
  • ماژول‌های NVIDIA Jetson (از جمله مدل‌های جدید T2000 و T3000)

در مقایسه مستقیم، Cosmos 3 Edge در بنچمارک VANTAGE-Bench برای تحلیل‌های بینایی، در میان مدل‌های هم‌اندازه (۴ میلیارد پارامتری) رتبه اول را کسب کرد. این مدل در حال حاضر پیشروترین (SOTA) ابزار برای یادگیری سیاست رباتیک و زیرساخت‌های هوشمند است.

این چرخش نشان می‌دهد که «مغز» هوش مصنوعی فیزیکی از مراکز داده عظیم به لبه شبکه نقل مکان می‌کند. انویدیا با یکپارچه کردن استدلال و اقدام در یک مدل ۴ میلیاردی، هزینه استقرار عامل‌های خودمختاری را که نباید با قطع اتصال از ابر از کار بیفتند، کاهش داده است.

برای توسعه‌دهندگان، اثر ثانویه این تحول، دموکراتیزه شدن داده‌های آموزشی مصنوعی با دقت بالاست. چون مدل می‌تواند «نتیجه بصری» یک اقدام را شبیه‌سازی کند، می‌توان از آن برای تولید داده‌های آموزشی برای ربات‌های دیگر استفاده کرد، بدون اینکه نیاز به میلیون‌ها بار آزمون و خطا در دنیای واقعی باشد.

انویدیا قصد دارد این نقاط بازرسی را با استفاده از چارچوب‌هایی مانند vLLM بهینه کند تا محاسبات مورد نیاز برای ساخت مدل‌های پایین‌دستی کاهش یابد. به‌روزرسانی‌های آینده بر تولید تعاملی جهان، شبیه‌سازی سناریوهای رانندگی و سیاست‌های پیچیده‌تر رباتیک تمرکز خواهند داشت.

گام بعدی شما

  • بررسی مستندات Cosmos 3 در Hugging Face برای اجرای مدل روی سخت‌افزارهای Jetson.
  • آزمایش نسخه DROID برای تسک‌های ساده برداشتن و گذاشتن در محیط‌های شبیه‌ساز.
  • مطالعه متدهای distillation انویدیا برای تبدیل مدل‌های بزرگ به نسخه‌های سریع‌تر برای لبه.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — برای درک قدرت پردازشی مورد نیاز، به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیش‌رفت با تکیه بر تخصص سخت‌افزاری انویدیا، استاندارد جدیدی برای «مدل‌های جهانی کوچک» تعریف می‌کند که استدلال و اجرا را هم‌زمان مدیریت می‌کنند. نتیجه این است که ربات‌ها دیگر برای هر حرکت به پردازش ابری نیاز ندارند و استقلال عملیاتی آن‌ها در محیط‌های صنعتی به شدت افزایش می‌یابد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به سخت‌افزارهای Jetson Thor و GPUهای سری RTX Pro در ایران، بهره‌برداری تجاری از این مدل دشوار است؛ اما توسعه‌دهندگان می‌توانند از وزن‌های باز آن برای آموزش مدل‌های کوچک‌تر در محیط‌های شبیه‌ساز استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگاه رتبه اول Cosmos 3 در بنچمارک VANTAGE با وجود حجم کم ۴ میلیاردی، فرضیه ضرورت مدل‌های غول‌آسا برای درک فیزیکی جهان را به چالش می‌کشد. انویدیا با این مدل، در واقع «اتاق کنترل» رباتیک را از ابر به سخت‌افزار محلی منتقل کرده است. این یعنی عامل‌های فیزیکی اکنون می‌توانند بدون تأخیر شبکه (Latency)، استدلال کنند و عمل نمایند که پیش‌شرط اصلی برای استقرار ربات‌ها در محیط‌های حساس مانند جراحی یا خطوط تولید سریع است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.