پرش به محتوای اصلی
پرش به محتوای مقاله

انویدیا سرعت شبیه‌ساز جراحی Cosmos-H-Dreams را به ۱۶۰ فریم بر ثانیه رساند

·۵ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
ربات جراحی در حال کار با محیط شبیه‌سازی شده تولیدی در زمان واقعی
ربات جراحی در حال کار با محیط شبیه‌سازی شده تولیدی در زمان واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک مدل جهانی کند به یک شبیه‌ساز ۱۶۰ فریم بر ثانیه از طریق تقطیر مدل-به-مدل (Student-Teacher Distillation) و بهینه‌سازی‌های سطح هسته GPU.

تصور کنید یک جراح بتواند هر حرکت حساس خود را در یک محیط مجازی، بدون هیچ تأخیری و با دقت میلی‌متری تمرین کند، بدون اینکه خطری برای بیمار یا تجهیزات گران‌قیمت وجود داشته باشد. این رویایی است که انویدیا با دستیابی به سرعت ۱۶۰ فریم بر ثانیه در شبیه‌سازی‌های جراحی را به واقعیت نزدیک کرده است.

طبق اعلام انویدیا (NVIDIA) در ۲۷ ژوئیه ۲۰۲۶، سامانه جدیدی به نام Cosmos-H-Dreams طراحی شده است که به یک تک‌پردازنده NVIDIA RTX PRO 6000 اجازه می‌دهد شبیه‌سازی‌های تعاملی را با سرعتی باورنکردنی پیش ببرد. این پیشرفت به جراحان و سیاست‌های هوش مصنوعی اجازه می‌دهد تا حرکات خود را در یک چرخه بسته (Closed-loop) آزمایش کنند. این رویکرد در راستای تلاش‌های گسترده‌تر انویدیا برای پیش‌بینی اقدامات فیزیکی در مدل‌های سری Cosmos است تا تعاملات هوش مصنوعی با جهان واقعی دقیق‌تر شود.

چالش شبیه‌سازی جراحی

رباتیک جراحی در حال حاضر از حالت عملیات از راه دور ساده (Teleoperation) به سمت سیاست‌های پیچیده «بینایی-زبان-عمل» (Vision-Language-Action) حرکت می‌کند. با این حال، آموزش این سیاست‌ها ریسک بالا و سرعت کمی دارد؛ یک اشتباه کوچک روی یک ربات فیزیکی می‌تواند ابزارهای گران‌قیمت یا بافت‌های ارگانیک را نابود کند. همچنین، پلتفرم‌های فیزیکی هزینه‌ی بهره‌برداری بالایی دارند و بازتولید آزمایش‌ها در آن‌ها کند است.

شبیه‌سازهای سنتی اغلب در بازتولید واقعیت‌های «ناپایدار» جراحی شکست می‌خورند. مدل‌های متداول با بافت‌های تغییرشکل‌دهنده (Deformable tissue)، تعاملات ظریف ابزارها و سطوح دارای بازتاب شدید (Specular surfaces) مشکل دارند. این مدل‌ها معمولاً پیچیدگی‌های مربوط به بخیه‌ها، سوزن‌ها، دود جراحی و انسدادهای بصری (Occlusions) را نادیده می‌گیرند. این جزئیات برای آموزش‌های واقع‌گرایانه حیاتی هستند اما مدل‌سازی دستی آن‌ها فوق‌العاده دشوار است.

برای حل این مشکل، انویدیا ابتدا Cosmos-H-Surgical-Simulator را توسعه داد. این یک مدل بنیادی است که بر روی NVIDIA Cosmos-Predict2.5-2B ساخته شده است. این سیستم دینامیک‌های بصری را مستقیماً از ویدیوهای همگام‌سازی شده و کینماتیک ربات با استفاده از مجموعه داده‌های Open-H-Embodiment یاد می‌گیرد. مدل‌های جهانی (World Foundation Models) مسیری متفاوت را پیشنهاد می‌دهند: یادگیری از داده‌های واقعی به جای طراحی دستی تک‌تک اشیاء و تعاملات. این چشم‌انداز با پروژه Newton برای ایجاد لایه‌های فیزیکی متن‌باز هم‌راستا است تا شبیه‌سازی محیط‌های موازی برای هوش مصنوعی فیزیکی تسهیل شود.

در حالی که مدل اولیه برای ارزیابی‌های آفلاین (جایی که یک مسیر به مدل ارسال شده و خروجی بدون نیاز به ربات فیزیکی امتیازدهی می‌شود) مفید بود، اما برای تعامل در زمان واقعی بسیار کند بود. این مدل می‌توانست ویدیوهای جراحی آینده را بر اساس یک صحنه اولیه و توالی از اقدامات تولید کند تا داده‌های مصنوعی برای اکوسیستم Open-H-Embodiment بسازد، اما سرعت لازم برای کنترل در چرخه بسته را نداشت.

Cosmos-H-Dreams این مشکل را با تقطیر دانش مدل «استاد» به یک مدل «شاگرد» علّی (Causal) که برای استریم طراحی شده، حل می‌کند. این مدل، پیش‌فرض‌های جراحی چند-بدنه (Multi-embodiment) را برای عملیات بخیه زدن روی میز با استفاده از کیت تحقیقاتی da Vinci (dVRK) تخصصی می‌کند و تکه‌هایی از فریم‌ها را بر اساس جریان زنده کینماتیک ربات تولید می‌کند. مدل منتشر شده، یک فریم RGB اولیه و ورودی‌های کینتیک را دریافت کرده و سپس تکه بعدی فریم‌ها را تولید می‌کند و سپس با بلوک اقدام بعدی ادامه می‌دهد.

مسیر رسیدن به عملکرد زمان-واقعی

انتقال به سرعت ۱۶۰ فریم بر ثانیه نیازمند یک خط لوله آموزشی سه مرحله‌ای بود تا از «انحراف» یا توهم (Hallucination) مدل در توالی‌های طولانی جلوگیری شود:

  • استاد جراحی (Surgical Teacher): این مدل دوطرفه از چک‌پوینت Cosmos-H-Surgical-Simulator شروع می‌کند و از یک نمایش عمل یکپارچه ۴۴ بعدی استفاده می‌کند. برای مدل dVRK، محتوای عملیاتی بازوی دوگانه — شامل انتقال نسبی مجری نهایی (End-effector)، چرخش و وضعیت گیره (Gripper) — به این نمایش نگاشت می‌شود. این استاد روی مجموعه ترکیبی JHU dVRK تنظیم دقیق (Fine-tune) شد. نکته حیاتی این است که مدل از شکست‌ها نیز یاد گرفت؛ مواردی مانند افتادن سوزن، پرتاب‌های erratic و گره‌های ناموفق، تا شبیه‌ساز بتواند پیامدهای حرکات نادرست رباتیک را به‌دقت پیش‌بینی کند. برای بهبود پایداری، افق زمانی آموزش به‌تدریج از ۱۲ فریم شروع و تا ۷۲ فریم افزایش یافت و در هر مرحله، مدل با وزن‌های پیش‌آموزش‌دیده مقداردهی اولیه شد.
  • گرم‌کردن علّی (Causal Warmup): برای فعال‌سازی قابلیت استریم، مدل شاگرد از مجموعه‌ای کش‌شده از مسیرهای حذف نویز (Denoising) پیش‌محاسبه‌شده توسط استاد استفاده کرد. این کار به شاگرد آموخت که با توجه علّی (Causal Attention) و یک حافظه KV (Key/Value) استریم‌شونده کار کند، پیش از آنکه هرگز فریم‌های تولیدی خودش را ببیند. این مرحله شاگرد را آماده می‌کند تا به عنوان یک مدل علّی عمل کرده و صحنه را به‌صورت خودبازگشتی (Autoregressively) تولید کند.
  • تقطیر خود‌اجباری (Self-Forcing Distillation): اکثر مدل‌ها زمانی که شروع به تکیه بر خروجی‌های ناقص خود می‌کنند، شکست می‌خورند زیرا خطاهای کوچک در طول زمان انباشته می‌شوند. انویدیا «خود-اجباری» را پیاده کرد؛ جایی که شاگرد با استفاده از بافت تولید شده توسط خودش به جلو حرکت می‌کند، در حالی که یک استاد منجمد (Frozen Teacher)، نظارت تطبیق توزیع (Distribution-matching supervision) را برای هدایت او به سمت ویدیوهای واقع‌گرایانه فراهم می‌کند. این امر شاگرد را برای شرایط خاصی که در طول استنتاج تعاملی با آن مواجه می‌شود، آماده می‌کند و اجازه می‌دهد پخش دیفیوژن در مراحل کم (Few-step diffusion) انجام شود؛ به طوری که تنها به دو مرحله حذف نویز برای هر فریم نهفته نیاز است، در حالی که مدل استاد به مراحل بسیار بیشتری نیاز داشت.

نمایی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی

سخت‌افزار و شتاب‌دهی استنتاج

تقطیر مدل به تنهایی کافی نبود. انویدیا مدل را با FlashDreams ترکیب کرد، یک کتابخانه استنتاج شتاب‌یافته برای مدل‌های جهانی و ویدیویی خودبازگشتی. این لایه از چندین بهینه‌سازی مکمل استفاده می‌کند:

  • Streaming KV Cache: کاهش محاسبات تکراری در هنگام تولید متوالی فریم‌ها.
  • CUDA Graph Capturing: به حداقل رساندن سربار اجرای دستورات CPU برای کرنل‌های GPU.
  • Model Compilation: بهینه‌سازی گراف اجرای مدل برای سخت‌افزار هدف خاص.

این تکنیک‌ها سیستم را از رژیم ۱۰ فریم بر ثانیه در Cosmos-H-Surgical-Simulator استاندارد به وضعیت تعاملی فعلی یعنی حدود ۱۶۰ فریم بر ثانیه روی یک تک‌پردازنده NVIDIA RTX PRO 6000 رساندند.

این سرعت، امکان ایجاد رابط‌های متنوع انسان-ماشین را فراهم می‌کند:

  • کلاینت‌های مرورگر: جراحان می‌توانند دستورات کیبورد ارسال کرده و فریم‌های تولید شده را از طریق WebRTC دریافت کنند.
  • ادغام VR: یک کلاینت Meta Quest می‌تواند حرکت کنترلرهای ردیابی شده را به اقدامات رباتیک نگاشت کرده و صحنه سنتز شده را از طریق WebXR نمایش دهد.
  • هوش مصنوعی چرخه-بسته: مدل می‌تواند به یک سیاست جراحی یادگرفته‌شده متصل شود و اقدامات پیش‌بینی‌شده و مشاهدات تولید شده را به‌صورت لحظه‌ای تبادل کند.

این مدل پیش از این از طریق همکاری با CMR Surgical و Cambridge Consultants با کنترل‌کننده جراح Versius ادغام شده است و عملیات در زمان واقعی را روی پلتفرم Versius ممکن ساخته است.

لوگوی Cosmos 3 Edge: طرحی مدرن با نماد سه‌بعدی و رنگ‌های آبی-نارنجی که سرعت و نوآوری را نشان می‌دهد.

تغییر پارادایم در هوش مصنوعی جراحی

این تغییر، هوش مصنوعی جراحی را از «مشاهده» به «ساکن شدن» (Habitation) منتقل می‌کند. برای یک توسعه‌دهنده، این بدان معنای این است که دیگر نیازی به یک ربات فیزیکی برای تست این موضوع ندارید که آیا یک سیاست می‌تواند یک مورد خاص و نادر (Edge case) را مدیریت کند یا خیر؛ شما می‌توانید آن شکست را در یک مدل جهانی به درخواست خود تولید کنید. این مدل‌ها می‌توانند به شرکای فعالی در توسعه تبدیل شوند و محیط‌هایی مقیاس‌پذیر برای یادگیری تقویتی (Reinforcement Learning) یا یادگیری تقلیدی (Imitation Learning) فراهم کنند، بدون اینکه هر آزمایش به سخت‌افزارهای رباتیک کمیاب وابسته باشد.

برای حوزه پزشکی، این فناوری مانع ورود برای تمرینات با دقت بالا، برنامه‌ریزی مراحل جراحی و پشتیبانی از تصمیمات حین عمل را کاهش می‌دهد. با استفاده از مدل‌های جهانی به جای موتورهای فیزیک کدنویسی شده، شبیه‌سازی جزئیات بازتاب نوری و انسدادهای بصری را که معمولاً آموزش‌های VR سنتی را مختل می‌کنند، به‌خوبی ثبت می‌کند. این سیستم حتی راهی به سوی جراحی از راه دور با آگاهی از تأخیر (Latency-aware telesurgery) ارائه می‌دهد، زیرا نمایش پایداری را از طریق مدل جهانی حفظ می‌کند.

انویدیا اکنون در حال ایجاد مجموعه جدیدی از «محک‌های چرخه-بسته» برای اعتبارسنجی این مدل‌ها است. برای اطمینان از اینکه سیاستی که در Cosmos-H-Dreams یاد گرفته شده واقعاً به یک ربات فیزیکی منتقل می‌شود، آن‌ها موارد زیر را اندازه‌گیری می‌کنند:

  • دقت رسیدن و وضعیت نوک ابزار: اطمینان از اینکه ابزار به‌درستی به هدف می‌رسد.
  • دقت چرخه گیره: اعتبارسنجی مکانیک باز و بسته شدن ربات.
  • پایداری در حالت بیکار: بررسی اینکه آیا صحنه در صورت عدم انجام هیچ اقدامی، ثابت می‌ماند.
  • تنوع اقدامات متقابل (Counterfactual): تست واکنش مدل به اقدامات متنوع و غیرمنتظره.
  • انحراف افق بلند: اندازه‌گیری میزان تخریب صحنه در بازه‌های زمانی طولانی.
  • تطابق نتایج سیاست شبیه‌سازی شده و واقعی: مقایسه نتیجه نهایی یک تکلیف در شبیه‌ساز در مقابل واقعیت.

این پلتفرم به‌گونه‌ای طراحی شده است که قابل گسترش باشد. Cosmos-H-Dreams یک پلتفرم تحقیق و توسعه است، نه یک سیستم تشخیص پزشکی، جایگزینی برای تصویربرداری حین عمل یا یک کنترل‌کننده فیزیکی ربات. با این حال، انویدیا یک دستورالعمل کامل — شامل راهنمای گام‌به‌گام برای تنظیم دقیق استاد و تقطیر خود‌اجباری — را برای کاربران فراهم کرده است تا بتوانند مدل‌های شاگرد خود را با استفاده از مجموعه‌داده‌های جراحی اختصاصی تقطیر کنند و اجازه دهند این فناوری در across بدنه های مختلف رباتیک مقیاس‌پذیر شود.

گام بعدی شما

  • اگر توسعه‌دهنده رباتیک هستید، مستندات تقطیر مدل‌های شاگرد انویدیا را برای کاهش هزینه استنتاج بررسی کنید.
  • کاربردهای مدل‌های جهانی در صنعت پزشکی را با تمرکز بر داده‌های Open-H-Embodiment دنبال کنید.
  • ابزارهای WebXR را برای ایجاد رابط‌های تعاملی با مدل‌های مولد ارزیابی کنید.

اما لایه‌ی سخت‌افزاری این سرعت خیره‌کننده، تنها بخشی از معماری جدید انویدیا است — برای درک عمیق‌تر، تحلیل ما درباره تراشه‌های Blackwell را بخوانید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص انویدیا در سخت‌افزار و مدل‌های مولد، ریسک آموزش ربات‌های جراحی را به شدت کاهش می‌دهد. اعتبار این سیستم از طریق ادغام در پلتفرم‌های تجاری مثل Versius تایید شده است.

تأثیر برای ایران

دسترسی به سخت‌افزارهای RTX PRO 6000 برای مراکز تحقیقاتی ایران محدود است، اما متدولوژی تقطیر مدل برای بهینه‌سازی مدل‌های سنگین روی سخت‌افزارهای ضعیف‌تر، کاربرد عملی دارد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی موتورهای فیزیک کدنویسی‌شده با مدل‌های جهانی، پارادایم آموزش رباتیک را تغییر می‌دهد. دیگر نیازی نیست هر برخورد فیزیکی را با معادلات ریاضی تعریف کنیم؛ مدل‌ها «شهود فیزیکی» را از داده‌ها می‌گیرند. این یعنی سرعت توسعه ربات‌های جراح از سال‌ها به هفته‌ها کاهش می‌یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.