پرش به محتوای اصلی
پرش به محتوای مقاله

پروژه Newton: شبیه‌سازی هزاران محیط موازی برای هوش مصنوعی فیزیکی

·۳۱ تیر ۱۴۰۵۹ دقیقه مطالعه۱ بازدید
نمایی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی
نمایی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

عرضهٔ یک لایهٔ فیزیک تفاضل‌پذیر و بازمتن که اجازه می‌دهد هزاران محیط شبیه‌سازی موازی روی GPU اجرا شوند، بدون اینکه نیاز به رندرینگ سنگین Omniverse باشد.

تصور کنید می‌خواهید به رباتی یاد بدهید چطور یک لیوان لغزنده، یک کابل خمیده یا گیره‌ای که با زاویه‌ای اشتباه با شیئی برخورد کرده است را مدیریت کند؛ این کار در دنیای واقعی به معنای هزاران ساعت شکست، تجربه تلخ و هزینه است. این حجم از تجربه، برای جمع‌آوری در دنیای واقعی بسیار گران، کند و ریسک‌پذیر است. در ۲۱ ژوئیه ۲۰۲۶، شرکت انویدیا (Nvidia) جزئیات تغییر رویکرد خود به سمت یک پشته شبیه‌سازی لایه‌بندی شده را شرح داد که هدف آن پر کردن این شکاف است و محوریت آن پروژه‌ای جدید و بازمتن به نام Newton است.

شکاف داده در هوش مصنوعی فیزیکی

سیستم‌های هوش مصنوعی فیزیکی (Physical AI) برخلاف مدل‌های زبانی بزرگ (LLMs) و مدل‌های بینایی-زبانی (VLMs)، به مجموعه‌داده‌هایی در مقیاس اینترنت دسترسی ندارند. در حالی که LLMها از متن یاد می‌گیرند، یک ربات باید پیامدهای خاص تعامل با دنیای فیزیکی را بیاموزد. برای آموزش یک سیستم هوش مصنوعی فیزیکی، ربات باید نتایج اقدامات خود را درک کند؛ مثلاً بداند وقتی یک کابل خم می‌شود یا وقتی گیره با زاویه نامناسب با جسم تماس پیدا می‌کند، چه اتفاقی می‌افتد.

شبیه‌سازی با تولید مقادیر عظیمی از داده‌های واقع‌گرایانه و مبتنی بر قوانین فیزیک، پلی برای عبور از این مشکل ایجاد می‌کند. توسعه‌دهندگان اکنون می‌توانند از «از راه دور کنترل» (Teleoperation) در محیط شبیه‌سازی و موازی‌سازی GPU استفاده کنند تا هزاران ساعت تجربه را با کسری از هزینه جمع‌آوری در دنیای واقعی تولید نمایند. این رویکرد شبیه‌ساز-محور دقیقاً همان مسیری است که شرکت‌هایی نظیر Flexion Robotics برای آماده‌سازی ربات‌های انسان‌نما در محیط‌های اداری به کار گرفته‌اند. این امر ایجاد مجموعه‌داده‌های عظیم را بدون خطرات مرتبط با ماهیت تخریبی برخی وظایف دنیایی ممکن می‌سازد.

از نظر تاریخی، شبیه‌سازها عمدتاً برای اشکال‌زدایی هندسی، تست کنترل‌کننده‌ها یا بصری‌سازی حرکت استفاده می‌شدند. اما امروزه، آن‌ها مستقیماً در حلقه توسعه مدل برای موارد زیر ادغام شده‌اند:

  • تولید مجموعه‌داده‌های ادراکی (Perception)
  • آموزش سیاست‌های یادگیری تقویتی (RL)
  • جمع‌آوری نمایش‌های عملی (Demonstrations)
  • تقویت داده‌های دنیای واقعی (Data Augmentation)
  • بنچ‌مارک کردن مدل‌ها
  • تست سیاست‌ها در مواجهه با سناریوهای نادر یا متخاصم (Adversarial)

این تغییر رویکرد توضیح می‌دهد چرا آزمایشگاه‌های تحقیقات صنعتی و گروه‌های دانشگاهی به‌طور فزاینده‌ای در حال توسعه یا مشارکت در موتورهای شبیه‌سازی هستند که نیازهای مدرن و مقیاس‌پذیر این حوزه را برآورده کنند.

پارادایم سه-کامپیوتری

برای مدیریت این نیازها، صنعت اکنون یک معماری سه-کامپیوتری را بر اساس نیازهای تأخیر (Latency)، توان عملیاتی (Throughput) و دقت پذیرفته است. این پارادایم اجازه می‌دهد سخت‌افزارهای مختلف نقش‌های خاصی را در چرخه توسعه ایفا کنند:

۱. کامپیوتر آموزش: یک خوشه بزرگ GPU که برای پردازش داده‌ها و آموزش مدل‌های بنیادی هوش مصنوعی استفاده می‌شود.
۲. کامپیوتر شبیه‌سازی: یک ایستگاه کاری یا خوشه GPU که از فیزیک شتاب‌یافته با GPU و رندرینگ RTX برای تولید تجربه ربات، داده‌های حسگر و تعاملات شبیه‌سازی شده استفاده می‌کند.
۳. کامپیوتر روی ربات: یک دستگاه لبه (Edge device)، مانند سیستم‌های کلاس NVIDIA Jetson AGX Thor، که سیاست یا مدل آموزش‌دیده را در هنگام استقرار اجرا می‌کند.

نمایی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی

هر کامپیوتر بسته به تأخیر، توان عملیاتی، دقت و الزامات استقرار، نقشی متفاوت دارد. این ساختار تضمین می‌کند که یک سیستم فیزیکی (زمین و ربات) بتواند به‌طور مداوم با بازنمایی مجازی خود (مدل دیجیتال) تبادل داده داشته باشد و یک حلقه بازخورد دوطرفه برای نظارت، تحلیل، پیش‌بینی و کنترل ایجاد کند.

این مدل به طور خاص اجازه می‌دهد تا عملیات سنگین محاسباتی (Training) از عملیات تولید داده (Simulation) و اجرای لحظه‌ای (Inference) جدا شود. این جداسازی برای بهینه‌سازی مصرف انرژی و افزایش سرعت تکرار در چرخه توسعه حیاتی است.

همان‌طور که در پوشش پیشین ما درباره‌ی سرمایه‌گذاری‌های استراتژیک انویدیا در اکوسیستم هوش مصنوعی ژاپن دیدیم، این حرکت به سمت زیرساخت‌های فیزیکی بازمتن، نشان‌دهنده گذار از ابزارهای انحصاری و بسته به لایه‌های مشترک و تعامل‌پذیر است.

معماری Newton

Newton یک موتور فیزیک بازمتن، شتاب‌یافته با GPU و تفاضل‌پذیر (Differentiable) است که توسط انویدیا، گوگل دیپ‌مایند (Google DeepMind) و دیزنی ریسِرچ (Disney Research) توسعه یافته و از طریق بنیاد لینوکس مدیریت می‌شود. این پروژه بر پایه NVIDIA Warp (یک چارچوب پایتونی برای هسته‌های تفاضل‌پذیر شتاب‌یافته با CUDA) و OpenUSD بنا شده است.

در اکوسیستم گسترده‌تر، Newton به عنوان یک لایه فیزیکی مدرن برای چارچوب‌هایی مانند Isaac Lab و MuJoCo Playground عمل می‌کند. این موتور مسیری به سوی فیزیک مقیاس‌پذیر و مستقل از شبیه‌ساز (Simulator-agnostic) فراهم می‌آورد. Newton امکان محاسبات عددی فیزیکی شامل دینامیک اجسام صلب و نرم، مدل‌های تماس و اصطکاک، محدودیت‌های مفصلی (Joint constraints)، عملگرها، حسگرها و انتگرال‌گیری زمانی را فراهم می‌کند. در هر گام شبیه‌سازی، موتور تخمین می‌زند که اجسام تحت تأثیر نیروها، گشتاورها، برخوردها، گرانش، محدودیت‌ها و ورودی‌های کنترل‌کننده چگونه حرکت می‌کنند.

به جای تحمیل یک روش عددی واحد برای هر مسئله، Newton چندین پیاده‌سازی حل‌کننده (Solver) بر اساس سیستم فیزیکی مورد مدل‌سازی ارائه می‌دهد:

  • SolverMuJoCo و SolverFeatherstone: این‌ها از مختصات تعمیم‌یافته برای سیستم‌های صلب مفصل‌دار (Articulated) استفاده می‌کنند.
  • SolverSemiImplicit، SolverXPBD و SolverKamino: این‌ها از فرمول‌بندی‌های مختصات حداکثری (Maximal-coordinate) بهره می‌برند.
  • SolverVBD: یک حل‌کننده ضمنی (Implicit) که از اجسام صلب، ذرات، پارچه و اجسام نرم پشتیبانی می‌کند، هرچند پشتیبانی آن از مفاصل همچنان محدود است.
  • SolverImplicitMPM: به‌طور خاص متریال‌های پیوسته ذره‌محور (Particle-based continuum materials) را هدف قرار می‌دهد.
  • SolverStyle3D: یک حل‌کننده تخصصی برای شبیه‌سازی پارچه است.

نمایی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی

از آنجایی که قابلیت‌ها بین این حل‌کننده‌ها متفاوت است — به‌ویژه در مورد مفصل‌بندی‌ها، اجسام تغییر شکل‌پذیر، تماس‌ها و تفاضل‌پذیری — انتخاب مناسب کاملاً به سیستم فیزیکی مورد مدل‌سازی بستگی دارد. برای مثال، اگر هدف شبیه‌سازی دقیق لرزش یک کابل باشد، SolverVBD یا SolverImplicitMPM ترجیح داده می‌شوند، در حالی که برای بازوهای رباتیک صلب، SolverMuJoCo بهینه‌تر است.

کالبدشکافی اکوسیستم شبیه‌سازی

توسعه‌دهندگان باید موتورها را بر اساس نیازهای اساسی انتخاب کنند. آن‌ها اغلب با این پرسش‌ها شروع می‌کنند: آیا به گردش کارهای تولید داده‌های مصنوعی مقیاس‌پذیر نیاز دارم؟ آیا نیاز به یادگیری تقویتی دارم؟ چه نوع پشتیبانی از حسگرها در دسترس است؟ چه فرمت‌های دارایی‌های سه‌بعدی پشتیبانی می‌شوند؟ چه میزان دقت محیطی و مقیاسی مورد نیاز است؟

چشم‌انداز فعلی بین رندرینگ با دقت بالا (High-fidelity) و فیزیک با توان عملیاتی بالا (High-throughput) تقسیم شده است. موتورهای محبوب برای ربات‌های انسان‌نما و دست‌ورزی‌های دو بازه شامل NVIDIA Isaac Sim، Isaac Lab، MuJoCo، PyBullet، Drake و Genesis است. این رویکرد ایجاد یک مدل واحد برای کنترل بدن‌های متنوع، مشابه آنچه در معماری مدل LingBot-VLA 2.0 برای مدیریت ۲۰ بدنه رباتیک مشاهده شد، را تسهیل می‌کند.

MuJoCo (دینامیک چند-مفصلی با تماس) یک موتور بازمتن است که برای رباتیک، بیومکانیک و سیستم‌های مفصل‌دار ساخته شده است. این موتور بر سرعت، دقت و بهینه‌سازی مدل‌محور تأکید دارد. نقاط قوت اصلی آن شامل خط لوله قطعی (Deterministic)، مدل‌سازی قوی تماس‌ها و دینامیک معکوس تعریف‌شده با تماس‌ها است. با این حال، MuJoCo برای رندرینگ واقع‌گرایانه یا موازی‌سازی عظیم GPU طراحی نشده است.

نمای کلی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی

برای رفع این مشکل، MuJoCo Warp (MJWarp) ایجاد شد. این یک پیاده‌سازی شتاب‌یافته با GPU است که با NVIDIA Warp نوشته شده است. برخلاف MuJoCo مبتنی بر CPU، مدل MJWarp توان عملیاتی را بر تأخیر تک-گام ترجیح می‌دهد. این سیستم برای شبیه‌سازی دنیای متعددی به‌طور موازی، کاهش گلوگاه‌های انتقال داده بین CPU و GPU و مقیاس‌بندی کارآمدتر وظایف رباتیکِ غنی از تماس برای بارهای کاری یادگیری طراحی شده است.

Nvidia Isaac Sim یک چارچوب شبیه‌سازی رباتیک است که بر روی NVIDIA Omniverse بنا شده است. این ابزار از OpenUSD به عنوان لایه داده و صحنه اصلی استفاده می‌کند و ربات‌ها، حسگرها، متریال‌ها و نورپردازی را به عنوان USD prims و schemaها نمایش می‌دهد. این سیستم فیزیک با دقت بالا را از طریق PhysX و رندرینگ واقع‌گرایانه RTX فراهم می‌کند. همچنین می‌تواند دارایی‌ها را از CAD، URDF، MJCF، USD و خطوط لوله بازسازی دنیای واقعی دریافت کند. این ابزار اصلی برای شبیه‌سازی حسگرهای پیچیده است، از جمله:

  • دوربین‌ها و حسگرهای عمق (Depth sensors)
  • لایدار (Lidar) و رادار
  • بخش‌بندی (Segmentation) و گردش‌های کاری تولید داده‌های مصنوعی

Nvidia Isaac Lab 3.0 به یک چارچوب سبک و با پشتیبانی از چندین Backend برای یادگیری ربات تبدیل شده است که برای آموزش و ارزیابی سیاست‌های ربات در مقیاس بالا طراحی شده است. این ابزار از گردش‌های کاری با کمک ایجنت برای ساخت محیط‌ها، تنظیم فیزیک، اشکال‌زدایی، پروفایلینگ، انتقال شبیه‌ساز-به-شبیه‌ساز (Sim-to-sim) و استقرار شبیه‌ساز-به-واقعیت (Sim-to-real) پشتیبانی می‌کند. پس از نسخه 3.0.0، این چارچوب وابستگی خود را به Isaac Sim و Omniverse جدا کرده است.

این معماری جدید به توسعه‌دهندگان اجازه می‌دهد Backend خود را انتخاب کنند:

  • Isaac Sim backend: استفاده از PhysX و RTX برای گردش‌های کاری واقع‌گرایانه و غنی از حسگر.
  • Newton backend: استفاده از فیزیک سبک و بدون رابط گرافیکی (Headless) Newton برای شبیه‌سازی با توان عملیاتی بالا.
  • OVRTX renderer: یک گزینه مستقل برای افزودن حسگرهای واقع‌گرایانه.
  • Newton renderer: برای وظایف یادگیری تقویتی مبتنی بر بینایی که به تعداد محیط‌های بسیار زیاد نیاز دارند.

مقایسه خطوط پایه (Baselines)

در حالی که Newton و Isaac مرزهای مقیاس GPU را جابه‌جا می‌کنند، سایر ابزارها جایگاه‌های خاص خود را حفظ کرده‌اند:

  • PyBullet: همچنان یک خط پایه مفید مبتنی بر CPU برای نمونه‌سازی سریع است و برای تست‌های اولیه کاربرد دارد.
  • Drake: استاندارد طلایی برای محاسبات عددی دقیق و بهینه‌سازی مسیر با تماس‌های ضمنی است و در محیط‌های دانشگاهی برای اثبات تئوری‌ها استفاده می‌شود.
  • DART و ODE: هنوز به‌طور گسترده به عنوان Backendهای Gazebo استفاده می‌شوند و برای شبیه‌سازی‌های ساده‌تر رباتیک در لینوکس رایج هستند.

نمای کلی از وضعیت شبیه‌سازی برای هوش مصنوعی فیزیکی

هیچ موتور واحدی تمام موارد استفاده را پوشش نمی‌دهد. به عنوان مثال، خطوط پایه سنتی CPU نمی‌توانند نیاز به شبیه‌سازی ۴۰۹۶ ربات انسان‌نما روی یک GPU واحد را پشتیبانی کنند؛ چنین مقیاسی نیازمند خطوط لوله تخصصی شتاب‌یافته با GPU در Isaac Lab و Newton است. این موتورها در پشتیبانی از شبیه‌سازی دسته‌ای (Batched)، یادگیری تقویتی و فیزیک غنی از تماس تفاوت‌های چشمگیری دارند. در واقع، تفاوت اصلی در نحوه مدیریت حافظه GPU و کاهش زمان انتقال داده‌ها میان هسته‌های پردازشی است.

تحلیل: گذار به زیرساخت‌های مشترک

این تکه‌تکه شدن و بازسازی پشته شبیه‌سازی، نشان‌دهنده یک تغییر بنیادی در هوش مصنوعی تجسم‌یافته (Embodied AI) است. ما در حال حرکت از این پرسش که «کدام موتور سریع‌تر است» به سوی دنیایی از زیرساخت‌های مشترک هستیم. این روند مشابهی با آنچه در لایه‌های پایین‌دستی وب (مانند پروتکل TCP/IP) رخ داد، دارد؛ جایی که استانداردهای مشترک جایگزین پیاده‌سازی‌های منزوی شدند.

با بازمتن کردن لایه فیزیک از طریق بنیاد لینوکس و استفاده از OpenUSD، انویدیا و شرکایش در تلاش‌اند تا انتزاعاتی (Abstractions) را تعریف کنند که تمام ابزارهای رباتیک آینده بر روی آن‌ها بنا شوند. همان‌طور که مدل‌ها از مجموعه‌داده‌های ایستا به سمت تعامل فیزیکی حرکت می‌کنند، تجربیات شبیه‌سازی شده مقیاس‌پذیر دیگر اختیاری نیستند، بلکه بنیادی هستند. بدون این لایه‌های مشترک، هر شرکت باید چرخ را از اول اختراع می‌کرد که باعث کند شدن سرعت پیشرفت کل صنعت می‌شد.

برای توسعه‌دهنده، این بدان معناست که سد ورود در حال فروپاشی است. شبیه‌سازی تفاضل‌پذیر و با عملکرد بالا دیگر محدود به آزمایشگاه‌های نخبه نیست؛ هر کسی با یک GPU مصرف‌کننده اکنون می‌تواند به همان هسته‌های فیزیکی دسترسی داشته باشد که DeepMind از آن‌ها استفاده می‌کند. این امر خط لوله «شبیه‌ساز-به-واقعیت» را دموکراتیزه کرده و سرعت تبدیل سیاست‌های مجازی به واقعیت‌های فیزیکی را افزایش می‌دهد. این مدل حاکمیتی باز تضمین می‌کند که زیرساخت‌های اصلی — موتورهای فیزیک، شبیه‌سازهای تفاضل‌پذیر و خطوط لوله آموزش — به‌طور شفاف و در فضای باز شکل بگیرند و از هرگونه انحصار سخت‌افزاری یا نرم‌افزاری فاصله بگیرند.

گام بعدی

توسعه‌دهندگانی که به دنبال پیاده‌سازی این گردش‌های کاری هستند، می‌توانند دوره SO-101 sim-to-real انویدیا را بررسی کنند که خط لوله را از Isaac Sim و Isaac Lab تا استقرار فیزیکی با GR00T آموزش می‌دهد. این دوره به طور خاص بر مدیریت خطاهای انتقال از محیط مجازی به واقعی تمرکز دارد. برای کسانی که به دنبال دید گسترده‌تری هستند، مسیرهای یادگیری Physical AI انویدیا، راهنمایی‌های ساختاریافته‌ای را در سراسر گردش‌های کاری شبیه‌سازی و هوش مصنوعی تجسم‌یافته ارائه می‌دهد.

مرز حیاتی بعدی که باید زیر نظر گرفت، ادغام MuJoCo Warp به عنوان یک حل‌کننده اصلی در اکوسیستم Newton برای آزمایش‌های با توان عملیاتی بالا است. این ادغام می‌تواند دقت بالای MuJoCo را با سرعت خیره‌کننده Newton ترکیب کند و با اهدافی مانند پیش‌بینی اقدامات فیزیکی در مدل Cosmos 3 Edge همسو شود. با حرکت به سمت سال ۲۰۲۶، تمرکز بر این است که کدام بخش‌های این پشته به زیرساخت‌های مشترک و تحت حاکمیت باز تبدیل شوند که برای جامعه جهانی در دسترس باشد و اجازه دهد تا ربات‌ها با سرعتی بی‌سابقه مهارت‌های پیچیده انسانی را بیاموزند.

چرا این موضوع مهم است؟

این پروژه با ایجاد یک استاندارد باز و شتاب‌یافته، وابستگی توسعه‌دهندگان به ابزارهای انحصاری را کم می‌کند. اعتبار این حرکت در همکاری سه غول انویدیا، گوگل و دیزنی نهفته است که مسیر رسیدن از مدل‌های مجازی به ربات‌های عملیاتی را کوتاه‌تر می‌کند.

تأثیر برای ایران

این ابزار به‌دلیل بازمتن بودن و مدیریت توسط بنیاد لینوکس، برای پژوهشگران رباتیک در ایران به‌شدت کاربردی است و دسترسی به هسته‌های محاسباتی سطح جهانی را بدون نیاز به لایسنس‌های گران‌قیمت فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا بر باز کردن لایهٔ فیزیک، نشان می‌دهد که رقابت در هوش مصنوعی فیزیکی از «ساخت بهترین شبیه‌ساز» به «تعریف استاندارد مشترک» تغییر جهت داده است. با انتقال این زیرساخت به بنیاد لینوکس، انویدیا در واقع در حال تبدیل کردن OpenUSD به «زبان مشترک» رباتیک است تا مدل‌های مختلف بتوانند بدون بازنویسی کد، در محیط‌های مختلف آموزش ببینند. این اقدام، سد ورود به دنیای Sim-to-Real را برای تیم‌های کوچک می‌شکند و سرعت تجاری‌سازی ربات‌های انسان‌نما را به‌شد Keychain افزایش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.