پرش به محتوای اصلی
پرش به محتوای مقاله

درون استراتژی تجاری Skild AI برای تسریع استقرار ربات‌های هوشمند

·۱۹ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
همکاری انویدیا و اسکیلد ای‌آی در مدل بنیادی ربات S1
همکاری انویدیا و اسکیلد ای‌آی در مدل بنیادی ربات S1
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین استقرار تجاری موفق یک مدل بنیادی رباتیک که یادگیری در بستر متن را برای تسک‌های طولانی‌مدت (۱۰ دقیقه) پیاده کرده و نرخ موفقیت را در کارهای دیده‌نشده ۷ برابر افزایش داده است.

تصور کنید کافی است یک بار فیلم بگیرید که چگونه قهوه دم می‌کنید تا ربات شما در عرض چند دقیقه همان مهارت را یاد بگیرد. این دیگر یک رویای علمی-تخیلی نیست، بلکه واقعیت تجاری است که شرکت Skild AI با مدل S1 به آن دست یافته است. به گونه‌ای که اکنون یک نمایش ویدیویی ساده می‌تواند به ربات بیاموزد که چگونه یک کیت صنعتی را مونتاژ کند یا قهوه دم‌کردنی (Pour-over) آماده کند.

به نقل از گزارش ۱۰ سپتامبر ۲۰۲۶ شرکت انویدیا (NVIDIA)، این استارتاپ تنها ۱۰ ماه پس از اولین استقرار تجاری خود، به نرخ درآمد سالانه ۱۰۰ میلیون دلار رسید. این رشد خیره‌کننده در حالی رخ می‌دهد که اکثر ربات‌های صنعتی سنتی بر پایه برنامه‌نویسی صلب و خشک هستند؛ یعنی اگر قطعه‌ای تنها یک اینچ از جای خود جابه‌جا شود، کل سیستم شکست می‌خورد. اما Skild AI رویکرد «یادگیری از تجربه» را جایگزین کرده است. این رویکرد به ربات‌ها اجازه می‌دهد تا با محیط‌های پویا سازگار شوند و هوش مصنوعی را از آزمایشگاه‌های کنترل‌شده به کارخانه‌های پیش‌بینی‌ناپذیر منتقل کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بنیادی (Foundation Models) اشاره کردیم، هدف این است که هوش مصنوعی از محیط‌های آزمایشگاهی کنترل‌شده به دنیای پیش‌بینی‌ناپذیر کارخانه‌ها منتقل شود. مدل S1 — که شبیه به یک شاگرد تیزهوش است که با دیدن یک بار انجام کار، منطق آن را می‌فهمد — از مکانیزم یادگیری در بستر متن (In-Context Learning) استفاده می‌کند.

طبق مستندات منتشر شده در ۱۸ اوت ۲۰۲۶، مدل S1 به‌جای به‌روزرسانی وزن‌ها (Weights) یا گذراندن آموزش‌های خاص برای هر وظیفه، یک ویدیو از انسان در حال انجام یک کار را به‌عنوان «پرامپت» دریافت می‌کند. مدل ابتدا قصد (Intent) و توالی حرکات را تحلیل کرده و سپس آن اقدامات را بر روی سخت‌افزار خود نقشه‌برداری و پیاده می‌کند. این نخستین بار است که یک مدل بنیادی رباتیک، یادگیری در بستر متن را برای کارهای «طولانی‌مدت» (Long-horizon) تا ۱۰ دقیقه نمایش می‌دهد؛ سناریوهایی که مدل هرگز در مرحله پیش‌آموزش (Pretraining) با آن‌ها مواجه نشده بود. S1 قادر است کارهای ناآشنایی از جمله گلدانی کردن گیاهان، پختن پنکیک، دم کردن قهوه و مونتاژ کیت‌ها را انجام دهد. این وظایف شامل ده‌ها مرحله دست‌کاری (Manipulation) هستند و نیازمند ترکیب مهارت‌ها در توالی‌هایی هستند که مدل پیش از این هرگز اجرا نکرده است.

در یک تست واقعی برای گلدانی کردن گیاه، کل فرآیند از ضبط نمایش انسان تا اجرای خودکار ربات تنها ۱۱ دقیقه زمان برد. جزئیات زمانی این آزمایش بسیار دقیق بود: خاک، گلدان، آب‌پاش و گیاه در ساعت ۲۰:۵۴ به دفتر رسیدند؛ ضبط ویدیو در ۲۱:۱۶ آغاز شد؛ یک نمونه ویدیو از دید اول‌شخص (Egocentric) در ۲۱:۲۲ ضبط گردید و مدل S1 در ساعت ۲۱:۲۷ اجرای خودکار را شروع کرد.

نکته کلیدی این است که S1 صرفاً یک تقلید کورکورانه از مسیر حرکتی (Trajectory) نیست، بلکه با نمایش ویدیو به عنوان یک «مشخصات از هدف» (Specification of the goal) برخورد می‌کند. این قابلیت به مدل اجازه می‌دهد تا نمایش‌های ناقص یا دارای خطا را بهبود ببخشد. ربات می‌تواند زمانی که اشیایی در میانه‌ی کار جابه‌جا می‌شوند، خود را تطبیق داده و از خطاها بازیابی کند.

علاوه بر این، S1 می‌تواند اشیایی با «کارکرد مشابه» (Matched Affordance) را جایگزین کند. در یک مورد، ربات زمانی که در نمایش اصلی از آب‌پاش استفاده شده بود، اما آب‌پاش در دسترس نبود، از یک لیوان آب استفاده کرد. این انعطاف‌پذیری اجازه می‌دهد ربات حتی در صورت نبود ابزارهای دقیق ذکر شده در پرامپت، به کار خود ادامه دهد.

بر اساس گزارش‌های انویدیا، عملکرد S1 در مقایسه با سیاست‌های مبتنی بر دستورات متنی (Language-prompted policies) در کارهای چندمرحله‌ای دیده‌نشده بسیار برتر است. در یک مطالعه کنترل‌شده در برابر یک سیاست VLA مبتنی بر زبان — که هر دو روی داده‌ها، معماری‌ها و توان پردازشی یکسانی آموزش دیده بودند — نتایج تکان‌دهنده بود:

  • نرخ موفقیت: در ۱۰۰ هزار ساعت پیش‌آموزش، S1 در هر مرحله تقریباً ۶۶٪ موفق بود، در حالی که سیستم‌های متنی تنها ۹٪ موفقیت داشتند که نشان‌دهنده بهبود بیش از هفت برابری است.
  • وظایف پیش‌آموزش داده شده: در کارهایی که در طول آموزش دیده بودند، یادگیری در بستر متن در بزرگ‌ترین مقیاس به نرخ موفقیت ۹۶٪ رسید. در مقیاس ۱,۰۰۰ ساعت، سیاست شرطی‌شده با زبان ۵۳٪ و یادگیری در بستر متن ۴۳٪ امتیاز کسب کردند.
  • تغییر توزیع (Distribution Shift): در شرایط سخت که نیمی از اقدامات ربات باید با بازوی مخالف اجرا می‌شد، عملکرد سیاست‌های متنی تا سه برابر بیشتر از سیاست یادگیری در بستر متن افت کرد.
  • کارآمدی: تخمین زده می‌شود که یک ویدیوی یادگیری در بستر متن، جایگزین تقریباً ۳۸۰ اپیزود آموزش پس از استقرار شود. جمع‌آوری این ۳۸۰ نمایش طولانی‌مدت معمولاً ۵۰ تا ۱۰۰ ساعت عملیات از راه دور (Teleoperation) می‌طلبد. برای مقایسه، خط مبنای آموزش‌دیده (Post-trained baseline) برای رسیدن به موفقیت ۸۶٪ به ۲,۰۰۰ نمایش نیاز داشت.

این موفقیت مدیون استفاده از استک کامل انویدیا است. این همکاری شامل تولید داده‌های مصنوعی، آموزش مدل، شبیه‌سازی و استقرار فیزیکی AI در دنیای واقعی است:

  • مدیریت داده‌ها: NVIDIA Cosmos مدل‌های بنیادی دنیای باز را برای متنوع کردن داده‌های آموزشی و تبدیل ویدیو به توصیفات ساختاریافته فراهم می‌کند. ابزار Cosmos Curator نیز به برچسب‌گذاری، فیلتر کردن و سازماندهی این داده‌ها در مقیاس بالا کمک می‌کند.
  • شبیه‌سازی: کتابخانه‌های NVIDIA Omniverse و چارچوب Isaac Sim محیط‌های مجازی مبتنی بر فیزیک ایجاد می‌کنند تا موارد خاص (Edge cases) تست شده و رفتارها پیش از استقرار واقعی اعتبارسنجی شوند.
  • فیزیک و یادگیری: Skild از یادگیری تقویتی در Isaac Lab بهره می‌برد که توسط موتور فیزیک Newton پشتیبانی می‌شود. این سیستم پارامترهای فیزیکی مانند نیروها، تماس، برخورد و فشار را مدل‌سازی می‌کند تا «فاصله شبیه‌سازی تا واقعیت» (Sim-to-Reality Gap) کاهش یابد.
  • بهینه‌سازی: ابزارهای NVIDIA Nsight به مهندسان کمک می‌کنند تا گلوگاه‌های عملکردی را در حین آموزش پیدا کنند، در حالی که SDK TensorRT استنتاج (Inference) را بهینه می‌کند تا ربات‌ها در دنیای فیزیکی با سرعت پاسخ دهند.

در سطح تجاری، Skild بیش از ۶۰ شراکت استقرار در حوزه‌های تولید، لجستیک، بازرسی، امنیت و آماده‌سازی غذا ایجاد کرده است. این شامل همکاری با شرکت‌های ABB Robotics، Universal Robots و Mobile Industrial Robots است که در ۱۹ مارس ۲۰۲۶ اعلام شد.

یکی از برجسته‌ترین همکاری‌ها با شرکت Foxconn است. در این پروژه، «مغز Skild» روی بازوهای رباتیک دوگانه برای مونتاژ سیستم‌های NVIDIA Blackwell مستقر شده است. این گردش کار با دقت بالا شامل نصب یک باس‌بار (Busbar) و یک بلوک محدودکننده، بستن ۱۶ پیچ و در نهایت حذف بلوک محدودکننده است. سیستم باید با اختلالات سازگار شود و در صورتی که صحنه فیزیکی با برنامه متفاوت بود، خود را بازیابی کند. این امر نیازمند حرکت دقیق، کنترل آگاه از تماس (Contact-aware control) و ردیابی توالی است. برای این گردش کار خاص، مغز ربات با مقدار کمی داده‌های رباتیک تنظیم دقیق (Fine-tune) شده است.

برای مدیران کسب‌وکار، این یک چرخش راهبردی است: ربات‌ها از «ابزاری برای انجام یک کار خاص» به «نیروی کاری انعطاف‌پذیر» تبدیل می‌شوند. وقتی بتوان یک مهارت جدید کارخانه‌ای را از طریق یک ویدیوی گوشی موبایل به‌جای هفته‌ها کدنویسی مستقر کرد، سد ورود به اتوماسیون به‌شدت پایین می‌آید. اگر S1 واقعاً بتواند اشیا را بر اساس «کارکرد» جایگزین کند — مانند استفاده از لیوان در نبود آب‌پاش — وابستگی به محیط‌های صنعتی کاملاً سازمان‌یافته و سخت‌گیرانه به‌زودی از بین خواهد رفت.

گام بعدی شما

  • اگر در حوزه اتوماسیون صنعتی فعال هستید، مدل‌های VLA (بینایی-زبان-عمل) را دنبال کنید زیرا جایگزین برنامه‌نویسی سنتی رباتیک می‌شوند.
  • بررسی کنید که آیا زیرساخت‌های داده‌ای شما برای تبدیل ویدیوهای عملیاتی به داده‌های آموزشی آماده است یا خیر.
  • منتظر انتشار حل‌کننده‌های شبیه‌سازی شتاب‌یافته با GPU در موتور Newton باشید. این حل‌کننده‌ها که به‌طور مشترک توسط Skild و انویدیا توسعه یافته‌اند، به توسعه‌دهندگان اجازه می‌دهند نحوه لمس، گرفتن و دست‌کاری اشیای جامد توسط ربات‌ها را بهتر مدل‌سازی کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار زیرساختی انویدیا، ثابت می‌کند که مدل‌های بنیادی می‌توانند پیچیدگی‌های فیزیکی دنیا را بدون نیاز به برنامه‌نویسی دستی مدیریت کنند. این تغییر، مدل اقتصادی کارخانه‌ها را از خرید ربات‌های تخصصی به خرید «مغزهای یادگیرنده» تغییر می‌دهد.

تأثیر برای ایران

این تحول بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک در ایران اهمیت دارد تا بازار مصرف؛ چرا که دسترسی به سخت‌افزارهای انویدیا در مقیاس مورد نیاز Skild برای توسعه‌دهندگان داخلی محدود است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی آموزش‌های طولانی با یادگیری در بستر متن (In-Context Learning) در رباتیک، همان اتفاقی است که LLMها در متن ایجاد کردند. این یعنی ربات‌ها از «ابزارهای تک‌منظوره» به «عامل‌های عمومی» تبدیل می‌شوند که می‌توانند در محیط‌های غیرساختاریافته دوام بیاورند. حذف نیاز به هزاران نمونه داده برای هر تسک جدید، سرعت بازگشت سرمایه (ROI) در اتوماسیون صنعتی را به‌طور چشم‌گیر افزایش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.