پرش به محتوای اصلی
پرش به محتوای مقاله

درون معماری Helix 2.5 برای حذف آموزش محیطی در ربات‌های انسان‌نما

·۲۷ شهریور ۱۴۰۵۵ دقیقه مطالعه
شکل ۱: معرفی هلیکس ۲.۵، آزمایش‌شده بدون داده آموزشی در ۳۰ خانه ناشناخته
شکل ۱: معرفی هلیکس ۲.۵، آزمایش‌شده بدون داده آموزشی در ۳۰ خانه ناشناخته
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین نمایش موفق تعمیم‌پذیری کل-بدن (Whole-body generalization) در مقیاس وسیع؛ مدل بدون آموزش در محیط جدید، نرخ موفقیت را از ۹٪ به ۵۶٪ رساند.

تصور کنید رباتی را بخرید که بدون نیاز به هفته‌ها یادگیری درباره‌ی چیدمان خانه شما، از همان لحظه اول بتواند تخت را مرتب کند یا اسباب‌بازی‌ها را جمع کند. این رویای «استقرار فوری» اکنون با نرخ موفقیت ۵۶ درصدی در محیط‌های کاملاً ناشناخته به واقعیت نزدیک‌تر شده است.

طبق اعلام شرکت Figure در ۱۷ سپتامبر ۲۰۲۶، ربات‌های این شرکت اکنون می‌توانند در خانه‌هایی که هرگز در داده‌های آموزشی‌شان نبوده‌اند، کارهای خانه را انجام دهند. این دستاورد یک جهش بزرگ در تعمیم‌پذیری (Generalization) — یعنی توانایی مدل برای به‌کارگیری آموخته‌هایش در شرایط جدید — است. این نرخ موفقیت ۵۶ درصدی برای ربات‌های انسان‌نما در مرتب کردن اتاق‌های پذیرایی یا مرتب کردن تخت در خانه‌هایی که کاملاً ناشناخته هستند و بدون استفاده از داده‌های محلی به دست آمده است.

بیشتر ربات‌های امروز بسیار شکننده هستند؛ اگر رنگ مبل تغییر کند یا حوله کمی متفاوت تا شود، آن‌ها شکست می‌خورند. برای حل این مشکل، Figure از یادگیری محیط‌محور (Site-specific learning) — جایی که ربات فقط در اتاقی که قرار است در آن کار کند یاد می‌گیرد — فاصله گرفت و به سمت مدل بنیادی (Foundation Model) حرکت کرد. این تغییر رویکرد، حرکت فیزیکی را مانند زبان می‌بیند؛ جایی که مدل ابتدا «دستور زبان» رفتار انسانی را یاد می‌گیرد، پیش از آنکه هرگز وارد یک خانه خاص شود.

زمینه و تکامل

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های فیزیکی اشاره کردیم، چالش اصلی همواره انتقال از محیط‌های آزمایشگاهی کنترل‌شده به دنیای واقعی بوده است. سیستم‌های قدیمی‌تر مانند Helix 02 می‌توانستند کنترل کل بدن را در بازه‌های زمانی طولانی هماهنگ کنند. این قابلیت‌ها شامل کارهایی مانند خالی کردن ماشین ظرف‌شویی و اجرای وظایف لجستیکی خودمختار به مدت ۲۰۰ ساعت بود. با این حال، Helix 02 به داده‌هایی متکی بود که دقیقاً در مکان‌های عملیاتی ربات جمع‌آوری شده بودند.

مدل Helix 2.5 نشان‌دهنده یک گسست از این مسیر است. برخلاف نسل قبلی که از یک مدل پیش‌آموزش‌دیده بینایی-زبانی (Vision-Language Model) شروع می‌کرد، Helix 2.5 کاملاً از یک مقداردهی اولیه تصادفی (Random Initialization) و صرفاً بر روی مجموعه داده Index پیش‌آموزش دیده است. شرکت Figure این مدل را پیشرفته‌ترین شبکه عصبی می‌نامد که تا به حال ساخته است.

در مرکز این پیشرفت، Helix 2.5 قرار دارد؛ یک شبکه عصبی (Neural Network) — شبکه‌ای از سلول‌های کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب می‌رساند — که روی مجموعه داده Index پیش‌آموزش (Pretraining) دیده است. بر اساس مستندات شرکت، این پیش‌آموزش باعث شد نرخ موفقیت زیرو-شات (Zero-shot) — یعنی انجام کار بدون دیدن نمونه قبلی در آن محیط — از ۹٪ به ۵۶٪ برسد، در حالی که یک سیاست (Policy) مشابه که از صفر آموزش دیده بود، تنها ۹٪ موفقیت داشت. این ربات در ۳۰ خانه مختلف در منطقه خلیج سان‌فرانسیسکو آزمایش شد و از مبلمان و رختخواب‌های موجودی استفاده کرد که هرگز در داده‌های آموزشی مدل ظاهر نشده بودند.

معیارهای عملکرد

شرکت Figure سیستم را بر اساس سه رفتار خاص در سطح کل بدن ارزیابی کرد:

  • مرتب‌سازی پذیرایی: جمع کردن ۱۳ تا ۱۵ اسباب‌بازی پراکنده و قرار دادن آن‌ها در یک سبد. برای هر اسباب‌بازی یک مهلت زمانی یک دقیقه‌ای در نظر گرفته شد و در صورت عدم موفقیت، عملیات متوقف می‌شد.
  • تا کردن حوله: برداشتن و تا کردن حوله‌ها با این شرط سخت‌گیرانه که برای دریافت بالاترین نمره، گوشه‌ها باید در فاصله یک اینچ با هم تراز شوند. برای هر حوله یک مهلت زمانی سه دقیقه‌ای اعمال شد.
  • مرتب کردن تخت: صاف کردن روتختی و قرار دادن بالش‌ها در یک‌سوم بالای تخت. بالش‌ها بر اساس جهت قرارگیری نمره شدند و برای هر بالش و هر طرف روتختی، مهلت یک دقیقه‌ای تعیین شد.

سخت‌گیری در ارزیابی

برای اطمینان از اینکه نتایج اتفاقی نبوده است، Figure از یک نقطه بازرسی (Checkpoint) واحد و ثابت در تمام ۳۰ خانه استفاده کرد. هیچ‌یک از وزن‌های مدل برای محیط‌های خاص تطبیق داده نشد و از داده‌های عملیاتی ارزیابی برای انتخاب نقطه بازرسی استفاده نشد. هرگونه دخالت انسانی برای حفظ ایمنی، منجر به ثبت نمره شکست فوری می‌شد.

موفقیت زیرو-شات به‌طور سخت‌گیرانه‌ای تعریف شد. هیچ اسباب‌بازی، حوله یا رختخوابی که در ارزیابی استفاده شد، در داده‌های مربوط به مشخصات تکلیف (Task-specification data) وجود نداشت. یک مدل هوش مصنوعی و بازبین‌های انسانی تأیید کردند که اشیاء به‌کار رفته در ۳۰ خانه در داده‌های آموزشی حضور نداشتند. موفقیت مستلزم تکمیل کامل تکلیف بود و هیچ نمره جزئی برای کارهای نیمه‌تمام داده نشد.

جداسازی اثر Index

برای اثبات تأثیر مجموعه داده Index، شرکت Figure یک آزمایش کنترل‌شده انجام داد. آن‌ها دو سیاست را روی داده‌های مشخصات تکلیف یکسان آموزش دادند: یکی با وزن‌های تصادفی و دیگری با مدل پیش‌آموزش‌دیده Helix 2.5. تمام متغیرهای دیگر از جمله معماری، بهینه‌سازی و هایپرپارامترها ثابت نگه داشته شدند.

در ارزیابی‌های کور (Blind evaluations)، سیاستی که از صفر آموزش دیده بود تنها در ۹٪ از تلاش‌های زیرو-شات موفق شد. در مقابل، سیاست پیش‌آموزش‌دیده با Index به نرخ ۵۶٪ رسید که شکافی بیش از شش برابر است. Figure اشاره کرد که هیچ تکلیفی در ارزیابی، بیش از ۱.۹۰٪ از کل مجموعه داده پیش‌آموزش Index را تشکیل نمی‌داد؛ این موضوع نشان می‌دهد که این اولین نمایش تعمیم‌پذیری کل-بدن زیرو-شات در این مقیاس روی یک ربات انسان‌نما است.

موتور داده‌ای Index

هوش Helix 2.5 از Index می‌آید، یک تلاش عظیم برای جمع‌آوری داده که در ۲۵ اوت ۲۰۲۶ از حالت مخفی خارج شد. این مجموعه داده توسط یک اپلیکیشن سازنده (Creator app) تغذیه می‌شود که بیش از ۲۶۴ هزار دانلود در ۱۰۸ کشور دارد و بیش از ۴۴ هزار کاربر فعال هفتگی آن را تشکیل می‌دهند:

  • مقیاس: بیش از ۱۶ میلیون ویدیو توسط سازندگان آپلود شده و ۱۵ میلیون دلار به آن‌ها پرداخت شده است.
  • توان عملیاتی: سیستم تقریباً هر ثانیه ۳۵ دقیقه تجربه انسانی جدید را پردازش می‌کند.
  • تنوع: در هر ۱۰۰۰ ساعت داده جمع‌آوری شده، Index شامل ۳۷۳ تکلیف منحصربه‌فرد، ۱۱۴۶ شیء دستکاری‌شده منحصربه‌فرد و ۱۱۶ محیط منحصربه‌فرد است.
  • خط لوله (Pipeline): داده‌ها از یک فرآیند پنج مرحله‌ای شامل فیلتر کردن، بررسی تقلب، حذف موارد تکراری، بازتعادل (Rebalancing) و حاشیه‌نویسی (Annotation) عبور می‌کنند.

بهره‌وری داده‌ها و مقیاس‌پذیری

شرکت Figure مبلغ ۳.۵ میلیارد دلار برای محاسبات (Compute) آموزش Helix اختصاص داده است. این شرکت همچنین یک «قانون مقیاس‌پذیری انتقال» (Transfer Scaling Law) را گزارش کرد؛ آن‌ها چهار مدل را روی زیرمجموعه‌های تودرتوی Index آموزش دادند که شامل افزایش ۸ برابری داده‌ها بود. آن‌ها دریافتند که خطای پیش‌بینی اکشن (Action-prediction loss) با هر دو برابر شدن داده‌ها، به‌طور پیش‌بینی‌پذیری کاهش می‌یابد.

شرکت Figure از اجراهای کوچک‌تر استفاده کرد تا خطای تست بزرگ‌ترین اجرا را تا چهار رقم اعشار پیش از شروع آموزش پیش‌بینی کند، در حالی که خطای پیش‌بینی تنها ۰.۵۴٪ از تغییرات در محدوده ۸ برابری بود. این دستاورد به عنوان اولین قانون مقیاس‌پذیری انتقال انسان-به-ربات اندازه‌گیری شده روی یک انسان‌نما توصیف شده است.

برای یک صاحب کسب‌وکار یا خانه، این یعنی «شکاف استقرار» در حال بسته شدن است. Helix 2.5 توانست با نرخ موفقیت مشابه یک سیاست Helix 02 که مستقیماً در محیط آموزش دیده بود، اما با استفاده از نیمی از داده‌های انطباقی، به این نتیجه برسد. توانایی ربات در اصلاح خود — مثلاً عقب رفتن برای تغییر زاویه، تغییر حالت ایستادن یا دور زدن تخت برای درست کردن یک تا — نشان‌دهنده شهود فیزیکی است که پیش از این در هوش مصنوعی انسان‌نما وجود نداشت.

این انتقال از آزمایشگاه به واقعیتِ به‌هم‌ریخته‌ی ۳۰ خانه مختلف ثابت می‌کند که هوش فیزیکی عمومی، بیش از آنکه یک مشکل مکانیکی باشد، یک مسئله مقیاس‌پذیری داده است. برنده این رقابت کسی خواهد بود که جامع‌ترین کتابخانه از حرکات انسانی را در اختیار داشته باشد. این رویکرد داده‌محور برای تسریع ورود ربات‌ها به بازار، مشابه استراتژی‌هایی است که شرکت Skild AI برای استقرار سریع مدل‌های هوشمند خود به کار گرفته است.

منتظر گام بعدی Figure در استخدام متخصصان هوش فیزیکی عمومی باشید، زیرا این شرکت به دنبال انتقال این قابلیت‌ها از نمونه‌های اولیه خانگی به لجستیک صنعتی است.

گام بعدی شما

  • بررسی مدل‌های Open-source در حوزه رباتیک برای درک نحوه پیاده‌سازی سیاست‌های کنترلی.
  • دنبال کردن گزارش‌های مربوط به انتقال این قابلیت‌ها از محیط خانه به لجستیک صنعتی.
  • تحلیل اثر داده‌های تولیدشده توسط کاربر (User-generated data) بر سرعت آموزش مدل‌های فیزیکی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های واقعی انسانی، ربات‌ها را از محیط‌های استریل آزمایشگاهی به محیط‌های متغیر خانگی می‌برد. این تغییر، پیش‌نیاز اصلی برای تجاری‌سازی ربات‌های خدمت‌رسان در مقیاس انبوه است.

تأثیر برای ایران

این تحول در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد و بیشتر برای پژوهشگران مدل‌های بنیادی رباتیک اهمیت دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز Figure بر جمع‌آوری داده‌های انسانی در مقیاس وسیع نشان می‌دهد که رباتیک در حال تکرار مسیر LLMهاست؛ یعنی عبور از مهندسی دستیِ رفتارها به سمت یادگیری آماری از حجم عظیم داده. این رویکرد احتمالاً باعث می‌شود تخصص در «طراحی حرکت» جای خود را به تخصص در «مدیریت داده‌های فیزیکی» بدهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.