پرش به محتوای اصلی
پرش به محتوای مقاله

سامانه HomeBody با دوقلوهای دیجیتال محیط‌های ناشناخته را پیمایش می‌کند

·۵ مهر ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
ربات انسان‌نمای HomeBody در حال تعامل با محیط خانگی و یادگیری فضای اطراف
ربات انسان‌نمای HomeBody در حال تعامل با محیط خانگی و یادگیری فضای اطراف
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل‌های CAD پیش‌ساخته با فرآیند Real2Sim؛ ربات اکنون خودش محیط را کاوش کرده و دوقلوی دیجیتال آن را برای استدلال VLM می‌سازد، نه اینکه نقشه‌ای را از انسان دریافت کند.

تصور کنید رباتی را که برای نخستین بار وارد خانه شما می‌شود و بدون هیچ نقشه‌ی قبلی، می‌داند کجا باید شیر خشک را پیدا کند و آن را روی میز بگذارد. این دیگر یک رویای علمی-تخیلی نیست، بلکه دستاورد جدیدی است که مرز بین استدلال سطح بالا و واقعیت فیزیکی را می‌شکند.

در ۲۶ سپتامبر ۲۰۲۶، پژوهشگران آزمایشگاه حرکت دانشگاه استنفورد (The Movement Lab at Stanford University) از سامانه‌ای به نام HomeBody پرده برداشتند. این سیستم به ربات‌های انسان‌نما اجازه می‌دهد محیط‌های ناشناخته را کاوش کرده و یک مدل داخلی از مکان اشیا بسازند تا حتی زمانی که هدف از دید خارج است، عملیات را ادامه دهند.

بسیاری از ربات‌ها در انجام کارهای «طولانی‌مدت» (long-horizon) شکست می‌خورند چون فقط به آنچه در لحظه در میدان دیدشان است واکنش نشان می‌دهند. برای مثال، اگر از یک ربات معمولی بخواهید دارویی را از اتاق دیگر بیاورد، به محض اینکه هدف از کادر دوربین خارج شود، ربات سردرگم شده و عملیات را متوقف می‌کند. HomeBody این مشکل را با ایجاد یک مدل مکانی پایدار حل می‌کند که اشیای مرئی را به مکان‌های به‌خاطر سپرده‌شده متصل می‌کند. این مدل داخلی به ربات کمک می‌کند تا درخواست‌های مبهم را رمزگشایی کرده و دقیقاً بداند کجا برود، با چه شیئی تعامل کند و چگونه توالی راه رفتن و دست‌ورزی را سازماندهی نماید.

این رویکرد از چرخه ساده‌ی «پرامپت و پاسخ» فراتر می‌رود. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی سرعت در مدل‌های زبانی مانند DeepSeek Flash اشاره کردیم، تمرکز در آنجا بر روی کارایی نرم‌افزاری بود، اما HomeBody بر روی اصطکاک‌های فیزیکی دنیای واقعی تمرکز دارد. این سیستم شکاف بین استدلال‌های انتزاعی سطح بالا و واقعیت‌های سخت و نامنظم — مثل گرفتن دسته‌ی یک کشو یا جلوگیری از برخورد با اشیاء — را پر می‌کند. HomeBody حافظه مکانی را با مهارت‌های ترکیب‌پذیر ادغام کرده و از بازخوردهای اجرایی استفاده می‌کند تا مدل بینایی-زبانی (VLM) بتواند در صورت شکست یک انتقال یا اقدام، تصمیم بعدی خود را بازبینی و اصلاح کند.

فرآیند استقرار در سه مرحله

طبق مستندات این پژوهش، HomeBody برای جلوگیری از حرکت کورکورانه و برخورد با دیوارها، از یک خط لوله (Pipeline) مشخص پیروی می‌کند:

  • کاوش: ربات ابتدا محیط را با استفاده از ترکیبی از ویدیوهای آیفون (با زوم 0.5×)، مشاهدات دوربین D435i و اسکن‌های LiDAR بررسی می‌کند. در این مرحله از SLAM (مکان‌یابی و نقشه‌برداری هم‌زمان) برای تثبیت زمینه مکانی بر اساس دیدگاه خود ربات استفاده می‌کند. در طول این فاز، HomeBody ژست‌های مفاصل و نقاط راه (waypoints) انتخاب شده توسط Astra را جمع‌آوری کرده و این مشاهدات را ذخیره می‌کند تا حتی زمانی که اشیاء از دید ربات خارج می‌شوند، زمینه محیطی حفظ شود.

  • بازسازی Real2Sim: ربات با کمک عاملی به نام Astra، داده‌های کاوش را به یک دوقلوی دیجیتال در محیط NVIDIA Isaac Sim تبدیل می‌کند. این کار به VLM اجازه می‌دهد بدون نیاز به نقشه‌هایی که توسط انسان ساخته شده باشند، درباره هندسه و معنای (semantics) اتاق استدلال کند. HomeBody با استفاده از هندسه اندازه‌گیری شده توسط SLAM برای محدود کردن ابعاد، به بازسازی بسیار دقیق‌تری دست می‌یابد تا عامل‌هایی که تنها بر اساس ظاهر ویدیو عمل می‌کنند و باید ابعاد را تخمین بزنند.

  • اجرای تکلیف: پس از ساخت دوقلوی دیجیتال، کاربر دستوری به زبان طبیعی مانند «آشپزخانه را مرتب کن» می‌دهد. ربات سپس توالی اقدامات خود را بر اساس نقشه می‌سازد. برای مثال، اگر به او گفته شود کیسه‌های قهوه را روی میز جزیره بگذارد و پاکت‌های فاسد را دور بریزد، HomeBody چندین سفر رفت‌وبرگشت، عملیات برداشتن و قرار دادن را در سراسر اتاق هماهنگ می‌کند.

استدلال مکانی و شناسایی هدف

برای کار در یک خانه واقعی، HomeBody باید مشکل مکان‌یابی و شناسایی هدف را حل کند. این سیستم از Super Odometry برای مکان‌یابی ربات انسان‌نمای G1 استفاده می‌کند و نقشه SLAM را با استفاده از ثبت «نزدیک‌ترین نقطه تکراری» (ICP registration) با شبیه‌سازی بازسازی‌شده هم‌راستا می‌کند. این فرآیند یک چارچوب مختصاتی مشترک ایجاد می‌کند که در آن مشاهدات دوربین (ego camera) و محتوای توصیفی ذخیره می‌شوند.

این زمینه مکانی برای کارهایی که هدف در ابتدا دیده نمی‌شود، حیاتی است. در سناریوی «بازیابی دارو»، HomeBody از فریم‌های کلیدی ذخیره‌شده برای مکان‌یابی یک کشو استفاده می‌کند، با دست راست دسته‌ی کشو را باز کرده و سپس از دست چپ خود برای دور ریختن یک پاکت فاسد استفاده می‌کند. قابلیت انتخاب بین دو بازو به ربات اجازه می‌دهد تا به اهدافی که در هر دو طرف بدنش قرار دارند، به‌طور بهینه و سریع دسترسی داشته باشد.

کتابخانه مهارت‌های ترکیب‌پذیر

به جای استفاده از یک شبکه عصبی غول‌پیکر که سعی کند هر مفصل را به طور مجزا کنترل کند، HomeBody از کتابخانه‌ای از مهارت‌های مجزا و قابل استفاده مجدد بهره می‌برد. VLM در اینجا نقش مدیر را دارد و این ابزارها را از طریق یک رابط ساختاریافته فراخوانی می‌کند. این مهارت‌ها رابط مشترکی برای اهداف و نتایج اجرا دارند که به VLM اجازه می‌دهد آن‌ها را برای تکالیف جدید به هم زنجیر کند:

  • ناوبری: دنبال کردن یک مسیر برنامه‌ریزی‌شده به یک هدف دوبعدی و یک نقطه رو-به-رو در مختصات نقشه که بر حسب متر اندازه‌گیری می‌شود.
  • برداشتن: استفاده از قطعه‌بندی و Fast-FoundationStereo برای تخمین عمق از تصاویر استریو D435i. VLM یک نقطه تصویر (نرمال شده بین ۰ تا ۱۰۰۰) و دست مورد استفاده را مشخص می‌کند. سپس سیستم گیره (grasp) را به صورت تحلیلی پیش‌بینی کرده و از یک برنامه‌ریز بازو برای ساخت یک مرجع اسپلاین (spline) با زمان‌بندی کمترین تکان (minimum-jerk) و سینماتیک معکوس استفاده می‌کند.
  • قرار دادن: انتقال شیء نگه داشته شده به یک هدف رهاسازی سه‌بعدی مشخص در چارچوب تنه ربات، با تعیین دست و فاصله رهاسازی.
  • باز کردن کشو: یک توالی پیچیده که در آن ربات ابتدا بصری با دسته تراز می‌شود، آن را قلاب کرده و سپس به عقب راه می‌رود تا کشو را باز کند.
  • برداشتن از کشو: مهارتی تخصصی برای رسیدن به داخل یک کشوی باز و بلند کردن اشیاء به گونه‌ای که از لبه کشو عبور کنند.

مدیریت شکست و قوانین فیزیک

در رباتیک واقعی، شکست یک اصل است. HomeBody این موضوع را از طریق یک حلقه بازخورد مدیریت می‌کند که در آن نتیجه اجرا به VLM بازگردانده می‌شود. برای مدیریت اهدافی که با نزدیک شدن ربات در کادر دوربین جابه‌جا می‌شوند، سیستم ردیابی SAM 2.1 را با انتخاب حافظه SAMURAI ترکیب می‌کند. این قابلیت اجازه می‌دهد ربات از «سروو-کنترل بصری» (visual servoing) برای اصلاح تراز در حین نزدیک شدن استفاده کند، بدون اینکه برای هر تنظیم کوچک به تصمیم جدید VLM نیاز باشد.

اگر یک عملیات برداشتن بدون تماس با شیء بسته شود، مهارت «برداشتن» می‌تواند کاندیدای دیگری برای گیره را امتحان کند یا وضعیت ایستادن خود را تغییر داده و دوباره برنامه‌ریزی کند. این تلاش‌های مجدد محلی محدود هستند. اگر راه recovery به پایان برسد، مهارت دلیل دقیق شکست را به VLM گزارش می‌دهد. سپس VLM تصمیم می‌گیرد که آیا موقعیت ربات را تغییر دهد، هدف دیگری را انتخاب کند یا کل برنامه را عوض نماید.

برای حفظ تعادل در طول این حرکات، از AMO (بهینه‌سازی حرکت تطبیقی) برای کنترل پایین‌تنه با آگاهی از وضعیت بالاتنه استفاده می‌شود. این امر تضمین می‌کند که پایین‌تنه ربات، اهداف بازو را در هنگام دست‌ورزی لحاظ کند. دستورات بازو و دست با فرکانس ۲۵۰ هرتز اجرا می‌شوند، در حالی که سیاست AMO هر ۵ تیک یک‌بار (در فرکانس ۵۰ هرتز) به‌روزرسانی می‌شود.

محدودیت‌های سخت‌افزاری و محاسباتی

به نقل از گزارش استنفورد، این سیستم روی یک پشته محاسباتی ترکیبی اجرا می‌شود. ادراک محلی، برنامه‌ریزی حرکت و اجرای مهارت‌ها توسط یک لپ‌تاپ Razer Blade مجهز به GPU RTX 4090 مدیریت می‌شود. استدلال سطح بالا به‌صورت دورکار توسط GPT Astra انجام می‌گیرد که درخواست‌های مهارت و اهداف را به لپ‌تاپ ارسال کرده و نتایج اجرا را دریافت می‌کند.

با این حال، پژوهشگران به چندین محدودیت فیزیکی و فنی اشاره کرده‌اند:

  • استقامت سخت‌افزاری: احتمال داغ شدن بیش از حد سرووهای انگشت در عملیات‌های طولانی‌مدت.
  • تأخیر: تأخیر در استدلال GPT Astra باعث ایجاد مکث‌های محسوس بین مهارت‌های مجزا می‌شود.
  • هزینه‌های راه‌اندازی: فرآیند Real2Sim زمان راه‌اندازی قابل‌توجه و هزینه‌های API زیادی را پیش از شروع تکلیف ربات تحمیل می‌کند.
  • محاسبات: پشته محلی فعلی به RTX 4090 نیاز دارد؛ مدل‌های ادراکی سنگین‌تر به توان محاسباتی بیشتری نیاز خواهند داشت.

این معماری، بار رباتیک را از اسکریپت‌نویسی دستی به یادگیری محیطی منتقل می‌کند. با اجازه دادن به ربات برای «شناسایی» محیط خود، پژوهشگران نیاز به مدل‌های دقیق و پیش‌بارگذاری شده CAD از هر خانه را از بین برده‌اند.

برای کاربر نهایی، این به معنای رباتی است که فقط یک مسیر را دنبال نمی‌کند، بلکه درک می‌کند که «شیر فاسد» در یخچال است و «کیسه‌های قهوه» متعلق به میز جزیره هستند، حتی اگر برای جابه‌جایی بین این دو، مجبور شود پشتش را به هر دوی آن‌ها کند.

منتظر باشید تا ببینید چگونه این خط لوله Real2Sim با مدل‌های استدلالی جدیدتر و سریع‌تر ترکیب می‌شود تا مکث‌های فعلی بین اقدامات فیزیکی حذف گردند.

گام بعدی شما

  • بررسی نحوه ترکیب مدل‌های استدلالی سریع‌تر برای حذف تأخیرهای فعلی در حرکات فیزیکی.
  • مطالعه درباره استانداردهای جدید SLAM برای بهبود دقت دوقلوهای دیجیتال در محیط‌های متراکم.
  • دنبال کردن پیشرفت‌های مدل‌های VLM در درک هندسی اشیا برای کاهش خطای برداشتن.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی دانشگاه استنفورد، اثبات می‌کند که ربات‌ها می‌توانند بدون نقشه‌های پیش‌ساخته در محیط‌های پویا عمل کنند. این تغییر پارادایم، مسیر تجاری‌سازی ربات‌های خدمت‌رسان خانگی را از محیط‌های کنترل‌شده به خانه‌های واقعی نزدیک‌تر می‌کند.

تأثیر برای ایران

این پژوهش بیشتر برای محققان رباتیک و هوش مصنوعی در ایران اهمیت دارد تا بازار مصرف؛ چرا که چارچوب‌های Open-source مشابه این سیستم می‌تواند در توسعه ربات‌های خدماتی داخلی به کار رود.

·نگاه ما
تحریریه دات‌هوش

انتقال از اسکریپت‌نویسی سخت به یادگیری محیطی از طریق دوقلوهای دیجیتال، نقطه عطفی در رباتیک خانگی است. HomeBody نشان می‌دهد که کلید موفقیت ربات‌های انسان‌نما نه در افزایش قدرت پردازشی صرف، بلکه در ایجاد یک لایه میانجی (Real2Sim) است که دنیای فیزیکی را برای مدل‌های زبانی قابل‌فهم می‌کند. این رویکرد احتمالاً باعث می‌شود در آینده ربات‌ها به‌جای دریافت دستورات گام‌به‌گام، اهداف کلی را دریافت کرده و استراتژی پیمایش را خودشان استخراج کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.