تصور کنید رباتی را که برای نخستین بار وارد خانه شما میشود و بدون هیچ نقشهی قبلی، میداند کجا باید شیر خشک را پیدا کند و آن را روی میز بگذارد. این دیگر یک رویای علمی-تخیلی نیست، بلکه دستاورد جدیدی است که مرز بین استدلال سطح بالا و واقعیت فیزیکی را میشکند.
در ۲۶ سپتامبر ۲۰۲۶، پژوهشگران آزمایشگاه حرکت دانشگاه استنفورد (The Movement Lab at Stanford University) از سامانهای به نام HomeBody پرده برداشتند. این سیستم به رباتهای انساننما اجازه میدهد محیطهای ناشناخته را کاوش کرده و یک مدل داخلی از مکان اشیا بسازند تا حتی زمانی که هدف از دید خارج است، عملیات را ادامه دهند.
بسیاری از رباتها در انجام کارهای «طولانیمدت» (long-horizon) شکست میخورند چون فقط به آنچه در لحظه در میدان دیدشان است واکنش نشان میدهند. برای مثال، اگر از یک ربات معمولی بخواهید دارویی را از اتاق دیگر بیاورد، به محض اینکه هدف از کادر دوربین خارج شود، ربات سردرگم شده و عملیات را متوقف میکند. HomeBody این مشکل را با ایجاد یک مدل مکانی پایدار حل میکند که اشیای مرئی را به مکانهای بهخاطر سپردهشده متصل میکند. این مدل داخلی به ربات کمک میکند تا درخواستهای مبهم را رمزگشایی کرده و دقیقاً بداند کجا برود، با چه شیئی تعامل کند و چگونه توالی راه رفتن و دستورزی را سازماندهی نماید.
این رویکرد از چرخه سادهی «پرامپت و پاسخ» فراتر میرود. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی سرعت در مدلهای زبانی مانند DeepSeek Flash اشاره کردیم، تمرکز در آنجا بر روی کارایی نرمافزاری بود، اما HomeBody بر روی اصطکاکهای فیزیکی دنیای واقعی تمرکز دارد. این سیستم شکاف بین استدلالهای انتزاعی سطح بالا و واقعیتهای سخت و نامنظم — مثل گرفتن دستهی یک کشو یا جلوگیری از برخورد با اشیاء — را پر میکند. HomeBody حافظه مکانی را با مهارتهای ترکیبپذیر ادغام کرده و از بازخوردهای اجرایی استفاده میکند تا مدل بینایی-زبانی (VLM) بتواند در صورت شکست یک انتقال یا اقدام، تصمیم بعدی خود را بازبینی و اصلاح کند.
فرآیند استقرار در سه مرحله
طبق مستندات این پژوهش، HomeBody برای جلوگیری از حرکت کورکورانه و برخورد با دیوارها، از یک خط لوله (Pipeline) مشخص پیروی میکند:
کاوش: ربات ابتدا محیط را با استفاده از ترکیبی از ویدیوهای آیفون (با زوم 0.5×)، مشاهدات دوربین D435i و اسکنهای LiDAR بررسی میکند. در این مرحله از SLAM (مکانیابی و نقشهبرداری همزمان) برای تثبیت زمینه مکانی بر اساس دیدگاه خود ربات استفاده میکند. در طول این فاز، HomeBody ژستهای مفاصل و نقاط راه (waypoints) انتخاب شده توسط Astra را جمعآوری کرده و این مشاهدات را ذخیره میکند تا حتی زمانی که اشیاء از دید ربات خارج میشوند، زمینه محیطی حفظ شود.
بازسازی Real2Sim: ربات با کمک عاملی به نام Astra، دادههای کاوش را به یک دوقلوی دیجیتال در محیط NVIDIA Isaac Sim تبدیل میکند. این کار به VLM اجازه میدهد بدون نیاز به نقشههایی که توسط انسان ساخته شده باشند، درباره هندسه و معنای (semantics) اتاق استدلال کند. HomeBody با استفاده از هندسه اندازهگیری شده توسط SLAM برای محدود کردن ابعاد، به بازسازی بسیار دقیقتری دست مییابد تا عاملهایی که تنها بر اساس ظاهر ویدیو عمل میکنند و باید ابعاد را تخمین بزنند.
اجرای تکلیف: پس از ساخت دوقلوی دیجیتال، کاربر دستوری به زبان طبیعی مانند «آشپزخانه را مرتب کن» میدهد. ربات سپس توالی اقدامات خود را بر اساس نقشه میسازد. برای مثال، اگر به او گفته شود کیسههای قهوه را روی میز جزیره بگذارد و پاکتهای فاسد را دور بریزد، HomeBody چندین سفر رفتوبرگشت، عملیات برداشتن و قرار دادن را در سراسر اتاق هماهنگ میکند.
استدلال مکانی و شناسایی هدف
برای کار در یک خانه واقعی، HomeBody باید مشکل مکانیابی و شناسایی هدف را حل کند. این سیستم از Super Odometry برای مکانیابی ربات انساننمای G1 استفاده میکند و نقشه SLAM را با استفاده از ثبت «نزدیکترین نقطه تکراری» (ICP registration) با شبیهسازی بازسازیشده همراستا میکند. این فرآیند یک چارچوب مختصاتی مشترک ایجاد میکند که در آن مشاهدات دوربین (ego camera) و محتوای توصیفی ذخیره میشوند.
این زمینه مکانی برای کارهایی که هدف در ابتدا دیده نمیشود، حیاتی است. در سناریوی «بازیابی دارو»، HomeBody از فریمهای کلیدی ذخیرهشده برای مکانیابی یک کشو استفاده میکند، با دست راست دستهی کشو را باز کرده و سپس از دست چپ خود برای دور ریختن یک پاکت فاسد استفاده میکند. قابلیت انتخاب بین دو بازو به ربات اجازه میدهد تا به اهدافی که در هر دو طرف بدنش قرار دارند، بهطور بهینه و سریع دسترسی داشته باشد.
کتابخانه مهارتهای ترکیبپذیر
به جای استفاده از یک شبکه عصبی غولپیکر که سعی کند هر مفصل را به طور مجزا کنترل کند، HomeBody از کتابخانهای از مهارتهای مجزا و قابل استفاده مجدد بهره میبرد. VLM در اینجا نقش مدیر را دارد و این ابزارها را از طریق یک رابط ساختاریافته فراخوانی میکند. این مهارتها رابط مشترکی برای اهداف و نتایج اجرا دارند که به VLM اجازه میدهد آنها را برای تکالیف جدید به هم زنجیر کند:
- ناوبری: دنبال کردن یک مسیر برنامهریزیشده به یک هدف دوبعدی و یک نقطه رو-به-رو در مختصات نقشه که بر حسب متر اندازهگیری میشود.
- برداشتن: استفاده از قطعهبندی و Fast-FoundationStereo برای تخمین عمق از تصاویر استریو D435i. VLM یک نقطه تصویر (نرمال شده بین ۰ تا ۱۰۰۰) و دست مورد استفاده را مشخص میکند. سپس سیستم گیره (grasp) را به صورت تحلیلی پیشبینی کرده و از یک برنامهریز بازو برای ساخت یک مرجع اسپلاین (spline) با زمانبندی کمترین تکان (minimum-jerk) و سینماتیک معکوس استفاده میکند.
- قرار دادن: انتقال شیء نگه داشته شده به یک هدف رهاسازی سهبعدی مشخص در چارچوب تنه ربات، با تعیین دست و فاصله رهاسازی.
- باز کردن کشو: یک توالی پیچیده که در آن ربات ابتدا بصری با دسته تراز میشود، آن را قلاب کرده و سپس به عقب راه میرود تا کشو را باز کند.
- برداشتن از کشو: مهارتی تخصصی برای رسیدن به داخل یک کشوی باز و بلند کردن اشیاء به گونهای که از لبه کشو عبور کنند.
مدیریت شکست و قوانین فیزیک
در رباتیک واقعی، شکست یک اصل است. HomeBody این موضوع را از طریق یک حلقه بازخورد مدیریت میکند که در آن نتیجه اجرا به VLM بازگردانده میشود. برای مدیریت اهدافی که با نزدیک شدن ربات در کادر دوربین جابهجا میشوند، سیستم ردیابی SAM 2.1 را با انتخاب حافظه SAMURAI ترکیب میکند. این قابلیت اجازه میدهد ربات از «سروو-کنترل بصری» (visual servoing) برای اصلاح تراز در حین نزدیک شدن استفاده کند، بدون اینکه برای هر تنظیم کوچک به تصمیم جدید VLM نیاز باشد.
اگر یک عملیات برداشتن بدون تماس با شیء بسته شود، مهارت «برداشتن» میتواند کاندیدای دیگری برای گیره را امتحان کند یا وضعیت ایستادن خود را تغییر داده و دوباره برنامهریزی کند. این تلاشهای مجدد محلی محدود هستند. اگر راه recovery به پایان برسد، مهارت دلیل دقیق شکست را به VLM گزارش میدهد. سپس VLM تصمیم میگیرد که آیا موقعیت ربات را تغییر دهد، هدف دیگری را انتخاب کند یا کل برنامه را عوض نماید.
برای حفظ تعادل در طول این حرکات، از AMO (بهینهسازی حرکت تطبیقی) برای کنترل پایینتنه با آگاهی از وضعیت بالاتنه استفاده میشود. این امر تضمین میکند که پایینتنه ربات، اهداف بازو را در هنگام دستورزی لحاظ کند. دستورات بازو و دست با فرکانس ۲۵۰ هرتز اجرا میشوند، در حالی که سیاست AMO هر ۵ تیک یکبار (در فرکانس ۵۰ هرتز) بهروزرسانی میشود.
محدودیتهای سختافزاری و محاسباتی
به نقل از گزارش استنفورد، این سیستم روی یک پشته محاسباتی ترکیبی اجرا میشود. ادراک محلی، برنامهریزی حرکت و اجرای مهارتها توسط یک لپتاپ Razer Blade مجهز به GPU RTX 4090 مدیریت میشود. استدلال سطح بالا بهصورت دورکار توسط GPT Astra انجام میگیرد که درخواستهای مهارت و اهداف را به لپتاپ ارسال کرده و نتایج اجرا را دریافت میکند.
با این حال، پژوهشگران به چندین محدودیت فیزیکی و فنی اشاره کردهاند:
- استقامت سختافزاری: احتمال داغ شدن بیش از حد سرووهای انگشت در عملیاتهای طولانیمدت.
- تأخیر: تأخیر در استدلال GPT Astra باعث ایجاد مکثهای محسوس بین مهارتهای مجزا میشود.
- هزینههای راهاندازی: فرآیند Real2Sim زمان راهاندازی قابلتوجه و هزینههای API زیادی را پیش از شروع تکلیف ربات تحمیل میکند.
- محاسبات: پشته محلی فعلی به RTX 4090 نیاز دارد؛ مدلهای ادراکی سنگینتر به توان محاسباتی بیشتری نیاز خواهند داشت.
این معماری، بار رباتیک را از اسکریپتنویسی دستی به یادگیری محیطی منتقل میکند. با اجازه دادن به ربات برای «شناسایی» محیط خود، پژوهشگران نیاز به مدلهای دقیق و پیشبارگذاری شده CAD از هر خانه را از بین بردهاند.
برای کاربر نهایی، این به معنای رباتی است که فقط یک مسیر را دنبال نمیکند، بلکه درک میکند که «شیر فاسد» در یخچال است و «کیسههای قهوه» متعلق به میز جزیره هستند، حتی اگر برای جابهجایی بین این دو، مجبور شود پشتش را به هر دوی آنها کند.
منتظر باشید تا ببینید چگونه این خط لوله Real2Sim با مدلهای استدلالی جدیدتر و سریعتر ترکیب میشود تا مکثهای فعلی بین اقدامات فیزیکی حذف گردند.
گام بعدی شما
- بررسی نحوه ترکیب مدلهای استدلالی سریعتر برای حذف تأخیرهای فعلی در حرکات فیزیکی.
- مطالعه درباره استانداردهای جدید SLAM برای بهبود دقت دوقلوهای دیجیتال در محیطهای متراکم.
- دنبال کردن پیشرفتهای مدلهای VLM در درک هندسی اشیا برای کاهش خطای برداشتن.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو