پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل با Gemini Robotics 2 کنترل تمام‌بدنی ربات‌های انسان‌نما را ممکن کرد

·۸ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
ربات هوشمند جمینی ۲ با کنترل کل بدن، حرکات انسان‌وار انجام می‌دهد.
ربات هوشمند جمینی ۲ با کنترل کل بدن، حرکات انسان‌وار انجام می‌دهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن کامل مدل استدلالی (VLM) از مدل عملیاتی (VLA) و معرفی قابلیت انتقال حرکت سریع (کمتر از ۲۰۰ نمونه) برای سازگاری با هر نوع سخت‌افزار رباتیک.

تصور کنید رباتی داشته باشید که نه‌تنها بازوهایش حرکت کند، بلکه برای برداشتن یک شیء از کف زمین، درست مثل یک انسان خم شود، تعادلش را حفظ کند و با دقت آن را جابه‌جا کند. این سطح از کنترل فیزیکی، مرز بین ماشین‌های صنعتی و دستیاران واقعی را از بین می‌برد. این معماری جدید وعده می‌دهد جهانی را خلق کند که در آن ربات تنها به حرکت دادن بازوی خود اکتفا نمی‌کند، بلکه برای پاکسازی یک اتاق به‌هم‌ریخته، خم می‌شود، چمباتمه می‌زند و تعادل خود را حفظ می‌کند.

بر اساس مستندات رسمی شرکت گوگل دیپ‌مایند (Google DeepMind)، سامانه Gemini Robotics 2 در تاریخ ۳۰ ژوئیه ۲۰۲۶ معرفی شد. این فناوری می‌تواند یک دستور زبانی سطح بالا را به مجموعه‌ای از اقدامات فیزیکی دقیق و سراسری در تمام بدن ربات تبدیل کند. به نقل از گزارش deepmind.google، این تکنولوژی به یک ربات انسان‌نما اجازه می‌دهد تا تنها بر اساس یک فرمان ساده به زبان طبیعی، به سمت میز برود، یک آب‌پاش را بردارد و آن را در یکی از قفسه‌های پایین قرار دهد. این پیشرفت در واقع تکامل یافته‌ی رویکرد جدید گوگل برای ربات‌های پیچیده است که گام‌های نخستین را برای رسیدن به AGI فیزیکی برداشت.

این پیشرفت در حالی رخ می‌دهد که صنعت رباتیک برای خروج از محیط‌های دیجیتال و ورود به دنیای فیزیکی دست‌وپا می‌زند. اکثر ربات‌های فعلی یا از راه دور هدایت می‌شوند (Teleoperated) یا محدود به انجام کارهای تکراری در محیط‌های کاملاً کنترل‌شده هستند. این ماشین‌ها فاقد توانایی یادگیری مستقل یا سازگاری با محیط‌های غیرقابل‌پیش‌بینی هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام بینایی و عمل در نسخه‌های اولیه Gemini Robotics اشاره کردیم، مشکل اصلی همیشه «انتقال‌پذیری» (Transferability) بود؛ یعنی اینکه مدل هوش مصنوعی چقدر سریع با بدن یک ربات جدید سازگار می‌شود. نسخه‌ی دوم این مشکل حیاتی را حل کرده و اجازه می‌دهد هوش مصنوعی به جای هفته‌ها، تنها در عرض چند ساعت با بدن‌های مختلف رباتیک سازگار شود. این دستاورد در کنار تلاش‌های دیگر شرکت‌ها، مانند مدل Orca که کنترل ربات‌ها را بدون نیاز به داده‌های برچسب‌گذاری‌شده ممکن کرد، مسیر حذف وابستگی به داده‌های صنعتی سخت را هموار کرده است.

برای رسیدن به این هدف، گوگل معماری سیستم را به سه مدل تخصصی تقسیم کرده است:

معماری سه-مدلی

  • Gemini Robotics 2 (VLA): این پیشرفته‌ترین مدل بینایی-زبانی-عملی (Vision-Language-Action) است. VLA شبیه به سیستم عصبی‌ای است که ورودی‌های بصری و متنی را مستقیماً به کنترل موتور تبدیل می‌کند. این مدل همه چیز را، از انگشتان پا تا نوک انگشتان دست، از جمله سیستم‌های دو-بازویی را مدیریت می‌کند و سطح جدیدی از دست‌کاری‌های ظریف (Dexterous Manipulation) را برای هر دو دست و گیره‌ها معرفی می‌کند.
  • Gemini Robotics ER 2 (VLM): این مدل که «استدلال تجسم‌یافته» (Embodied Reasoning) نام دارد، در واقع مغز سطح بالای ربات است. این یک مدل بینایی-زبانی (VLM) است که به عنوان یک «عامل» (Agent) عمل می‌کند. ER 2 به ربات‌ها اجازه می‌دهد با انسان‌ها ارتباط برقرار کنند، دنیای فیزیکی را بفهمند و وظایف چند-مرحله‌ای را برنامه‌ریزی کنند که ممکن است چندین دقیقه به طول بینجامند.
  • Gemini Robotics On-Device 2: یک مدل VLA بهینه‌شده و کارآمد که برای اجرای محلی (Local Execution) طراحی شده است تا تأخیر شبکه یا وابستگی به اتصال اینترنت کاملاً حذف شود. این مدل می‌تواند با کمتر از ۲۰۰ مثال، در عرض تنها چند ساعت با یک بدن رباتیک جدید سازگار شود.

ربات انسان‌نمای جمینی روباتیکس ۲ در حال تعامل با یک توپ نارنجی در محیط آزمایشگاهی.

کنترل تمام‌بدنی و تحرک انسان‌نماها

دنیای فیزیکی برای حرکات انسانی طراحی شده است و نیاز به توانایی دسترسی، خم شدن و حفظ تعادل در فضاهای تنگ و شلوغ دارد. مدل‌های قبلی تا حد زیادی محدود به کنترل بالاتنه برای کارهای روی میز بودند. Gemini Robotics 2 برای نخستین بار هوش مصنوعی فیزیکی را به حرکات تمام‌بدنی (Whole-body motions) گسترش داد.

این قابلیت اجازه می‌دهد تا ربات، قصد و نیت خود را به حرکت در تمام چارچوب بدنش ترجمه کند. به‌عنوان یک مثال کلیدی، هنگام کنترل ربات انسان‌نمای Apollo 2 ساخت شرکت Apptronik، سیستم می‌تواند این دستور خاص را پردازش کند: «آب‌پاش را در سطل سبز رنگ در پایین‌ترین قفسه قرار بده». در این حالت، ربات ابتدا به سمت میز می‌رود، شیء را برمی‌دارد، چندین قدم تا قفسه‌ها طی می‌کند و در نهایت شیء را دقیقاً در مقصد قرار می‌دهد. هرچند سرعت حرکت هنوز نیاز به پیشرفت دارد، اما این یک گام حیاتی به سوی مهارت‌های مورد نیاز برای کارهای پیچیده در دنیای واقعی است که نیازمند هماهنگی کامل تمام بدن هستند. این تمرکز بر دقت حرکتی مشابه تلاش‌های Mistral AI است که در مدل Robostral Navigate برای ارتقای دقت ناوبری ربات‌ها با استفاده از دوربین‌های ساده تلاش کرد.

عبور از سد مهارت‌های ظریف

دقت و ظرافت فیزیکی همچنان یکی از موانع اصلی در رباتیک است. ربات‌ها برای اینکه در محیط‌های کاری و خانگی مفید باشند، به لمس ظریف نیاز دارند. سیستم جدید به ربات Apollo 2 که دارای دست SharpaWave با ۲۲ درجه آزادی و پنج انگشت است، اجازه می‌دهد کارهای بسیار 섬‌سانی را انجام دهد. این اقدامات شامل گره زدن ریسمان‌ها و بستن کیسه‌های زیپ‌کیپ است؛ کارهایی که نیازمند دقت بسیار بالا هستند.

حتی با سخت‌افزارهای ساده‌تر، این سیستم عملکرد مناسبی دارد. با استفاده از پلتفرم‌های Franka Duo که دارای گیره‌های موازی استاندارد دو انگشتی هستند، هوش مصنوعی می‌تواند کارهای پیچیده‌ای مانند بسته‌بندی متراکم (Tight Packing) را اجرا کند. گوگل گزارش داده است که در حال بهینه‌سازی مستمر سرعت و دقت است تا به سطح مهارت دست انسان در تمام انواع مجری‌های انتهایی (End Effectors) دست یابد.

استدلال عامل‌محور و کار تیمی

بسیاری از کارهای پیچیده به این دلیل با شکست مواجه می‌شوند که ربات‌ها نمی‌توانند «تصویر کلی» را ببینند یا بازه‌های زمانی طولانی را مدیریت کنند. Gemini Robotics ER 2 این مشکل را با تبدیل شدن به یک عامل حل می‌کند که اتاق را مشاهده کرده، درباره مراحل ضروری استدلال می‌کند، با VLA برای اجرا هماهنگ می‌شود و پیشرفت کار را تا لحظه تکمیل رصد می‌کند.

جزئیات قابلیت‌های عامل‌محور:

  • اجرای توالی‌های طولانی: مدل اکنون می‌تواند توالی‌هایی را که چندین دقیقه طول می‌کشند و شامل صدها تصمیم فردی هستند، به‌طور قابل‌اعتمادی اجرا کند.
  • ردیابی پیشرفت: ER 2 دقیقاً درک می‌کند که وظایف چه زمانی شروع و چه زمانی پایان می‌یابند و لحظه وقوع رویدادهای کلیدی را شناسایی می‌کند.
  • خود-اصلاحی: چون این عامل از طریق محیط استدلال می‌کند، اگر یک مرحله خاص با شکست مواجه شود، می‌تواند خود را اصلاح کرده و اهداف جدید را تعمیم دهد.
  • همکاری چند-رباتی: سیستم اکنون از کار تیمی پشتیبانی می‌کند. انواع مختلف ربات‌ها می‌توانند با یکدیگر ارتباط برقرار کرده و برای حل گردش‌کارهای پیچیده‌ای که یک ماشین به‌تنهایی قادر به انجام آن نیست، با هم همکاری کنند.

سازگاری سریع با سخت‌افزارهای متنوع

برای بسیاری از کاربردهای رباتیک، اجرای محلی برای جلوگیری از تأخیر (Latency) حیاتی است. مدل Gemini Robotics On-Device 2 به‌طور ذاتی «چند-بدنه» (Multi-embodiment) است و تکنیک‌های «انتقال حرکت» (Motion Transfer) را از نسخه Gemini Robotics 1.5 به ارث برده است.

این ویژگی اجازه می‌دهد تا سیستم با بدن‌های رباتیک کاملاً متفاوت — از جمله شکل‌ها، حسگرها و درجات آزادی مختلف — در عرض چند ساعت سازگار شود. این تطبیق‌پذیری در پلتفرم‌های متنوعی از جمله Dexmate، SO101 و Trossen به اثبات رسیده است و معمولاً برای دستیابی به عملکرد مطلوب، به کمتر از ۲۰۰ نمونه نیاز دارد.

ایمنی و محک ASIMOV-Agentic

با افزایش خودمختاری ربات‌ها، ریسک حوادث فیزیکی افزایش می‌یابد. گوگل یک رویکرد چندلایه را اتخاذ کرده است که تدابیر ایمنی فیزیکی سنتی را با چارچوب‌های قدرتمند ایمنی هوش مصنوعی ترکیب می‌کند. آن‌ها محک جدیدی به نام ASIMOV-Agentic را برای ارکستراسیون ایمنی عامل‌ها و رفع عدم قطعیت معرفی کرده‌اند.

مکانیزم‌های چارچوب ایمنی:

  • منطق رد کردن (Refusal Logic): این محک توانایی عامل استدلالی را در رد کردن یک فراخوانی ابزار ناایمن که توسط VLA درخواست شده است، می‌سنجد.
  • رفع عدم قطعیت (Uncertainty Resolution): این بخش توانایی عامل را در پیش‌بینی اینکه آیا یک کار اصلاً امکان‌پذیر است یا خیر، آزمایش می‌کند و اگر مدل نامطمئن باشد، به‌طور فعال درخواست کمک انسان را می‌کند.
  • تشخیص نزدیکی: مدل ER 2 می‌تواند حضور انسان‌ها را در نزدیکی خود بهتر تشخیص دهد و برای متوقف کردن ایمن ربات در صورت نزدیک شدن بیش از حد فرد، دستورات ایمنی را فعال کند.

این ویژگی‌ها الزامات کلیدی در استانداردهای ایمنی مشارکتی هستند. یافته‌های مفصل در «گزارش فنی ایمنی Gemini Robotics 2» در دسترس است.

به سوی هوش مصنوعی عام فیزیکی

این انتشار نشان می‌دهد که مسیر رسیدن به هوش مصنوعی عام (AGI) نیازمند یک «لایه فیزیکی» است. گوگل با جداسازی استدلال (ER) از عمل (VLA)، در واقع نقشه‌ای برای هوشی خلق می‌کند که به یک سخت‌افزار خاص وابسته نیست. این یعنی عبور از اتوماسیون تک-وظیفه‌ای به سمتی که AI بتواند در کنار انسان‌ها به حل چالش‌های پیچیده کمک کند.

برای صاحبان کسب‌وکار، این خبر به معنای نزدیک شدن فاصله بین یک نمونه آزمایشگاهی و یک دستیار کاربردی در انبار یا خانه است. ما در حال حرکت به سمت ماشین‌هایی هستیم که می‌توانند در فضاهای غیرقابل‌پیش‌بینی و انسان‌محور مستقر شوند.

توسعه‌دهندگانی که در پی دسترسی به این قابلیت‌ها هستند، می‌توانند از طریق Google AI Studio یا در پیش‌نمایش خصوصی در Gemini Enterprise Agent Platform به مدل ER 2 دسترسی پیدا کنند. مدل‌های VLA و On-Device فعلاً برای شرکای دسترسی زودهنگام در دسترس هستند و راهنمای پیاده‌سازی بیشتر در وبلاگ توسعه‌دهندگان گوگل قرار دارد.

گام بعدی شما

  • اگر در حوزه رباتیک فعالیت می‌کنید، مستندات Gemini Robotics 2 در وبلاگ توسعه‌دهندگان گوگل را برای درک ساختار VLA بررسی کنید.
  • برای بررسی استانداردهای جدید ایمنی، گزارش فنی ASIMOV-Agentic را مطالعه کنید تا متوجه شوید چگونه می‌توان تعادل بین خودمختاری و ایمنی را برقرار کرد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر اعتبار پژوهشی DeepMind، ربات‌ها را از ابزارهای تکرارکننده به عامل‌های تصمیم‌گیرنده تبدیل می‌کند. نتیجه آن، کاهش شدید هزینه استقرار ربات‌ها در محیط‌های غیرصنعتی مانند بیمارستان‌ها و منازل است.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای پیشرفته گوگل و سخت‌افزارهای تخصصی رباتیک، این تحول فعلاً برای پژوهشگران دانشگاهی ایران در سطح مطالعه تئوریک اهمیت دارد تا کاربرد تجاری.

·نگاه ما
تحریریه دات‌هوش

جدا کردن لایه استدلال (ER) از لایه عمل (VLA)، در واقع تلاش گوگل برای ایجاد یک «سیستم‌عامل جهانی» برای رباتیک است. این رویکرد فرضیه وابستگی شدید هوش مصنوعی به سخت‌افزار خاص را می‌شکند و نشان می‌دهد که AGI لزوماً در یک چت‌بات نیست، بلکه در توانایی تعمیم استدلال به هر بدنیست که بتواند با محیط تعامل کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.