تصور کنید رباتی داشته باشید که نهتنها بازوهایش حرکت کند، بلکه برای برداشتن یک شیء از کف زمین، درست مثل یک انسان خم شود، تعادلش را حفظ کند و با دقت آن را جابهجا کند. این سطح از کنترل فیزیکی، مرز بین ماشینهای صنعتی و دستیاران واقعی را از بین میبرد. این معماری جدید وعده میدهد جهانی را خلق کند که در آن ربات تنها به حرکت دادن بازوی خود اکتفا نمیکند، بلکه برای پاکسازی یک اتاق بههمریخته، خم میشود، چمباتمه میزند و تعادل خود را حفظ میکند.
بر اساس مستندات رسمی شرکت گوگل دیپمایند (Google DeepMind)، سامانه Gemini Robotics 2 در تاریخ ۳۰ ژوئیه ۲۰۲۶ معرفی شد. این فناوری میتواند یک دستور زبانی سطح بالا را به مجموعهای از اقدامات فیزیکی دقیق و سراسری در تمام بدن ربات تبدیل کند. به نقل از گزارش deepmind.google، این تکنولوژی به یک ربات انساننما اجازه میدهد تا تنها بر اساس یک فرمان ساده به زبان طبیعی، به سمت میز برود، یک آبپاش را بردارد و آن را در یکی از قفسههای پایین قرار دهد. این پیشرفت در واقع تکامل یافتهی رویکرد جدید گوگل برای رباتهای پیچیده است که گامهای نخستین را برای رسیدن به AGI فیزیکی برداشت.
این پیشرفت در حالی رخ میدهد که صنعت رباتیک برای خروج از محیطهای دیجیتال و ورود به دنیای فیزیکی دستوپا میزند. اکثر رباتهای فعلی یا از راه دور هدایت میشوند (Teleoperated) یا محدود به انجام کارهای تکراری در محیطهای کاملاً کنترلشده هستند. این ماشینها فاقد توانایی یادگیری مستقل یا سازگاری با محیطهای غیرقابلپیشبینی هستند. همانطور که در تحلیل قبلی ما دربارهی ادغام بینایی و عمل در نسخههای اولیه Gemini Robotics اشاره کردیم، مشکل اصلی همیشه «انتقالپذیری» (Transferability) بود؛ یعنی اینکه مدل هوش مصنوعی چقدر سریع با بدن یک ربات جدید سازگار میشود. نسخهی دوم این مشکل حیاتی را حل کرده و اجازه میدهد هوش مصنوعی به جای هفتهها، تنها در عرض چند ساعت با بدنهای مختلف رباتیک سازگار شود. این دستاورد در کنار تلاشهای دیگر شرکتها، مانند مدل Orca که کنترل رباتها را بدون نیاز به دادههای برچسبگذاریشده ممکن کرد، مسیر حذف وابستگی به دادههای صنعتی سخت را هموار کرده است.
برای رسیدن به این هدف، گوگل معماری سیستم را به سه مدل تخصصی تقسیم کرده است:
معماری سه-مدلی
- Gemini Robotics 2 (VLA): این پیشرفتهترین مدل بینایی-زبانی-عملی (Vision-Language-Action) است. VLA شبیه به سیستم عصبیای است که ورودیهای بصری و متنی را مستقیماً به کنترل موتور تبدیل میکند. این مدل همه چیز را، از انگشتان پا تا نوک انگشتان دست، از جمله سیستمهای دو-بازویی را مدیریت میکند و سطح جدیدی از دستکاریهای ظریف (Dexterous Manipulation) را برای هر دو دست و گیرهها معرفی میکند.
- Gemini Robotics ER 2 (VLM): این مدل که «استدلال تجسمیافته» (Embodied Reasoning) نام دارد، در واقع مغز سطح بالای ربات است. این یک مدل بینایی-زبانی (VLM) است که به عنوان یک «عامل» (Agent) عمل میکند. ER 2 به رباتها اجازه میدهد با انسانها ارتباط برقرار کنند، دنیای فیزیکی را بفهمند و وظایف چند-مرحلهای را برنامهریزی کنند که ممکن است چندین دقیقه به طول بینجامند.
- Gemini Robotics On-Device 2: یک مدل VLA بهینهشده و کارآمد که برای اجرای محلی (Local Execution) طراحی شده است تا تأخیر شبکه یا وابستگی به اتصال اینترنت کاملاً حذف شود. این مدل میتواند با کمتر از ۲۰۰ مثال، در عرض تنها چند ساعت با یک بدن رباتیک جدید سازگار شود.

کنترل تمامبدنی و تحرک انساننماها
دنیای فیزیکی برای حرکات انسانی طراحی شده است و نیاز به توانایی دسترسی، خم شدن و حفظ تعادل در فضاهای تنگ و شلوغ دارد. مدلهای قبلی تا حد زیادی محدود به کنترل بالاتنه برای کارهای روی میز بودند. Gemini Robotics 2 برای نخستین بار هوش مصنوعی فیزیکی را به حرکات تمامبدنی (Whole-body motions) گسترش داد.
این قابلیت اجازه میدهد تا ربات، قصد و نیت خود را به حرکت در تمام چارچوب بدنش ترجمه کند. بهعنوان یک مثال کلیدی، هنگام کنترل ربات انساننمای Apollo 2 ساخت شرکت Apptronik، سیستم میتواند این دستور خاص را پردازش کند: «آبپاش را در سطل سبز رنگ در پایینترین قفسه قرار بده». در این حالت، ربات ابتدا به سمت میز میرود، شیء را برمیدارد، چندین قدم تا قفسهها طی میکند و در نهایت شیء را دقیقاً در مقصد قرار میدهد. هرچند سرعت حرکت هنوز نیاز به پیشرفت دارد، اما این یک گام حیاتی به سوی مهارتهای مورد نیاز برای کارهای پیچیده در دنیای واقعی است که نیازمند هماهنگی کامل تمام بدن هستند. این تمرکز بر دقت حرکتی مشابه تلاشهای Mistral AI است که در مدل Robostral Navigate برای ارتقای دقت ناوبری رباتها با استفاده از دوربینهای ساده تلاش کرد.
عبور از سد مهارتهای ظریف
دقت و ظرافت فیزیکی همچنان یکی از موانع اصلی در رباتیک است. رباتها برای اینکه در محیطهای کاری و خانگی مفید باشند، به لمس ظریف نیاز دارند. سیستم جدید به ربات Apollo 2 که دارای دست SharpaWave با ۲۲ درجه آزادی و پنج انگشت است، اجازه میدهد کارهای بسیار 섬سانی را انجام دهد. این اقدامات شامل گره زدن ریسمانها و بستن کیسههای زیپکیپ است؛ کارهایی که نیازمند دقت بسیار بالا هستند.
حتی با سختافزارهای سادهتر، این سیستم عملکرد مناسبی دارد. با استفاده از پلتفرمهای Franka Duo که دارای گیرههای موازی استاندارد دو انگشتی هستند، هوش مصنوعی میتواند کارهای پیچیدهای مانند بستهبندی متراکم (Tight Packing) را اجرا کند. گوگل گزارش داده است که در حال بهینهسازی مستمر سرعت و دقت است تا به سطح مهارت دست انسان در تمام انواع مجریهای انتهایی (End Effectors) دست یابد.
استدلال عاملمحور و کار تیمی
بسیاری از کارهای پیچیده به این دلیل با شکست مواجه میشوند که رباتها نمیتوانند «تصویر کلی» را ببینند یا بازههای زمانی طولانی را مدیریت کنند. Gemini Robotics ER 2 این مشکل را با تبدیل شدن به یک عامل حل میکند که اتاق را مشاهده کرده، درباره مراحل ضروری استدلال میکند، با VLA برای اجرا هماهنگ میشود و پیشرفت کار را تا لحظه تکمیل رصد میکند.
جزئیات قابلیتهای عاملمحور:
- اجرای توالیهای طولانی: مدل اکنون میتواند توالیهایی را که چندین دقیقه طول میکشند و شامل صدها تصمیم فردی هستند، بهطور قابلاعتمادی اجرا کند.
- ردیابی پیشرفت: ER 2 دقیقاً درک میکند که وظایف چه زمانی شروع و چه زمانی پایان مییابند و لحظه وقوع رویدادهای کلیدی را شناسایی میکند.
- خود-اصلاحی: چون این عامل از طریق محیط استدلال میکند، اگر یک مرحله خاص با شکست مواجه شود، میتواند خود را اصلاح کرده و اهداف جدید را تعمیم دهد.
- همکاری چند-رباتی: سیستم اکنون از کار تیمی پشتیبانی میکند. انواع مختلف رباتها میتوانند با یکدیگر ارتباط برقرار کرده و برای حل گردشکارهای پیچیدهای که یک ماشین بهتنهایی قادر به انجام آن نیست، با هم همکاری کنند.
سازگاری سریع با سختافزارهای متنوع
برای بسیاری از کاربردهای رباتیک، اجرای محلی برای جلوگیری از تأخیر (Latency) حیاتی است. مدل Gemini Robotics On-Device 2 بهطور ذاتی «چند-بدنه» (Multi-embodiment) است و تکنیکهای «انتقال حرکت» (Motion Transfer) را از نسخه Gemini Robotics 1.5 به ارث برده است.
این ویژگی اجازه میدهد تا سیستم با بدنهای رباتیک کاملاً متفاوت — از جمله شکلها، حسگرها و درجات آزادی مختلف — در عرض چند ساعت سازگار شود. این تطبیقپذیری در پلتفرمهای متنوعی از جمله Dexmate، SO101 و Trossen به اثبات رسیده است و معمولاً برای دستیابی به عملکرد مطلوب، به کمتر از ۲۰۰ نمونه نیاز دارد.
ایمنی و محک ASIMOV-Agentic
با افزایش خودمختاری رباتها، ریسک حوادث فیزیکی افزایش مییابد. گوگل یک رویکرد چندلایه را اتخاذ کرده است که تدابیر ایمنی فیزیکی سنتی را با چارچوبهای قدرتمند ایمنی هوش مصنوعی ترکیب میکند. آنها محک جدیدی به نام ASIMOV-Agentic را برای ارکستراسیون ایمنی عاملها و رفع عدم قطعیت معرفی کردهاند.
مکانیزمهای چارچوب ایمنی:
- منطق رد کردن (Refusal Logic): این محک توانایی عامل استدلالی را در رد کردن یک فراخوانی ابزار ناایمن که توسط VLA درخواست شده است، میسنجد.
- رفع عدم قطعیت (Uncertainty Resolution): این بخش توانایی عامل را در پیشبینی اینکه آیا یک کار اصلاً امکانپذیر است یا خیر، آزمایش میکند و اگر مدل نامطمئن باشد، بهطور فعال درخواست کمک انسان را میکند.
- تشخیص نزدیکی: مدل ER 2 میتواند حضور انسانها را در نزدیکی خود بهتر تشخیص دهد و برای متوقف کردن ایمن ربات در صورت نزدیک شدن بیش از حد فرد، دستورات ایمنی را فعال کند.
این ویژگیها الزامات کلیدی در استانداردهای ایمنی مشارکتی هستند. یافتههای مفصل در «گزارش فنی ایمنی Gemini Robotics 2» در دسترس است.
به سوی هوش مصنوعی عام فیزیکی
این انتشار نشان میدهد که مسیر رسیدن به هوش مصنوعی عام (AGI) نیازمند یک «لایه فیزیکی» است. گوگل با جداسازی استدلال (ER) از عمل (VLA)، در واقع نقشهای برای هوشی خلق میکند که به یک سختافزار خاص وابسته نیست. این یعنی عبور از اتوماسیون تک-وظیفهای به سمتی که AI بتواند در کنار انسانها به حل چالشهای پیچیده کمک کند.
برای صاحبان کسبوکار، این خبر به معنای نزدیک شدن فاصله بین یک نمونه آزمایشگاهی و یک دستیار کاربردی در انبار یا خانه است. ما در حال حرکت به سمت ماشینهایی هستیم که میتوانند در فضاهای غیرقابلپیشبینی و انسانمحور مستقر شوند.
توسعهدهندگانی که در پی دسترسی به این قابلیتها هستند، میتوانند از طریق Google AI Studio یا در پیشنمایش خصوصی در Gemini Enterprise Agent Platform به مدل ER 2 دسترسی پیدا کنند. مدلهای VLA و On-Device فعلاً برای شرکای دسترسی زودهنگام در دسترس هستند و راهنمای پیادهسازی بیشتر در وبلاگ توسعهدهندگان گوگل قرار دارد.
گام بعدی شما
- اگر در حوزه رباتیک فعالیت میکنید، مستندات Gemini Robotics 2 در وبلاگ توسعهدهندگان گوگل را برای درک ساختار VLA بررسی کنید.
- برای بررسی استانداردهای جدید ایمنی، گزارش فنی ASIMOV-Agentic را مطالعه کنید تا متوجه شوید چگونه میتوان تعادل بین خودمختاری و ایمنی را برقرار کرد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو