پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف میان دموهای ویروسی و واقعیت؛ ربات‌های انسان‌نما هنوز با خانه فاصله دارند

·۱۶ مهر ۱۴۰۵۱۵ دقیقه مطالعه
ربات‌های هوشمند هنوز زود است که زندگی‌تان را تغییر دهند.
ربات‌های هوشمند هنوز زود است که زندگی‌تان را تغییر دهند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از مدل‌های VLA (تقلید حرکت) به سمت مدل‌های جهان (پیش‌بینی نتیجه عمل) و معرفی مدل π0.7 که برای نخستین بار «تعمیم ترکیبی» را در کارهای غیرآموزشی (مثل استفاده از سرخ‌کن) نشان داد.

تصور کنید ویدیوهای دست‌چین‌شده از ربات اپتیموس تسلا را تماشا می‌کنید: رباتی سفید با سر و تنه سیاه که دکمه مایکروویو را فشار می‌دهد، زباله‌ها را در سطل می‌اندازد، پاپ‌کورن رد می‌کند یا جاروبرقی می‌کشد. در حالی که این کلیپ‌ها نویدبخش غایت عصر هوش مصنوعی هستند — رباتی که بتواند شام بپزد یا لباس‌ها را تا کند — اما واقعیت بسیار ناشیانه‌تر است. در عمل، این ماشین هنوز برای اتوی کردن یک پیراهن یا دادن بطری‌های آب بدون افتادن، به شدت تقلا می‌کند.

این فاصله میان نمایش‌های ویروسی و کاربرد واقعی، نقطهٔ بحرانی فعلی رباتیک است. ما شاهد تقابل «مبلغان» هستیم که باور دارند مقیاس‌پذیری مدل‌های زبانی (LLM) مشکل فیزیک را حل می‌کند، و پژوهشگرانی که استدلال می‌کنند دنیای مادی به نوعی کاملاً متفاوت از هوش نیاز دارد. این گزارش حاصل همکاری MIT Technology Review و Aventine است؛ یک بنیاد تحقیقاتی غیرانتفاعی که بر نحوه تغییر زندگی انسان‌ها توسط علم و فناوری تمرکز دارد.

هایپ در برابر سخت‌افزار

ایلان ماسک ادعا کرده است که اپتیموس (Optimus) می‌تواند بزرگ‌ترین محصول تاریخ باشد و قیمت آن احتمالاً تا ۲۰ هزار دلار کاهش یابد. او در ژوئیه به سهامداران گفت که این ربات‌ها در نهایت به «مهارت‌های انسانی و سپس فراانسانی» می‌رسند. ماسک در ژانویه، در جریان سخنرانی در مجمع جهانی اقتصاد در داووس سوئیس، پیش‌بینی کرد که این ربات‌ها تا پایان سال ۲۰۲۷ در دسترس عموم قرار می‌گیرند. او تصور می‌کند این ماشین‌ها ابتدا در کف کارخانه‌ها مشغول به کار شوند و سپس به خانه‌های ما وارد شوند تا تقریباً تمام کارهای سخت انسانی، از جابه‌جایی ورق‌های فلزی گرفته تا تا کردن لباس‌ها را خودکار کنند.

او تنها خوش‌بین این میدان نیست. جنسن هوانگ، مدیرعامل انویدیا (Nvidia)، در ژانویه اشاره کرد که ربات‌های انسان‌نما در سال جاری به توانایی‌های سطح انسان می‌رسند. مارک اندرسن، هم‌بنیان‌گذار Andreessen Horowitz، حتی فراتر رفته و بیان کرده است که رباتیک می‌تواند به «بزرگ‌ترین صنعت در تاریخ سیاره» تبدیل شود. در همین راستا، مورگان استنلی (Morgan Stanley) بازار این صنعت را تا سال ۲۰۵۰ بیش از ۵ تریلیون دلار، با نزدیک به یک میلیارد ربات انسان‌نما در حال عملیات تخمین می‌زند.

ربات انسان‌نما در حال کار در آزمایشگاه، نمادی از پیشرفت‌های آهسته هوش مصنوعی در رباتیک

اما یان لکون، پیشگام هوش مصنوعی، با این دیدگاه مخالف است. لکون در همان نشست داووس اعلام کرد هیچ‌کدام از شرکت‌های سازنده انسان‌نما هیچ ایده‌ای ندارند که چگونه آن‌ها را برای کاربردهای واقعی «باهوش» کنند. او استدلال می‌کند روش‌های مورد استفاده در مدل‌های زبانی برای داده‌های نویزی و پیوسته دنیای فیزیکی اساساً کار نمی‌کنند.

جاناتان هرست، هم‌بنیان‌گذار Agility Robotics و استاد دانشگاه ایالت اورگان، تمایزی حیاتی قائل می‌شود. او توضیح می‌دهد ساخت رباتی که «شبیه انسان به نظر برسد» بسیار آسان است، اما ساخت ماشینی که «شبیه انسان حرکت کند و رفتار پویا داشته باشد»، به مراتب دشوارتر است. این تنش — اینکه آیا ربات‌های همه‌کاره در همین نزدیکی هستند یا اصلاً در افق دیده نمی‌شوند — در حال حاضر در آزمایشگاه‌های سراسر کشور در جریان است.

ربات‌ها امروز چگونه «فکر» می‌کنند؟

برای درک این چالش باید به «سیاست‌های رباتیک» (Robot Policies) نگاه کنیم؛ نرم‌افزاری که به ماشین می‌گوید چگونه حرکت کند، محیط اطرافش را ارزیابی کند و برای وظایفش برنامه‌ریزی نماید. در گذشته، این دستورات توسط مهندسان به صورت سخت‌افزاری (Hard-coded) نوشته می‌شد. هر میلی‌متر حرکت در هزاران خط کد تعریف می‌شد.

امروز پژوهشگران کد را با مدل‌های هوش مصنوعی جایگزین می‌کنند:

  • مدل‌های بینایی-زبانی (VLM): شبیه به مدل‌های زبانی اما آموزش‌دیده روی تصاویر و کلمات. آن‌ها درک زمینه‌ای فوری ایجاد می‌کنند؛ برای مثال، نشان دادن عکسی از ریختن قهوه به یک VLM به ربات اجازه می‌دهد تا یک دستمال در نزدیکی را به عنوان ابزار مناسب برای پاک‌سازی شناسایی کند.
  • مدل‌های بینایی-زبان-عمل (VLA): این مدل‌ها دستورات حرکتی را به ترکیب قبلی اضافه می‌کنند. آن‌ها روی تصاویر یا ویدیوهای انجام یک کار، جفت‌شده با داده‌های مربوط به نحوه حرکت بازوی ربات برای اجرای آن، آموزش می‌بینند. این داده‌های حرکتی معمولاً از طریق «کنترل از راه دور» (Teleoperation) جمع‌آوری می‌شوند، جایی که یک انسان با استفاده از کنترل‌های از راه دور، ربات را هدایت می‌کند.

گوگل دیپ‌مایند (Google DeepMind) از این روش در سامانه ALOHA 2 (یک سیستم سخت‌افزاری متن‌باز و ارزان‌قیمت برای کنترل دو-دستی از راه دور) استفاده می‌کند. این سیستم یک انسان‌نما نیست، بلکه مجموعه‌ای از دو بازو، گیره و دوربین است. این ربات که توسط Gemini Robotics (یک VLA) کنترل می‌شود، می‌تواند یک جعبه ناهار را ببندد — به این صورت که نان سفید را با ظرافت در یک کیسه زیپ‌لاک قرار دهد، انگورها را در ظرف پلاستیکی بگذارد و زیپ جعبه ناهار را ببندد. اگرچه ناهار جذابی نیست، اما نسبت به سه سال پیش پیشرفتی عظیم است. در حوزه‌های تخصصی‌تر، شاهد تلاش‌هایی برای ترکیب مدل‌های زبانی پیشرفته با سخت‌افزار هستیم، مانند استفاده از مدل Claude برای هدایت ربات‌ها در آزمایشگاه‌های داروسازی که دقت عملیاتی را در محیط‌های حساس افزایش می‌دهد.

«دیوار داده‌ها» در رباتیک

یک محدودیت آشکار وجود دارد: اگر رباتی با قدرت VLA با کاری مواجه شود که در مجموعه آموزش (Training Set) آن نبوده، معمولاً شکست می‌خورد. ادوارد جانز، استاد امپریال کالج لندن، اشاره می‌کند که در حالی که یک سیاست واقعاً همه‌کاره می‌تواند هر کاری انجام دهد، مدل‌های فعلی مثل Gemini Robotics فقط می‌توانند «تعدادی کار در اینجا و تعدادی در آنجا» انجام دهند.

برای حل این مشکل، شرکت‌ها به داده‌های بیشتر نیاز دارند، اما رباتیک برخلاف ChatGPT، به «اقیانوسی از متن» دسترسی ندارد. پژوهشگران سه راهکار ناقص را امتحان می‌کنند:

  • کنترل انسانی: استخدام تعداد زیادی انسان برای تولید داده، که بسیار گران و زمان‌بر است.
  • آموزش با ویدیوهای انسانی: آموزش VLAها روی ویدیوهای مردم، که منجر به کیفیت پایین داده‌ها می‌شود.
  • استقرار در دنیای واقعی: استفاده از داده‌های ربات‌های فعال در محیط واقعی، هرچند آن‌ها در حال حاضر خارج از آزمایشگاه‌ها بیش از حد ناامن و غیرقابل‌اعتماد هستند.

پاناگ سانکتی، مدیر فنی سابق گوگل دیپ‌مایند، معتقد است تنها راه پیش‌رو، رویکردی «چندجانبه» با استفاده از تمام این منابع است. اما جاناتان هرست این فرض را «اساساً معیوب» می‌داند.

پیچیدگی دنیای فیزیکی

پیچیدگی کارهای فیزیکی بسیار سریع‌تر از کارهای زبانی رشد می‌کند. هرست اشاره می‌کند کار ساده‌ای مثل دم کردن قهوه متغیرهای بی‌شماری دارد: هیچ دو آشپزخانه‌ای یکسان نیستند، دستگاه‌های قهوه‌ساز متفاوت عمل می‌کنند و هر فنجان نیاز به نوع خاصی از گرفتن دارد. مدیریت پودر قهوه، آب جوش و شیر، هر کدام به رویکرد فیزیکی متفاوتی نیاز دارند.

دستیابی به تعمیم‌پذیری از طریق VLAها نیازمند «پوشش کامل داده‌ها» برای هر حرکت احتمالی است که ربات ممکن است انجام دهد — که عملاً به معنای نیاز به مجموعه‌ای بی‌نهایت از داده‌های آموزشی است. یان لکون با صراحت می‌گوید روش‌های موفق در زبان، برای داده‌های پربعد، پیوسته و نویزی دنیای فیزیکی کار نمی‌کنند.

ظهور مدل‌های جهان

به دلیل ضعف VLAها در مواجهه با شرایط جدید، میدان در حال چرخش به سمت «مدل‌های جهان» (World Models) است. این مدل‌ها به جای تقلید صرف از حرکات، روی ترکیبی از ویدیو، اسکن‌های سه‌بعدی و داده‌های حسگر آموزش می‌بینند تا نتایج اقدامات را پیش‌بینی کنند. هدف، ایجاد یک بازنمایی داخلی از واقعیت است که نحوه حرکت، برخورد، سقوط و تغییر شکل اشیا را درک کند.

این رویکرد به ربات‌ها اجازه می‌دهد به جای واکنش ساده، درباره محیط خود «استدلال» کنند. اگر شبیه‌سازی‌ها به فیزیک واقعی نزدیک باشند، توسعه سریع‌تر، ارزان‌تر و ایمن‌تر می‌شود. سرمایه‌های کلانی به این حوزه سرازیر شده است:

  • World Labs: توسط فی‌فی لی (پژوهشگر استنفورد) بنیان‌گذاری شد، در فوریه ۱ میلیارد دلار جذب کرد و در سپتامبر ۲۰۲۶ با ۸.۲ میلیارد دلار توسط AMD خریداری شد.
  • AMI Labs: توسط یان لکون بنیان‌گذاری شد و در مارس ۱ میلیارد دلار جذب کرد.

با وجود این بودجه‌ها، فی‌فی لی در اواخر ۲۰۲۵ این حوزه را «نوپا» توصیف کرد و اشاره کرد که رویکردهای بنیادی هنوز در حال شکل‌گیری هستند و چالش‌ها دلهره‌آورند. او در یک پست در Substack در ماه ژوئن، جزئیات موانع بزرگی را که همچنان پیش روی این فناوری است، شرح داد.

جرقه‌ای از تعمیم‌پذیری

در آوریل ۲۰۲۶، استارتاپی به نام Physical Intelligence (PI) با مدل π0.7 به پیشرفتی رسید. هدف PI ساخت یک «مغز جهانی» برای ربات‌هاست. مسیر آن‌ها به این شکل بود:

  • π0 (۲۰۲۴): آموزش روی ۱۰ هزار ساعت داده‌های کنترل انسانی اختصاصی و مجموعه‌های متن‌باز؛ ادعا شد که توانمندترین سیاست رباتیک همه‌کاره تا آن زمان است.
  • π0.5 (بهار ۲۰۲۵): اضافه کردن تصاویر برچسب‌دار وب برای تطبیق‌پذیری بیشتر.
  • π0.6 (پاییز ۲۰۲۵): اضافه کردن یادگیری تقویتی (Reinforcement Learning) برای بهبود نرخ موفقیت در تا کردن جعبه‌ها و لباس‌ها.
  • π0.7 (آوریل ۲۰۲۶): ادغام یک مدل جهان «سبک‌وزن» که تصاویری از مراحل لازم برای انجام یک کار تولید می‌کند و به ربات عکس‌هایی از آنچه باید در گام بعدی انجام دهد، می‌دهد.

وقتی از این ربات خواستند «یک سیب‌زمینی شیرین را در سرخ‌کن بدون روغن قرار دهد» — کاری که هرگز برایش آموزش ندیده بود — اگرچه کاملاً موفق نشد و با دشواری روبرو شد، اما تلاشی «قابل‌قبول» انجام داد. سرگی لِوین، استاد دانشگاه برکلی و هم‌بنیان‌گذار PI، این را «تعمیم ترکیبی» (Compositional Generalization) می‌نامد؛ یعنی توانایی ترکیب مهارت‌های آموخته‌شده برای حل یک مسئله جدید. موفقیت این ربات احتمالاً به دلیل وجود چند تکه داده پراکنده از کنترل انسانی مربوط به سبدهای سرخ‌کن در مجموعه آموزشی بود، اما این اتفاق چشم‌اندازی از آینده استدلال رباتیک را ارائه می‌دهد.

بررسی واقعیت

با وجود این پیروزی‌های آزمایشگاهی، فاصله تا ربات خانگی بسیار زیاد است. بسیاری از دموهای مشهور فریبنده هستند؛ برای مثال، رباتی که در مارس ۲۰۲۵ در کنار جنسن هوانگ ظاهر شد، در واقع توسط یک «عروسک‌گردان» انسانی از پشت صحنه کنترل می‌شد.

«قابلیت اطمینان» (Reliability) آخرین سد بزرگ است. مارک رایبرت، بنیان‌گذار Boston Dynamics، اشاره می‌کند در حالی که پژوهشگران افزایش نرخ موفقیت از ۵۰٪ به ۷۰٪ را جشن می‌گیرند، در دنیای واقعی، نرخ موفقیت ۷۰٪ عملاً به معنای شکست است. علاوه بر این، ربات‌ها هنوز با کارهای چندمرحله‌ای و مبهم مشکل دارند. گوگل دیپ‌مایند سعی کرد رباتی را برای بررسی آشپزخانه و جمع‌آوری مواد لازم برای ریسوتو قارچ به کار بگیرد، اما این تلاش با شکست مواجه شد.

استقرار فعلی و بازار جهانی

در حال حاضر، پیشرفته‌ترین استقرارها محدود به محیط‌های کاملاً کنترل‌شده است:

  • آزمون‌های صنعتی: شرکت Agility Robotics صدها ربات در مراکز آمازون (Amazon)، GXO Logistics و Schaeffler دارد، اما آن‌ها فقط کارهای ساده‌ای مثل جابه‌جایی جعبه‌ها و محموله‌ها را انجام می‌دهند. هرست می‌گوید سال‌ها طول کشید تا این ربات‌ها برای شرکت‌های لجستیکی به اندازه کافی ایمن شوند. در همین راستا، شرکت‌هایی مانند Maven Robotics نیز بر اتوماسیون پالت‌ها در محیط‌های صنعتی تمرکز کرده‌اند تا بهره‌وری انبارها را افزایش دهند.
  • پیش‌سفارش‌های خانگی: ربات 1X Neo با قیمت ۲۰ هزار دلار وعده می‌دهد اتاق‌ها را مرتب کند و در را باز کند، اما هنوز برای اکثر کارها به یک اپراتور انسانی از راه دور نیاز دارد؛ یعنی شخصی باید اجازه داشته باشد از طریق دوربین‌های ربات به درون خانه شما نگاه کند.

جاناتان هرست معتقد است احتمالاً ۱۰ سال می‌کشد تا ربات‌ها کارهای «مفید» در خانه‌ها انجام دهند. وقتی برسند، احتمالاً چینی خواهند بود؛ ۹۰٪ از حدود ۱۵ هزار ربات انسان‌نمای ارسال‌شده در سال ۲۰۲۵ توسط شرکت‌های چینی مثل Unitree ساخته شده‌اند. یکی از مدل‌های Unitree کمتر از ۶ هزار دلار قیمت دارد، هرچند اکثر سفارش‌ها در حال حاضر از طرف سازمان‌های دولتی، آزمایشگاه‌های شرکتی و دانشگاهی است.

ما قبلاً اینجا بوده‌ایم

رویای ساخت ربات انسان‌نما ریشه در تاریخ دارد. لئوناردو داوینچی در سال ۱۴۹۵ طرح یک شوالیه مکانیکی را کشید که توسط کابل‌ها و قرقره‌ها کنترل می‌شد. در قرن بیستم هم تلاش‌های دیگری صورت گرفت:

  • Elektro (۱۹۳۹): جعبه‌ای هفت‌فوت روی پاها که در نمایشگاه جهانی نیویورک سیگار می‌کشید.
  • WABOT-1 (۱۹۷۳): اولین انسان‌نمای برنامه‌ریزی‌شده در مقیاس کامل که در دانشگاه واسدا ژاپن ساخته شد.
  • ASIMO (۲۰۰۰): ماشین هوندا که چهره‌ها را می‌شناخت و از پله‌ها بالا می‌رفت، اما در سال ۲۰۱۸ متوقف شد چون نتوانست از مرحله دموها فراتر رود و به ابزاری واقعاً مفید تبدیل شود.

ربات‌های امروز، حتی با قدرت تحول‌آفرین هوش مصنوعی، هنوز با همان چالش وجودی روبرو هستند: شکاف عمیق میان «شبیه انسان بودن» و «عمل کردن در دنیای انسان‌ها».

چرا این موضوع مهم است؟

این موضوع نشان می‌دهد که برخلاف هایپ رسانه‌ای، ربات‌های خانگی یک محصول کوتاه‌مدت نیستند و نیاز به معماری‌های هوش مصنوعی جدیدی دارند که فراتر از پیش‌بینی توکن بعدی باشد. اعتبار این ادعا در تضاد میان پیش‌بینی‌های ماسک و واقعیت‌های فنی لکون و هرست نهفته است.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد و بیشتر برای پژوهشگران رباتیک و مدل‌های بنیادی در ایران اهمیت دارد.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین توهم فعلی در صنعت رباتیک، این است که می‌توان دنیای فیزیکی را با همان منطق «بیشتر داده = بیشتر هوش» که در LLMها جواب داد، فتح کرد. در حالی که زبان یک سیستم بسته با قواعد مشخص است، فیزیک یک سیستم باز با متغیرهای بی‌نهایت است. به نظر ما، نقطه عطف واقعی زمانی رخ می‌دهد که ربات‌ها از «تقلید حرکتی» به «درک علی» (Causal Understanding) از جهان برسند، نه اینکه فقط ویدیوهای بیشتری از انسان‌ها را تماشا کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.