تصور کنید ویدیوهای دستچینشده از ربات اپتیموس تسلا را تماشا میکنید: رباتی سفید با سر و تنه سیاه که دکمه مایکروویو را فشار میدهد، زبالهها را در سطل میاندازد، پاپکورن رد میکند یا جاروبرقی میکشد. در حالی که این کلیپها نویدبخش غایت عصر هوش مصنوعی هستند — رباتی که بتواند شام بپزد یا لباسها را تا کند — اما واقعیت بسیار ناشیانهتر است. در عمل، این ماشین هنوز برای اتوی کردن یک پیراهن یا دادن بطریهای آب بدون افتادن، به شدت تقلا میکند.
این فاصله میان نمایشهای ویروسی و کاربرد واقعی، نقطهٔ بحرانی فعلی رباتیک است. ما شاهد تقابل «مبلغان» هستیم که باور دارند مقیاسپذیری مدلهای زبانی (LLM) مشکل فیزیک را حل میکند، و پژوهشگرانی که استدلال میکنند دنیای مادی به نوعی کاملاً متفاوت از هوش نیاز دارد. این گزارش حاصل همکاری MIT Technology Review و Aventine است؛ یک بنیاد تحقیقاتی غیرانتفاعی که بر نحوه تغییر زندگی انسانها توسط علم و فناوری تمرکز دارد.
هایپ در برابر سختافزار
ایلان ماسک ادعا کرده است که اپتیموس (Optimus) میتواند بزرگترین محصول تاریخ باشد و قیمت آن احتمالاً تا ۲۰ هزار دلار کاهش یابد. او در ژوئیه به سهامداران گفت که این رباتها در نهایت به «مهارتهای انسانی و سپس فراانسانی» میرسند. ماسک در ژانویه، در جریان سخنرانی در مجمع جهانی اقتصاد در داووس سوئیس، پیشبینی کرد که این رباتها تا پایان سال ۲۰۲۷ در دسترس عموم قرار میگیرند. او تصور میکند این ماشینها ابتدا در کف کارخانهها مشغول به کار شوند و سپس به خانههای ما وارد شوند تا تقریباً تمام کارهای سخت انسانی، از جابهجایی ورقهای فلزی گرفته تا تا کردن لباسها را خودکار کنند.
او تنها خوشبین این میدان نیست. جنسن هوانگ، مدیرعامل انویدیا (Nvidia)، در ژانویه اشاره کرد که رباتهای انساننما در سال جاری به تواناییهای سطح انسان میرسند. مارک اندرسن، همبنیانگذار Andreessen Horowitz، حتی فراتر رفته و بیان کرده است که رباتیک میتواند به «بزرگترین صنعت در تاریخ سیاره» تبدیل شود. در همین راستا، مورگان استنلی (Morgan Stanley) بازار این صنعت را تا سال ۲۰۵۰ بیش از ۵ تریلیون دلار، با نزدیک به یک میلیارد ربات انساننما در حال عملیات تخمین میزند.

اما یان لکون، پیشگام هوش مصنوعی، با این دیدگاه مخالف است. لکون در همان نشست داووس اعلام کرد هیچکدام از شرکتهای سازنده انساننما هیچ ایدهای ندارند که چگونه آنها را برای کاربردهای واقعی «باهوش» کنند. او استدلال میکند روشهای مورد استفاده در مدلهای زبانی برای دادههای نویزی و پیوسته دنیای فیزیکی اساساً کار نمیکنند.
جاناتان هرست، همبنیانگذار Agility Robotics و استاد دانشگاه ایالت اورگان، تمایزی حیاتی قائل میشود. او توضیح میدهد ساخت رباتی که «شبیه انسان به نظر برسد» بسیار آسان است، اما ساخت ماشینی که «شبیه انسان حرکت کند و رفتار پویا داشته باشد»، به مراتب دشوارتر است. این تنش — اینکه آیا رباتهای همهکاره در همین نزدیکی هستند یا اصلاً در افق دیده نمیشوند — در حال حاضر در آزمایشگاههای سراسر کشور در جریان است.
رباتها امروز چگونه «فکر» میکنند؟
برای درک این چالش باید به «سیاستهای رباتیک» (Robot Policies) نگاه کنیم؛ نرمافزاری که به ماشین میگوید چگونه حرکت کند، محیط اطرافش را ارزیابی کند و برای وظایفش برنامهریزی نماید. در گذشته، این دستورات توسط مهندسان به صورت سختافزاری (Hard-coded) نوشته میشد. هر میلیمتر حرکت در هزاران خط کد تعریف میشد.
امروز پژوهشگران کد را با مدلهای هوش مصنوعی جایگزین میکنند:
- مدلهای بینایی-زبانی (VLM): شبیه به مدلهای زبانی اما آموزشدیده روی تصاویر و کلمات. آنها درک زمینهای فوری ایجاد میکنند؛ برای مثال، نشان دادن عکسی از ریختن قهوه به یک VLM به ربات اجازه میدهد تا یک دستمال در نزدیکی را به عنوان ابزار مناسب برای پاکسازی شناسایی کند.
- مدلهای بینایی-زبان-عمل (VLA): این مدلها دستورات حرکتی را به ترکیب قبلی اضافه میکنند. آنها روی تصاویر یا ویدیوهای انجام یک کار، جفتشده با دادههای مربوط به نحوه حرکت بازوی ربات برای اجرای آن، آموزش میبینند. این دادههای حرکتی معمولاً از طریق «کنترل از راه دور» (Teleoperation) جمعآوری میشوند، جایی که یک انسان با استفاده از کنترلهای از راه دور، ربات را هدایت میکند.
گوگل دیپمایند (Google DeepMind) از این روش در سامانه ALOHA 2 (یک سیستم سختافزاری متنباز و ارزانقیمت برای کنترل دو-دستی از راه دور) استفاده میکند. این سیستم یک انساننما نیست، بلکه مجموعهای از دو بازو، گیره و دوربین است. این ربات که توسط Gemini Robotics (یک VLA) کنترل میشود، میتواند یک جعبه ناهار را ببندد — به این صورت که نان سفید را با ظرافت در یک کیسه زیپلاک قرار دهد، انگورها را در ظرف پلاستیکی بگذارد و زیپ جعبه ناهار را ببندد. اگرچه ناهار جذابی نیست، اما نسبت به سه سال پیش پیشرفتی عظیم است. در حوزههای تخصصیتر، شاهد تلاشهایی برای ترکیب مدلهای زبانی پیشرفته با سختافزار هستیم، مانند استفاده از مدل Claude برای هدایت رباتها در آزمایشگاههای داروسازی که دقت عملیاتی را در محیطهای حساس افزایش میدهد.
«دیوار دادهها» در رباتیک
یک محدودیت آشکار وجود دارد: اگر رباتی با قدرت VLA با کاری مواجه شود که در مجموعه آموزش (Training Set) آن نبوده، معمولاً شکست میخورد. ادوارد جانز، استاد امپریال کالج لندن، اشاره میکند که در حالی که یک سیاست واقعاً همهکاره میتواند هر کاری انجام دهد، مدلهای فعلی مثل Gemini Robotics فقط میتوانند «تعدادی کار در اینجا و تعدادی در آنجا» انجام دهند.
برای حل این مشکل، شرکتها به دادههای بیشتر نیاز دارند، اما رباتیک برخلاف ChatGPT، به «اقیانوسی از متن» دسترسی ندارد. پژوهشگران سه راهکار ناقص را امتحان میکنند:
- کنترل انسانی: استخدام تعداد زیادی انسان برای تولید داده، که بسیار گران و زمانبر است.
- آموزش با ویدیوهای انسانی: آموزش VLAها روی ویدیوهای مردم، که منجر به کیفیت پایین دادهها میشود.
- استقرار در دنیای واقعی: استفاده از دادههای رباتهای فعال در محیط واقعی، هرچند آنها در حال حاضر خارج از آزمایشگاهها بیش از حد ناامن و غیرقابلاعتماد هستند.
پاناگ سانکتی، مدیر فنی سابق گوگل دیپمایند، معتقد است تنها راه پیشرو، رویکردی «چندجانبه» با استفاده از تمام این منابع است. اما جاناتان هرست این فرض را «اساساً معیوب» میداند.
پیچیدگی دنیای فیزیکی
پیچیدگی کارهای فیزیکی بسیار سریعتر از کارهای زبانی رشد میکند. هرست اشاره میکند کار سادهای مثل دم کردن قهوه متغیرهای بیشماری دارد: هیچ دو آشپزخانهای یکسان نیستند، دستگاههای قهوهساز متفاوت عمل میکنند و هر فنجان نیاز به نوع خاصی از گرفتن دارد. مدیریت پودر قهوه، آب جوش و شیر، هر کدام به رویکرد فیزیکی متفاوتی نیاز دارند.
دستیابی به تعمیمپذیری از طریق VLAها نیازمند «پوشش کامل دادهها» برای هر حرکت احتمالی است که ربات ممکن است انجام دهد — که عملاً به معنای نیاز به مجموعهای بینهایت از دادههای آموزشی است. یان لکون با صراحت میگوید روشهای موفق در زبان، برای دادههای پربعد، پیوسته و نویزی دنیای فیزیکی کار نمیکنند.
ظهور مدلهای جهان
به دلیل ضعف VLAها در مواجهه با شرایط جدید، میدان در حال چرخش به سمت «مدلهای جهان» (World Models) است. این مدلها به جای تقلید صرف از حرکات، روی ترکیبی از ویدیو، اسکنهای سهبعدی و دادههای حسگر آموزش میبینند تا نتایج اقدامات را پیشبینی کنند. هدف، ایجاد یک بازنمایی داخلی از واقعیت است که نحوه حرکت، برخورد، سقوط و تغییر شکل اشیا را درک کند.
این رویکرد به رباتها اجازه میدهد به جای واکنش ساده، درباره محیط خود «استدلال» کنند. اگر شبیهسازیها به فیزیک واقعی نزدیک باشند، توسعه سریعتر، ارزانتر و ایمنتر میشود. سرمایههای کلانی به این حوزه سرازیر شده است:
- World Labs: توسط فیفی لی (پژوهشگر استنفورد) بنیانگذاری شد، در فوریه ۱ میلیارد دلار جذب کرد و در سپتامبر ۲۰۲۶ با ۸.۲ میلیارد دلار توسط AMD خریداری شد.
- AMI Labs: توسط یان لکون بنیانگذاری شد و در مارس ۱ میلیارد دلار جذب کرد.
با وجود این بودجهها، فیفی لی در اواخر ۲۰۲۵ این حوزه را «نوپا» توصیف کرد و اشاره کرد که رویکردهای بنیادی هنوز در حال شکلگیری هستند و چالشها دلهرهآورند. او در یک پست در Substack در ماه ژوئن، جزئیات موانع بزرگی را که همچنان پیش روی این فناوری است، شرح داد.
جرقهای از تعمیمپذیری
در آوریل ۲۰۲۶، استارتاپی به نام Physical Intelligence (PI) با مدل π0.7 به پیشرفتی رسید. هدف PI ساخت یک «مغز جهانی» برای رباتهاست. مسیر آنها به این شکل بود:
- π0 (۲۰۲۴): آموزش روی ۱۰ هزار ساعت دادههای کنترل انسانی اختصاصی و مجموعههای متنباز؛ ادعا شد که توانمندترین سیاست رباتیک همهکاره تا آن زمان است.
- π0.5 (بهار ۲۰۲۵): اضافه کردن تصاویر برچسبدار وب برای تطبیقپذیری بیشتر.
- π0.6 (پاییز ۲۰۲۵): اضافه کردن یادگیری تقویتی (Reinforcement Learning) برای بهبود نرخ موفقیت در تا کردن جعبهها و لباسها.
- π0.7 (آوریل ۲۰۲۶): ادغام یک مدل جهان «سبکوزن» که تصاویری از مراحل لازم برای انجام یک کار تولید میکند و به ربات عکسهایی از آنچه باید در گام بعدی انجام دهد، میدهد.
وقتی از این ربات خواستند «یک سیبزمینی شیرین را در سرخکن بدون روغن قرار دهد» — کاری که هرگز برایش آموزش ندیده بود — اگرچه کاملاً موفق نشد و با دشواری روبرو شد، اما تلاشی «قابلقبول» انجام داد. سرگی لِوین، استاد دانشگاه برکلی و همبنیانگذار PI، این را «تعمیم ترکیبی» (Compositional Generalization) مینامد؛ یعنی توانایی ترکیب مهارتهای آموختهشده برای حل یک مسئله جدید. موفقیت این ربات احتمالاً به دلیل وجود چند تکه داده پراکنده از کنترل انسانی مربوط به سبدهای سرخکن در مجموعه آموزشی بود، اما این اتفاق چشماندازی از آینده استدلال رباتیک را ارائه میدهد.
بررسی واقعیت
با وجود این پیروزیهای آزمایشگاهی، فاصله تا ربات خانگی بسیار زیاد است. بسیاری از دموهای مشهور فریبنده هستند؛ برای مثال، رباتی که در مارس ۲۰۲۵ در کنار جنسن هوانگ ظاهر شد، در واقع توسط یک «عروسکگردان» انسانی از پشت صحنه کنترل میشد.
«قابلیت اطمینان» (Reliability) آخرین سد بزرگ است. مارک رایبرت، بنیانگذار Boston Dynamics، اشاره میکند در حالی که پژوهشگران افزایش نرخ موفقیت از ۵۰٪ به ۷۰٪ را جشن میگیرند، در دنیای واقعی، نرخ موفقیت ۷۰٪ عملاً به معنای شکست است. علاوه بر این، رباتها هنوز با کارهای چندمرحلهای و مبهم مشکل دارند. گوگل دیپمایند سعی کرد رباتی را برای بررسی آشپزخانه و جمعآوری مواد لازم برای ریسوتو قارچ به کار بگیرد، اما این تلاش با شکست مواجه شد.
استقرار فعلی و بازار جهانی
در حال حاضر، پیشرفتهترین استقرارها محدود به محیطهای کاملاً کنترلشده است:
- آزمونهای صنعتی: شرکت Agility Robotics صدها ربات در مراکز آمازون (Amazon)، GXO Logistics و Schaeffler دارد، اما آنها فقط کارهای سادهای مثل جابهجایی جعبهها و محمولهها را انجام میدهند. هرست میگوید سالها طول کشید تا این رباتها برای شرکتهای لجستیکی به اندازه کافی ایمن شوند. در همین راستا، شرکتهایی مانند Maven Robotics نیز بر اتوماسیون پالتها در محیطهای صنعتی تمرکز کردهاند تا بهرهوری انبارها را افزایش دهند.
- پیشسفارشهای خانگی: ربات 1X Neo با قیمت ۲۰ هزار دلار وعده میدهد اتاقها را مرتب کند و در را باز کند، اما هنوز برای اکثر کارها به یک اپراتور انسانی از راه دور نیاز دارد؛ یعنی شخصی باید اجازه داشته باشد از طریق دوربینهای ربات به درون خانه شما نگاه کند.
جاناتان هرست معتقد است احتمالاً ۱۰ سال میکشد تا رباتها کارهای «مفید» در خانهها انجام دهند. وقتی برسند، احتمالاً چینی خواهند بود؛ ۹۰٪ از حدود ۱۵ هزار ربات انساننمای ارسالشده در سال ۲۰۲۵ توسط شرکتهای چینی مثل Unitree ساخته شدهاند. یکی از مدلهای Unitree کمتر از ۶ هزار دلار قیمت دارد، هرچند اکثر سفارشها در حال حاضر از طرف سازمانهای دولتی، آزمایشگاههای شرکتی و دانشگاهی است.
ما قبلاً اینجا بودهایم
رویای ساخت ربات انساننما ریشه در تاریخ دارد. لئوناردو داوینچی در سال ۱۴۹۵ طرح یک شوالیه مکانیکی را کشید که توسط کابلها و قرقرهها کنترل میشد. در قرن بیستم هم تلاشهای دیگری صورت گرفت:
- Elektro (۱۹۳۹): جعبهای هفتفوت روی پاها که در نمایشگاه جهانی نیویورک سیگار میکشید.
- WABOT-1 (۱۹۷۳): اولین انساننمای برنامهریزیشده در مقیاس کامل که در دانشگاه واسدا ژاپن ساخته شد.
- ASIMO (۲۰۰۰): ماشین هوندا که چهرهها را میشناخت و از پلهها بالا میرفت، اما در سال ۲۰۱۸ متوقف شد چون نتوانست از مرحله دموها فراتر رود و به ابزاری واقعاً مفید تبدیل شود.
رباتهای امروز، حتی با قدرت تحولآفرین هوش مصنوعی، هنوز با همان چالش وجودی روبرو هستند: شکاف عمیق میان «شبیه انسان بودن» و «عمل کردن در دنیای انسانها».




گفتگو