تصور کنید یک مدل زبانی که برای چت کردن ساخته شده، ناگهان فرمان یک خودروی دو تنی را به دست بگیرد و آن را در ترافیک یک رستوران سریعپز هدایت کند. این اتفاق دیگر یک سناریوی علمی-تخیلی نیست، بلکه نتیجهٔ آزمایشی است که مرز بین دنیای دیجیتال و فیزیکی را جابهجا کرده است.
به نقل از تیم مهندسی استارتاپ Axiom، هدف این آزمایش ساده بود: هدایت یک تویوتا کورولای مدل ۲۰۲۴ تا پنجرهٔ سفارش رستوران In-N-Out. سه مهندس به نامهای آدیتیا رامابادران، سایمون مانز و توبیاس گسلر، رابط کاربری چت GPT-6 Astra را به سروری متصل کردند که کنترل فرمان و دوربینهای جلو را در اختیار داشت؛ البته یک راننده ایمنی برای ترمزهای اضطراری در کنار آنها بود.
در حالی که هوش مصنوعی خودرو را به سمت پنجره میراند، یکی از مهندسان با اشاره به هوش مصنوعی عمومی (AGI) — یعنی سیستمی که میتواند هر کار ذهنی انسان را انجام دهد — گفت: «شاید AGI بالاخره از راه رسیده است». این در حالی است که آزمایشگاههای هوش مصنوعی برای خروج از محیطهای مجازی و ورود به استدلال فیزیکی تقلا میکنند. همانطور که در تحلیل قبلی ما دربارهی هزینههای سرسامآور توکنها در کدنویسی شرکتهایی مانند Uber اشاره کردیم، چالش فعلی دیگر فقط هزینه نیست، بلکه تبدیل هوش دیجیتال به حرکت فیزیکی است. اکثر سیستمهای خودران بر پایه الگوریتمهای تخصصی هستند، اما این نمایش از مدلی استفاده کرد که اساساً برای متن و کد طراحی شده بود.
مرزهای استدلال فیزیکی
امروز هوشمندترین مدلها در پاسخ به سوالات پیچیده و انجام وظایف مجازی عالی هستند، اما در دنیای واقعی اغلب گیج میشوند. شرکتهای هوش مصنوعی، استدلال فیزیکی را آخرین مرز فتحنشده میبینند.
برخی از پژوهشگران حتی شرکتهای بزرگ را ترک کردهاند تا روی این موضوع تمرکز کنند. اندرو دای، مدیرعامل Elorian AI و پژوهشگر سابق گوگل دیپمایند، معتقد است کلید کاربردهای جدید در استدلال بصری است. او مثالهایی مانند سیستمهایی که میتوانند تشخیص دهند آیا مشتریان رستوران از غذایشان لذت میبرند یا رباتهایی که میتوانند در محیط خانه فعالیت کنند را میزند. دای تأکید میکند که این توانایی «برای رباتیک کاملاً ضروری است» و میگوید: «شما واقعاً نمیتوانید رباتیک خانگی را بدون این قابلیت تصور کنید». این رویکرد در راستای اتوماسیون پیشرفتهتر است، مشابه آنچه در پروژه Hestus برای خودکارسازی طراحی مهندسی مکانیک شاهد بودیم.
جزئیات فنی و سازوکار
تیم Axiom برای اجرای این مسیر، ابتدا با مقاومت مدل مواجه شدند. مدل Astra در ابتدا با هشدار میگفت: «من میتوانم تصاویر جاده را تفسیر کنم، اما نمیتوانم دستور حرکت به یک ماشین واقعی بدهم». مهندسان با استفاده از مهندسی پرامپت (Prompt Engineering) — که شبیه هنر سؤال درست پرسیدن از یک مشاور باتجربه است تا بهترین جواب را بگیرید — این محدودیتها را دور زدند تا مدل دستورات حرکتی صادر کند.
این سیستم بر سه رکن استوار بود:
- ورودیهای چندوجهی (Multimodal): دریافت ویدیوهای زنده و لحظهای از دوربینهای نصب شده روی شیشه جلو. مهندسان معتقدند این استعدادها از آموزش روی استدلالهای سهبعدی و مقیاسبندی چندوجهی، شامل تصاویر، ویدیوها و مدلهای سهبعدی حاصل شده است.
- اتصال سختافزاری: سروری که خروجی متنی مدل را به سیستم فرمان خودرو تبدیل میکرد.
- یادگیری در بستر متن (In-Context Learning): مدل بر اساس خطاهای لحظهای، فرمان خود را اصلاح میکرد. رامابادران اشاره کرد که مدل به نظر میرسید بر اساس اشتباهاتش یاد میگیرد که چگونه کنترلها را بهتر هدایت کند.
محک زدن هوش فیزیکی
این تیم که از تجربه مشاهده خودروهای تسلا و Waymo در منطقه Bay Area الهام گرفته بودند، محکی به نام DrivingBench طراحی کردند؛ یک مسیر ساده در پارکینگ که مدلها را در محیطهای «نامنظم دنیای واقعی» میسنجد.
طبق گزارش آنها، نتایج نشاندهنده شکافی عظیم بین مدلهای برتر است:
- GPT-6 Astra: تنها مدلی که توانست مسیر را به پایان برساند، هرچند این کار را بسیار کند انجام داد.
- Claude Fable 5.1: تنها ۴۵٪ از مسیر را طی کرد.
- Grok: فقط ۱۱٪ مسیر را پشت سر گذاشت (تیم ابتدا Grok متعلق به SpaceXAI را تست کرد و سپس به سراغ OpenAI و Anthropic رفت).
پژوهشگران دیگر نیز به صورت رسمیتر این مرز را دنبال میکنند. شرکتهای Elorian و Scale AI محک «حس ششم بشریت» (Humanity’s Sixth Sense) را ساختند. شینگانگ گوئو، دانشمند پژوهشی در Scale AI، توضیح داد که در حالی که بیشتر تحقیقات هوش مصنوعی بصری بر «ادراک» متمرکز است، آنها میخواستند ببینند چه چیزی لازم است تا یک مدل بتواند یک صحنه را بهصورت شهودی — درست مثل انسان بدون فکر کردن — درک کند. این تلاش برای شبیهسازی شهود انسانی، یادآور آزمایشهای ساخت کلونهای AI برای تقلید از قضاوت انسانی است که مرزهای شباهت ماشین به انسان را به چالش میکشد.
این تغییر نشان میدهد که استدلال فیزیکی یک ویژگی «نوظهور» در اثر مقیاسبندی چندوجهی است. مدلها با آموزش روی شبیهسازهای سهبعدی و ویدیوها، بهطور اتفاقی یاد گرفتهاند که دنیای فیزیکی چگونه کار میکند. ما در حال گذار از هوش مصنوعیای هستیم که یک اتاق را توصیف میکند، به هوش مصنوعیای که میتواند در آن اتاق حرکت کند.
برای کاربر عادی، این یعنی مرز بین چتبات و ربات در حال محو شدن است. اگر یک مدل عمومی بتواند بدون آموزش تخصصی رانندگی کند، نیاز به هوش مصنوعیهای تکمنظوره و محدود کم میشود. با این حال، سپردن فرمان یک ماشین دو تنی سریعراند به مدلی که خروجیهایش قطعی (Deterministic) نیست، هنوز یک قمار با ریسک بسیار بالا است. در واقع، مدیریت ریسک در محیطهای فیزیکی حساس، همان دغدغهای است که در استفاده از «عروسکهای تصادف» هوش مصنوعی برای پیشگیری از خطرات دنبال میشود.
منتظر انتشار مجموعه دادههای DrivingBench باشید تا ببینید آیا آزمایشگاههای دیگر میتوانند شکاف استدلال فیزیکی با Astra را پر کنند یا خیر.
گام بعدی شما
- دنبال کنید چه زمانی مجموعه دادههای DrivingBench منتشر میشود تا بتوانید قدرت استدلال فیزیکی مدلهای دیگر را مقایسه کنید.
- بررسی کنید که آیا ابزارهای اتوماسیون فعلی شما میتوانند از ورودیهای چندوجهی برای کنترل سختافزارهای ساده استفاده کنند یا خیر.
- مطالعه کنید که چگونه مدلهای استدلالی جدید در حال جایگزینی الگوریتمهای سختافزاری سنتی هستند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو