پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: مقیاس‌بندی چندوجهی منجر به استدلال فیزیکی ناخواسته شد

·۱۵ مهر ۱۴۰۵۴ دقیقه مطالعه
پژوهشگران با هوش مصنوعی، یک تویوتا کرولا را برای خرید غذا از رستوران In-N-Out هدایت کردند.
پژوهشگران با هوش مصنوعی، یک تویوتا کرولا را برای خرید غذا از رستوران In-N-Out هدایت کردند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از یک مدل زبانی عمومی (LLM) برای هدایت فیزیکی خودرو بدون هیچ‌گونه آموزش تخصصی رانندگی (Zero-shot driving)؛ چیزی که پیش از این فقط در اختیار سیستم‌های تخصصی و بسته بود.

تصور کنید یک مدل زبانی که برای چت کردن ساخته شده، ناگهان فرمان یک خودروی دو تنی را به دست بگیرد و آن را در ترافیک یک رستوران سریع‌پز هدایت کند. این اتفاق دیگر یک سناریوی علمی-تخیلی نیست، بلکه نتیجهٔ آزمایشی است که مرز بین دنیای دیجیتال و فیزیکی را جابه‌جا کرده است.

به نقل از تیم مهندسی استارتاپ Axiom، هدف این آزمایش ساده بود: هدایت یک تویوتا کورولای مدل ۲۰۲۴ تا پنجرهٔ سفارش رستوران In-N-Out. سه مهندس به نام‌های آدیتیا رامابادران، سایمون مانز و توبیاس گسلر، رابط کاربری چت GPT-6 Astra را به سروری متصل کردند که کنترل فرمان و دوربین‌های جلو را در اختیار داشت؛ البته یک راننده ایمنی برای ترمزهای اضطراری در کنار آن‌ها بود.

در حالی که هوش مصنوعی خودرو را به سمت پنجره می‌راند، یکی از مهندسان با اشاره به هوش مصنوعی عمومی (AGI) — یعنی سیستمی که می‌تواند هر کار ذهنی انسان را انجام دهد — گفت: «شاید AGI بالاخره از راه رسیده است». این در حالی است که آزمایشگاه‌های هوش مصنوعی برای خروج از محیط‌های مجازی و ورود به استدلال فیزیکی تقلا می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی هزینه‌های سرسام‌آور توکن‌ها در کدنویسی شرکت‌هایی مانند Uber اشاره کردیم، چالش فعلی دیگر فقط هزینه نیست، بلکه تبدیل هوش دیجیتال به حرکت فیزیکی است. اکثر سیستم‌های خودران بر پایه الگوریتم‌های تخصصی هستند، اما این نمایش از مدلی استفاده کرد که اساساً برای متن و کد طراحی شده بود.

مرزهای استدلال فیزیکی

امروز هوشمندترین مدل‌ها در پاسخ به سوالات پیچیده و انجام وظایف مجازی عالی هستند، اما در دنیای واقعی اغلب گیج می‌شوند. شرکت‌های هوش مصنوعی، استدلال فیزیکی را آخرین مرز فتح‌نشده می‌بینند.

برخی از پژوهشگران حتی شرکت‌های بزرگ را ترک کرده‌اند تا روی این موضوع تمرکز کنند. اندرو دای، مدیرعامل Elorian AI و پژوهشگر سابق گوگل دیپ‌مایند، معتقد است کلید کاربردهای جدید در استدلال بصری است. او مثال‌هایی مانند سیستم‌هایی که می‌توانند تشخیص دهند آیا مشتریان رستوران از غذایشان لذت می‌برند یا ربات‌هایی که می‌توانند در محیط خانه فعالیت کنند را می‌زند. دای تأکید می‌کند که این توانایی «برای رباتیک کاملاً ضروری است» و می‌گوید: «شما واقعاً نمی‌توانید رباتیک خانگی را بدون این قابلیت تصور کنید». این رویکرد در راستای اتوماسیون پیشرفته‌تر است، مشابه آنچه در پروژه Hestus برای خودکارسازی طراحی مهندسی مکانیک شاهد بودیم.

جزئیات فنی و سازوکار

تیم Axiom برای اجرای این مسیر، ابتدا با مقاومت مدل مواجه شدند. مدل Astra در ابتدا با هشدار می‌گفت: «من می‌توانم تصاویر جاده را تفسیر کنم، اما نمی‌توانم دستور حرکت به یک ماشین واقعی بدهم». مهندسان با استفاده از مهندسی پرامپت (Prompt Engineering) — که شبیه هنر سؤال درست پرسیدن از یک مشاور باتجربه است تا بهترین جواب را بگیرید — این محدودیت‌ها را دور زدند تا مدل دستورات حرکتی صادر کند.

این سیستم بر سه رکن استوار بود:

  • ورودی‌های چندوجهی (Multimodal): دریافت ویدیوهای زنده و لحظه‌ای از دوربین‌های نصب شده روی شیشه جلو. مهندسان معتقدند این استعدادها از آموزش روی استدلال‌های سه‌بعدی و مقیاس‌بندی چندوجهی، شامل تصاویر، ویدیوها و مدل‌های سه‌بعدی حاصل شده است.
  • اتصال سخت‌افزاری: سروری که خروجی متنی مدل را به سیستم فرمان خودرو تبدیل می‌کرد.
  • یادگیری در بستر متن (In-Context Learning): مدل بر اساس خطاهای لحظه‌ای، فرمان خود را اصلاح می‌کرد. رامابادران اشاره کرد که مدل به نظر می‌رسید بر اساس اشتباهاتش یاد می‌گیرد که چگونه کنترل‌ها را بهتر هدایت کند.

محک زدن هوش فیزیکی

این تیم که از تجربه مشاهده خودروهای تسلا و Waymo در منطقه Bay Area الهام گرفته بودند، محکی به نام DrivingBench طراحی کردند؛ یک مسیر ساده در پارکینگ که مدل‌ها را در محیط‌های «نامنظم دنیای واقعی» می‌سنجد.

طبق گزارش آن‌ها، نتایج نشان‌دهنده شکافی عظیم بین مدل‌های برتر است:

  • GPT-6 Astra: تنها مدلی که توانست مسیر را به پایان برساند، هرچند این کار را بسیار کند انجام داد.
  • Claude Fable 5.1: تنها ۴۵٪ از مسیر را طی کرد.
  • Grok: فقط ۱۱٪ مسیر را پشت سر گذاشت (تیم ابتدا Grok متعلق به SpaceXAI را تست کرد و سپس به سراغ OpenAI و Anthropic رفت).

پژوهشگران دیگر نیز به صورت رسمی‌تر این مرز را دنبال می‌کنند. شرکت‌های Elorian و Scale AI محک «حس ششم بشریت» (Humanity’s Sixth Sense) را ساختند. شینگانگ گوئو، دانشمند پژوهشی در Scale AI، توضیح داد که در حالی که بیشتر تحقیقات هوش مصنوعی بصری بر «ادراک» متمرکز است، آن‌ها می‌خواستند ببینند چه چیزی لازم است تا یک مدل بتواند یک صحنه را به‌صورت شهودی — درست مثل انسان بدون فکر کردن — درک کند. این تلاش برای شبیه‌سازی شهود انسانی، یادآور آزمایش‌های ساخت کلون‌های AI برای تقلید از قضاوت انسانی است که مرزهای شباهت ماشین به انسان را به چالش می‌کشد.

این تغییر نشان می‌دهد که استدلال فیزیکی یک ویژگی «نوظهور» در اثر مقیاس‌بندی چندوجهی است. مدل‌ها با آموزش روی شبیه‌سازهای سه‌بعدی و ویدیوها، به‌طور اتفاقی یاد گرفته‌اند که دنیای فیزیکی چگونه کار می‌کند. ما در حال گذار از هوش مصنوعی‌ای هستیم که یک اتاق را توصیف می‌کند، به هوش مصنوعی‌ای که می‌تواند در آن اتاق حرکت کند.

برای کاربر عادی، این یعنی مرز بین چت‌بات و ربات در حال محو شدن است. اگر یک مدل عمومی بتواند بدون آموزش تخصصی رانندگی کند، نیاز به هوش مصنوعی‌های تک‌منظوره و محدود کم می‌شود. با این حال، سپردن فرمان یک ماشین دو تنی سریع‌راند به مدلی که خروجی‌هایش قطعی (Deterministic) نیست، هنوز یک قمار با ریسک بسیار بالا است. در واقع، مدیریت ریسک در محیط‌های فیزیکی حساس، همان دغدغه‌ای است که در استفاده از «عروسک‌های تصادف» هوش مصنوعی برای پیشگیری از خطرات دنبال می‌شود.

منتظر انتشار مجموعه داده‌های DrivingBench باشید تا ببینید آیا آزمایشگاه‌های دیگر می‌توانند شکاف استدلال فیزیکی با Astra را پر کنند یا خیر.

گام بعدی شما

  • دنبال کنید چه زمانی مجموعه داده‌های DrivingBench منتشر می‌شود تا بتوانید قدرت استدلال فیزیکی مدل‌های دیگر را مقایسه کنید.
  • بررسی کنید که آیا ابزارهای اتوماسیون فعلی شما می‌توانند از ورودی‌های چندوجهی برای کنترل سخت‌افزارهای ساده استفاده کنند یا خیر.
  • مطالعه کنید که چگونه مدل‌های استدلالی جدید در حال جایگزینی الگوریتم‌های سخت‌افزاری سنتی هستند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار مدل‌های چندوجهی OpenAI، نشان می‌دهد که مدل‌های عمومی در حال بلعیدن حوزه‌های تخصصی مانند خودران‌ها هستند. این موضوع ریسک‌های ایمنی را افزایش می‌دهد اما سرعت توسعه ربات‌های همه‌منظوره را به‌شدت بالا می‌برد.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد و بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک اهمیت دارد.

·نگاه ما
تحریریه دات‌هوش

این آزمایش ثابت می‌کند که استدلال فیزیکی دیگر نیازمند برنامه‌نویسی صریح قوانین فیزیک نیست، بلکه به عنوان یک اثر جانبی از پردازش حجم عظیم داده‌های بصری ظاهر شده است. این یعنی مدل‌های آینده احتمالاً به جای «یادگیری رانندگی»، «درک مفهوم حرکت» را از طریق مشاهده ویدیوها به دست می‌آورند که این یک چرخش بنیادین در معماری رباتیک است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.