تصور کنید خودروی خودران شما در یک منطقه در حال ساختوساز، ناگهان برای یک حیوان کوچک ترمز میکند؛ در این لحظه ماشین نباید فقط «توقف» کند، بلکه باید بفهمد چرا این توقف ضروری است و مسیرهای جایگزین توسط موانع بسته شدهاند. این همان شکافی است که Motional در ۸ سپتامبر ۲۰۲۶ با معرفی nuReasoning سعی در پر کردن آن دارد. این مجموعه داده را Motional به عنوان «اولین مجموعه داده باز جهان با محوریت استدلال برای سناریوهای دم-بلند (Long-tail) در خودروهای خودران» توصیف میکند.
بسیاری از سیستمهای فعلی تنها بر ادراک — یعنی تشخیص یک عابر یا تابلوی ایست — متکی هستند. اما سناریوهای نادر یا همان لبههای سیستم (Edge Cases)، نیازمند درکی عمیقتر از روابط فضایی و پیشبینی ریسک هستند. به نقل از مستندات این پروژه، هدف این است که هوش مصنوعی بهجای یادگیری صرفاً «حرکت درست»، منطق پشت آن اقدام را بیاموزد. در واقع، خودروهای خودران اغلب نه به دلیل ناتوانی در دیدن یک شیء، بلکه به دلیل ناتوانی در استدلال درباره اهمیت آن شیء شکست میخورند.
همانطور که در تحلیلهای قبلی ما دربارهی مدلهای استدلالی اشاره کردیم، گذار از تشخیص صرف به استدلال، کلید خروج از بنبست ایمنی در محیطهای پیچیده است. این مجموعه داده که با همکاری آزمایشگاه تحرک UCLA و مدیر آن، پروفسور جیاچی ما توسعه یافته، متریال آموزشی لازم برای مدلهای بینایی-زبانی-اکشن (VLA) را فراهم میکند. این مدلها — شبیه به رانندهای که همزمان میبیند، فکر میکند و فرمان میچرخاند — تشخیص صحنه را با منطق تصمیمگیری ترکیب میکنند. Motional تصریح میکند که چنین مدلهایی به دادههای آموزشی نیاز دارند که منطق پشت یک اقدام رانندگی را منتقل کند، نه اینکه صرفاً اقدام صحیح را دیکته کند.
طبق گزارش این پروژه، هدف نهایی این است که خودروهای خودران به سناریوهای هرجومرجآمیز با همان منطق مطمئنی واکنش نشان دهند که یک راننده انسانی باتجربه دارد. فیل میشل، نایبرئیس ارشد بخش خودمختاری و هوش مصنوعی Motional، خاطرنشان کرد که شرکت در حال اولویتبندی «هوش مصنوعی شفاف» است تا تصمیمگیریهای لحظهای و ارزیابی ریسک بهصورت واضح قابل ارزیابی و تحلیل باشند.
جزئیات فنی این مجموعه داده نشان میدهد که ۲۰,۰۰۰ سناریوی نادر (Long-tail) از دادههای ناوگان خودروها در شهرهایی مثل لاسوگاس، سنگاپور، بوستون، پیتسبرگ و لسآنجلس استخراج شده است. هر سناریو یک کلیپ ویدیویی با مدتزمان حداقل ۲۰ ثانیه است که در مجموع بیش از ۱۰۵ ساعت دادهی متمرکز بر استدلال را تشکیل میدهد. این دادهها شامل موارد غیرمعمولی مثل فعالیتهای عجیب عابران، مناطق ساختوساز، عملیات جادهای در شب، عبور حیوانات و سناریوهای با دید محدود است. این تمرکز بر دادههای ویدئویی حجیم، یادآور انتشار مجموعه داده BVD است که ۱۰ میلیون ساعت ویدیو را برای پیشبرد پژوهشهای باز در مدلهای هوش مصنوعی فراهم کرد.
مشخصات کلیدی فنی عبارتند از:
- ۲۴۷,۰۰۰ برچسب تأییدشده توسط انسان که به سه دستهی استدلال فضایی (Spatial)، تصمیمگیری (Decision) و ضدواقعیتی (Counterfactual) تقسیم شدهاند.
- دادههای حسگر چندوجهی (Multimodal) شامل دوربینهای چندنمایی همگام، لایدار (LiDAR) برای کلیپهای پشتیبانیشده، دادههای کالیبراسیون، وضعیت خودرو (Ego state) و برچسبهای اشیاء سهبعدی.
- تفکیک ساختاریافته: ۱۷,۰۰۰ کلیپ آموزشی، ۲,۰۰۰ کلیپ اعتبارسنجی و ۱,۰۰۰ کلیپ آزمون خصوصی که با نرخ ۱۰ هرتز نمونهبرداری شدهاند.
- موتور جستوجوی Omnitag که به پژوهشگران اجازه میدهد سناریوها را بر اساس سطح دشواری، مکان یا از طریق جستوجوهای معنایی با زبان طبیعی برای تعاملات تاکتیکی پیدا کنند.
برای جمعآوری و پالایش این متریال، یک ارزیاب هوش مصنوعی ابتدا ۱۰۰,۰۰۰ کلیپ کاندید ۳۰ ثانیهای را که از میان ۱۰,۰۰۰ ساعت رانندگی پیشفیلتر شده بودند، امتیازدهی کرد و سپس انسانها فریمهای کلیدی را تأیید کردند. این دادهها همچنین شامل نقشههای HD برداریشده، وضعیت چراغهای راهنمایی، مسیرهای روت و دستورات ناوبری است. همچنین برای حفظ حریم خصوصی، عملیات ناشناسسازی روی چهرهها و پلاک خودروها اعمال شده است.
در بخش مکانیسمهای استدلال، استدلالهای فضایی با نرخ ۱ هرتز ثبت شدهاند و مواردی چون درک دوبعدی-سهبعدی شیءمحور، توپولوژی نقشه، موقعیت نسبی، سرعت و حرکت آینده را پوشش میدهند. استدلالهای تصمیمگیری، توصیفات صحنه و ردپای علت و معلولی رفتارها را ثبت میکنند که شامل «متا-اکشنهای» طولی و عرضی است.
اما استدلالهای ضدواقعیتی (Counterfactual Reasoning) — شبیه به بررسی اینکه «اگر فرمان را نمیچرخاندم چه میشد» — اقدامات جایگزین خودرو را در برابر نتایج بحرانی ایمنی ارزیابی میکنند. این موارد در سه دستهی «ایمن»، «بهینه نبودن» یا «ناایمن» برچسبگذاری شدهاند. لازم به ذکر است که برچسبهای تصمیمگیری و ضدواقعیتی با نرخ ۰.۲ هرتز ثبت شدهاند.
همزمان با این انتشار، Motional یک چالش پژوهشی را در کنفرانس بینالمللی بینایی کامپیوتر (ECCV) در سوئد آغاز کرد. شرکتکنندگان باید با استفاده از ۱۰ ثانیه بستر متنی (Context Window) — شامل تصاویر چندنمایی، اطلاعات نقشه HD، دستورات ناوبری و وضعیت خودرو — مسیر خودرو را برای ۵ ثانیه آینده پیشبینی کنند.
این رقابت تنها درباره مسیر نیست؛ بلکه شامل یک تسک کمکی پرسشوپاسخ تصویری (VQA) است. پژوهشگران باید به سوالاتی درباره هندسه، حرکت، تصمیمگیری و استدلال ضدواقعیتی در قالبهای چندگزینهای، عددی، مختصاتی و مسیر-محور پاسخ دهند. امتیاز نهایی به گونهای است که ۷۵٪ به برنامهریزی مسیر و ۲۵٪ به استدلال اختصاص مییابد. جایزه ۱۰,۰۰۰ دلاری این رقابت در دسامبر ۲۰۲۶ در کنفرانس NeurIPS اهدا خواهد شد.
این اقدام در ادامه میراث دادههای باز Motional است که از سال ۲۰۱۹ با nuScenes آغاز شد و سپس با nuImages، Panoptic nuScenes و nuPlan ادامه یافت. بر اساس مقالهای با عنوان «nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving» که ۲۹ مه ۲۰۲۶ در arXiv منتشر شد و تونی شوئی کی (Tony Xuewei Qi) رهبری پروژه آن را بر عهده داشت، نتایج امیدوارکنندهای به دست آمده است.
نویسندگان گزارش میدهند که تنظیم دقیق (Fine-tuning) مدلهای بینایی-زبانی روی nuReasoning، پاسخدهی آنها به سوالات تخصصی رانندگی را بهبود میبخشد. آنها همچنین دریافتند که گنجاندن نظارت استدلالی (Reasoning Supervision) در آموزش VLA، عملکرد برنامهریزی را حتی زمانی که استدلال متنی در مرحله استنتاج (Inference) غیرفعال است، بهبود میدهد. این رویکرد در استفاده از دادههای انسانی برای مقیاسپذیری مدلهای اکشن، شباهت زیادی به پروژه Dyna-2 دارد که با بهرهگیری از ۱۷۰ سال تجربه انسانی قوانین رباتیک را بازنویسی کرد. مدل برنامهریزی آنها، nuVLA، یک ستون فقرات بینایی-زبانی را با تولید مسیر ترکیب کرده است.
در حال حاضر بخشهای آموزشی و اعتبارسنجی در Hugging Face در دسترس هستند و نسخهی کوچکتر (miniset) این دادهها که اوایل سال جاری منتشر شد، تاکنون بیش از ۵۰,۰۰۰ بار دانلود شده است. همچنین یک Devkit متنباز در گیتهاب فراهم شده که مدلهای پایه و معیارهای ارزیابی لازم برای شروع فوری آموزش مدلهای VLA را ارائه میدهد.
گام بعدی شما
- اگر توسعهدهندهی مدلهای VLA هستید، Devkit متنباز این پروژه را در گیتهاب بررسی کنید تا مدلهای پایه را پیادهسازی کنید.
- برای درک تفاوت بین «ادراک» و «استدلال» در سیستمهای خودران، مقالهی nuReasoning در arXiv را مطالعه کنید.
- نتایج چالش ECCV را در دسامبر ۲۰۲۶ دنبال کنید تا ببینید کدام معماری در پیشبینی مسیرهای نادر موفقتر بوده است.
اما تأثیر این رویکرد بر کاهش هزینههای سختافزاری استنتاج در لبه، موضوعی است که در گزارشهای بعدی بررسی خواهیم کرد.




گفتگو