پرش به محتوای اصلی
پرش به محتوای مقاله

مجموعه داده nuReasoning منطق تصمیم‌گیری خودروهای خودران را باز کرد

·۱۷ شهریور ۱۴۰۵۴ دقیقه مطالعه
انتشار مجموعه‌داده nuReasoning و برگزاری چالش ECCV توسط Motional
انتشار مجموعه‌داده nuReasoning و برگزاری چالش ECCV توسط Motional
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مجموعه داده باز که به‌جای ثبت «چه اتفاقی افتاد»، «چرا این تصمیم گرفته شد» را با برچسب‌های استدلال ضدواقعیتی ثبت کرده است.

تصور کنید خودروی خودران شما در یک منطقه در حال ساخت‌وساز، ناگهان برای یک حیوان کوچک ترمز می‌کند؛ در این لحظه ماشین نباید فقط «توقف» کند، بلکه باید بفهمد چرا این توقف ضروری است و مسیرهای جایگزین توسط موانع بسته شده‌اند. این همان شکافی است که Motional در ۸ سپتامبر ۲۰۲۶ با معرفی nuReasoning سعی در پر کردن آن دارد. این مجموعه داده را Motional به عنوان «اولین مجموعه داده باز جهان با محوریت استدلال برای سناریوهای دم-بلند (Long-tail) در خودروهای خودران» توصیف می‌کند.

بسیاری از سیستم‌های فعلی تنها بر ادراک — یعنی تشخیص یک عابر یا تابلوی ایست — متکی هستند. اما سناریوهای نادر یا همان لبه‌های سیستم (Edge Cases)، نیازمند درکی عمیق‌تر از روابط فضایی و پیش‌بینی ریسک هستند. به نقل از مستندات این پروژه، هدف این است که هوش مصنوعی به‌جای یادگیری صرفاً «حرکت درست»، منطق پشت آن اقدام را بیاموزد. در واقع، خودروهای خودران اغلب نه به دلیل ناتوانی در دیدن یک شیء، بلکه به دلیل ناتوانی در استدلال درباره اهمیت آن شیء شکست می‌خورند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های استدلالی اشاره کردیم، گذار از تشخیص صرف به استدلال، کلید خروج از بن‌بست ایمنی در محیط‌های پیچیده است. این مجموعه داده که با همکاری آزمایشگاه تحرک UCLA و مدیر آن، پروفسور جیاچی ما توسعه یافته، متریال آموزشی لازم برای مدل‌های بینایی-زبانی-اکشن (VLA) را فراهم می‌کند. این مدل‌ها — شبیه به راننده‌ای که هم‌زمان می‌بیند، فکر می‌کند و فرمان می‌چرخاند — تشخیص صحنه را با منطق تصمیم‌گیری ترکیب می‌کنند. Motional تصریح می‌کند که چنین مدل‌هایی به داده‌های آموزشی نیاز دارند که منطق پشت یک اقدام رانندگی را منتقل کند، نه اینکه صرفاً اقدام صحیح را دیکته کند.

طبق گزارش این پروژه، هدف نهایی این است که خودروهای خودران به سناریوهای هرج‌ومرج‌آمیز با همان منطق مطمئنی واکنش نشان دهند که یک راننده انسانی باتجربه دارد. فیل میشل، نایب‌رئیس ارشد بخش خودمختاری و هوش مصنوعی Motional، خاطرنشان کرد که شرکت در حال اولویت‌بندی «هوش مصنوعی شفاف» است تا تصمیم‌گیری‌های لحظه‌ای و ارزیابی ریسک به‌صورت واضح قابل ارزیابی و تحلیل باشند.

جزئیات فنی این مجموعه داده نشان می‌دهد که ۲۰,۰۰۰ سناریوی نادر (Long-tail) از داده‌های ناوگان خودروها در شهرهایی مثل لاس‌وگاس، سنگاپور، بوستون، پیتسبرگ و لس‌آنجلس استخراج شده است. هر سناریو یک کلیپ ویدیویی با مدت‌زمان حداقل ۲۰ ثانیه است که در مجموع بیش از ۱۰۵ ساعت داده‌ی متمرکز بر استدلال را تشکیل می‌دهد. این داده‌ها شامل موارد غیرمعمولی مثل فعالیت‌های عجیب عابران، مناطق ساخت‌وساز، عملیات جاده‌ای در شب، عبور حیوانات و سناریوهای با دید محدود است. این تمرکز بر داده‌های ویدئویی حجیم، یادآور انتشار مجموعه داده BVD است که ۱۰ میلیون ساعت ویدیو را برای پیشبرد پژوهش‌های باز در مدل‌های هوش مصنوعی فراهم کرد.

مشخصات کلیدی فنی عبارتند از:

  • ۲۴۷,۰۰۰ برچسب تأییدشده توسط انسان که به سه دسته‌ی استدلال فضایی (Spatial)، تصمیم‌گیری (Decision) و ضدواقعیتی (Counterfactual) تقسیم شده‌اند.
  • داده‌های حسگر چندوجهی (Multimodal) شامل دوربین‌های چندنمایی هم‌گام، لایدار (LiDAR) برای کلیپ‌های پشتیبانی‌شده، داده‌های کالیبراسیون، وضعیت خودرو (Ego state) و برچسب‌های اشیاء سه‌بعدی.
  • تفکیک ساختاریافته: ۱۷,۰۰۰ کلیپ آموزشی، ۲,۰۰۰ کلیپ اعتبارسنجی و ۱,۰۰۰ کلیپ آزمون خصوصی که با نرخ ۱۰ هرتز نمونه‌برداری شده‌اند.
  • موتور جست‌وجوی Omnitag که به پژوهشگران اجازه می‌دهد سناریوها را بر اساس سطح دشواری، مکان یا از طریق جست‌وجوهای معنایی با زبان طبیعی برای تعاملات تاکتیکی پیدا کنند.

برای جمع‌آوری و پالایش این متریال، یک ارزیاب هوش مصنوعی ابتدا ۱۰۰,۰۰۰ کلیپ کاندید ۳۰ ثانیه‌ای را که از میان ۱۰,۰۰۰ ساعت رانندگی پیش‌فیلتر شده بودند، امتیازدهی کرد و سپس انسان‌ها فریم‌های کلیدی را تأیید کردند. این داده‌ها همچنین شامل نقشه‌های HD برداری‌شده، وضعیت چراغ‌های راهنمایی، مسیرهای روت و دستورات ناوبری است. همچنین برای حفظ حریم خصوصی، عملیات ناشناس‌سازی روی چهره‌ها و پلاک خودروها اعمال شده است.

در بخش مکانیسم‌های استدلال، استدلال‌های فضایی با نرخ ۱ هرتز ثبت شده‌اند و مواردی چون درک دوبعدی-سه‌بعدی شیء‌محور، توپولوژی نقشه، موقعیت نسبی، سرعت و حرکت آینده را پوشش می‌دهند. استدلال‌های تصمیم‌گیری، توصیفات صحنه و ردپای علت و معلولی رفتارها را ثبت می‌کنند که شامل «متا-اکشن‌های» طولی و عرضی است.

اما استدلال‌های ضدواقعیتی (Counterfactual Reasoning) — شبیه به بررسی اینکه «اگر فرمان را نمی‌چرخاندم چه می‌شد» — اقدامات جایگزین خودرو را در برابر نتایج بحرانی ایمنی ارزیابی می‌کنند. این موارد در سه دسته‌ی «ایمن»، «بهینه نبودن» یا «ناایمن» برچسب‌گذاری شده‌اند. لازم به ذکر است که برچسب‌های تصمیم‌گیری و ضدواقعیتی با نرخ ۰.۲ هرتز ثبت شده‌اند.

هم‌زمان با این انتشار، Motional یک چالش پژوهشی را در کنفرانس بین‌المللی بینایی کامپیوتر (ECCV) در سوئد آغاز کرد. شرکت‌کنندگان باید با استفاده از ۱۰ ثانیه بستر متنی (Context Window) — شامل تصاویر چندنمایی، اطلاعات نقشه HD، دستورات ناوبری و وضعیت خودرو — مسیر خودرو را برای ۵ ثانیه آینده پیش‌بینی کنند.

این رقابت تنها درباره مسیر نیست؛ بلکه شامل یک تسک کمکی پرسش‌وپاسخ تصویری (VQA) است. پژوهشگران باید به سوالاتی درباره هندسه، حرکت، تصمیم‌گیری و استدلال ضدواقعیتی در قالب‌های چندگزینه‌ای، عددی، مختصاتی و مسیر-محور پاسخ دهند. امتیاز نهایی به گونه‌ای است که ۷۵٪ به برنامه‌ریزی مسیر و ۲۵٪ به استدلال اختصاص می‌یابد. جایزه ۱۰,۰۰۰ دلاری این رقابت در دسامبر ۲۰۲۶ در کنفرانس NeurIPS اهدا خواهد شد.

این اقدام در ادامه میراث داده‌های باز Motional است که از سال ۲۰۱۹ با nuScenes آغاز شد و سپس با nuImages، Panoptic nuScenes و nuPlan ادامه یافت. بر اساس مقاله‌ای با عنوان «nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving» که ۲۹ مه ۲۰۲۶ در arXiv منتشر شد و تونی شوئی کی (Tony Xuewei Qi) رهبری پروژه آن را بر عهده داشت، نتایج امیدوارکننده‌ای به دست آمده است.

نویسندگان گزارش می‌دهند که تنظیم دقیق (Fine-tuning) مدل‌های بینایی-زبانی روی nuReasoning، پاسخ‌دهی آن‌ها به سوالات تخصصی رانندگی را بهبود می‌بخشد. آن‌ها همچنین دریافتند که گنجاندن نظارت استدلالی (Reasoning Supervision) در آموزش VLA، عملکرد برنامه‌ریزی را حتی زمانی که استدلال متنی در مرحله استنتاج (Inference) غیرفعال است، بهبود می‌دهد. این رویکرد در استفاده از داده‌های انسانی برای مقیاس‌پذیری مدل‌های اکشن، شباهت زیادی به پروژه Dyna-2 دارد که با بهره‌گیری از ۱۷۰ سال تجربه انسانی قوانین رباتیک را بازنویسی کرد. مدل برنامه‌ریزی آن‌ها، nuVLA، یک ستون فقرات بینایی-زبانی را با تولید مسیر ترکیب کرده است.

در حال حاضر بخش‌های آموزشی و اعتبارسنجی در Hugging Face در دسترس هستند و نسخه‌ی کوچک‌تر (miniset) این داده‌ها که اوایل سال جاری منتشر شد، تاکنون بیش از ۵۰,۰۰۰ بار دانلود شده است. همچنین یک Devkit متن‌باز در گیت‌هاب فراهم شده که مدل‌های پایه و معیارهای ارزیابی لازم برای شروع فوری آموزش مدل‌های VLA را ارائه می‌دهد.

گام بعدی شما

  • اگر توسعه‌دهنده‌ی مدل‌های VLA هستید، Devkit متن‌باز این پروژه را در گیت‌هاب بررسی کنید تا مدل‌های پایه را پیاده‌سازی کنید.
  • برای درک تفاوت بین «ادراک» و «استدلال» در سیستم‌های خودران، مقاله‌ی nuReasoning در arXiv را مطالعه کنید.
  • نتایج چالش ECCV را در دسامبر ۲۰۲۶ دنبال کنید تا ببینید کدام معماری در پیش‌بینی مسیرهای نادر موفق‌تر بوده است.

اما تأثیر این رویکرد بر کاهش هزینه‌های سخت‌افزاری استنتاج در لبه، موضوعی است که در گزارش‌های بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مجموعه داده با تکیه بر اعتبار UCLA و Motional، استاندارد جدیدی برای ارزیابی ایمنی خودروهای خودران ایجاد می‌کند. اکنون پژوهشگران می‌توانند به‌جای تست‌های جاده‌ای پرریسک، مدل‌های استدلالی را در محیط‌های شبیه‌سازی‌شده‌ی دقیق بسنجند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و بینایی ماشین در ایران اهمیت دارد تا بازار مصرف؛ چرا که دسترسی به این داده‌های باز در Hugging Face، فرصتی برای آموزش مدل‌های VLA بدون نیاز به ناوگان خودرویی گران‌قیمت است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر داده‌های ضدواقعیتی (Counterfactual) نشان می‌دهد که صنعت از مرحله‌ی «کپی‌برداری از راننده» به مرحله‌ی «درک پیامدها» رسیده است. این تغییر پارادایم یعنی مدل‌های آینده به‌جای یادگیری آماریِ مسیرها، یاد می‌گیرند که چرا یک مسیر خطرناک است. این همان گام نهایی برای رسیدن به سطح ۴ و ۵ خودمختاری است که در آن ماشین باید در شرایط پیش‌بینی‌نشده، منطق انسانی داشته باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.