پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف استدلال در Qwen-Drive 1.0؛ تضاد میان توصیف صحنه و مانور رانندگی

·۱۶ شهریور ۱۴۰۵۵ دقیقه مطالعه
«کیوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌کند، اما انتظار تطابق توضیح با مانور را نداشته باشید»
«کیوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌کند، اما انتظار تطابق توضیح با مانور را نداشته باشید»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری‌ای که ادراک فضایی را به عنوان یک الزام ساختاری (و نه یک ویژگی برآمده از زبان) تعریف می‌کند تا مشکل فراموشی فاجعه‌بار در مدل‌های رانندگی حل شود.

یک گسست خطرناک میان نحوه توضیح رانندگی توسط هوش مصنوعی و نحوه فرمان دادن واقعی آن وجود دارد. Qwen-Drive 1.0 می‌تواند دلیل ترمز گرفتن خود را به شما بگوید، اما این توضیح لزوماً با مانور اجرا شده مطابقت ندارد.

طبق گزارشی که در ۷ سپتامبر ۲۰۲۶ منتشر شد، توانایی توصیف یک صحنه ترافیکی به زبان متن، به‌طور خودکار به مدل درک فضایی سه‌بعدی لازم برای ناوبری ایمن نمی‌بخشد. این یافته نشان می‌دهد که «صحبت کردن درباره رانندگی» با «رانندگی کردن» دو مهارت کاملاً متفاوت هستند.

بسیاری از مدل‌های رانندگی فعلی از طریق تنظیم دقیق (Fine-tuning) مدل‌های بینایی-زبانی روی جفت‌های پرسش‌وپاسخ ترافیکی ساخته می‌شوند. بر اساس مستندات این پژوهش، این رویکرد دو نقطه ضعف اساسی دارد: نخست اینکه مدل‌های آموزش‌دیده بر پایه پرسش‌وپاسخ، همچنان در تشخیص دقیق فواصل و فضاهای باز ناتوان‌اند. دوم اینکه این فرآیند اغلب منجر به فراموشی فاجعه‌بار (Catastrophic Forgetting) می‌شود؛ وضعیتی که در آن مدل دانش عمومی خود را برای مواجهه با سناریوهای نادر و غیرمنتظره در جاده از دست می‌دهد.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های چندوجهی اشاره کردیم، این پدیده منحصر به رانندگی نیست. برای مثال، گوگل دیپ‌مایند در سال ۲۰۲۳ هنگام ساخت PaLM-E متوجه شد که نسخه‌های کوچک‌تر مدل پس از آموزش رباتیک، توانایی‌های زبانی خود را از دست می‌دهند و تنها نسخه‌ی ۵۶۲ میلیارد پارامتری پایدار ماند. به همین دلیل، بخش تحقیقات علی‌بابا سیستمی ساخت که ادراک فضایی را نه به عنوان یک ویژگی تصادفی، بلکه به عنوان یک الزام معماری در نظر می‌گیرد.

کوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌زند، فقط انتظار نداشته باشید توضیح با مانور همخوانی داشته باشد.

مدل Qwen-Drive 1.0 بر پایه مدل بنیادی Qwen3.5-4B (منتشر شده در فوریه) بنا شده و دو مؤلفه تخصصی را برای پر کردن شکاف میان پیکسل‌ها و برنامه‌ریزی معرفی می‌کند. این رویکرد در راستای پیشرفت‌های اخیر خانواده Qwen است که پیش‌تر شاهد برتری مدل Qwen3.8-27B در وظایف عامل‌محور چندوجهی نسبت به رقبای قدرتمندی چون Opus4.6 Max بودیم، تا قابلیت‌های عملیاتی مدل‌ها در محیط‌های پیچیده افزایش یابد.

جزئیات فنی

  • ماژول ادراک (Perception Module): این بخش با شناسایی اشیای سه‌بعدی و چیدمان جاده، یک نقشه از نمای چشم پرنده (BEV) ایجاد می‌کند. این ماژول در واقع ابزاری برای اندازه‌گیری است تا مشخص شود مدل چه مقدار داده‌ی فضایی را واقعاً از دوربین‌ها استخراج می‌کند.
  • کارشناس برنامه‌ریزی (Planning Expert): این ماژول از داده‌های داخلی مدل برای ترسیم مسیر حرکت خودرو در چند ثانیه آینده استفاده می‌کند.

پژوهشگران دریافتند که اگر فقط کارشناس برنامه‌ریزی آموزش ببیند و مدل بینایی-زبانی دست‌نخورده بماند، دقت فضایی پایین می‌ماند. عملکرد تنها زمانی بهبود یافت که خودِ مدل بینایی-زبانی روی وظایف فضایی آموزش دید؛ این یعنی درک فضایی باید به‌طور آگاهانه در مدل تزریق شود.

کوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌زند، اما انتظار تطابق توضیح با مانور را نداشته باشید

خط لوله داده و آموزش

تیم توسعه سیستم را در چند مرحله آموزش داد: ابتدا ادراک، سپس ترکیب آن با پرسش‌وپاسخ و در نهایت افزودن برنامه‌ریزی مسیر که از طریق یادگیری تقویتی بهینه‌سازی شد.

برای ساخت بخش بینایی-زبانی، استراتژی داده‌ای پیچیده‌ای به کار رفت:

  • ترکیب ۲۴ مجموعه داده عمومی از صحنه‌های ترافیکی.
  • استفاده از یک مدل هوش مصنوعی برای استانداردسازی پرسش‌ها و پاسخ‌ها به‌دلیل تفاوت در ساختار داده‌های اولیه.
  • ایجاد نمونه‌های دست‌ساز برای توضیح «چرایی» تصمیمات رانندگی (مثلاً اینکه دقیقاً کدام شیء باعث ترمز شد).

کوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌کند، اما انتظار تطابق توضیح با مانور را نداشته باشید.

عملکرد و یکپارچگی

در محک‌های داخلی، Qwen-Drive 1.0 در اکثر دسته‌های ادراکی از مدل‌های تخصصی پیشی گرفت. این مدل در توضیح علت و معلول (مثلاً چرا خودرو باید گردش کند) پیشرفت چشمگیری داشت، بدون اینکه دانش عمومی مدل پایه را از دست بدهد. حتی در برخی وظایف فضایی، نمره‌ای بالاتر از Qwen3.5-4B دست‌نخورده کسب کرد.

این قابلیت عمومی برای خودروهای مدرن حیاتی است؛ چرا که سیستم‌های سرگرمی و رانندگی در حال ادغام در یک واحد پردازشی واحد هستند. مدلی که دانش عمومی را فدای عملکرد رانندگی کند، باعث می‌شود کابین خودرو برای پاسخ به سوالات کاربر به یک مدل مجزا نیاز داشته باشد که هزینه محاسبات را افزایش می‌دهد.

در تست‌های شبیه‌ساز، نسخه‌ای که با پاداش‌ها بازآموزی شده بود، نرخ خروج خودرو از جاده را از ۲۴٪ به ۱۲٪ کاهش داد. همچنین مدل رانندگی محتاطانه‌تری داشت و مسافت کمتری را طی کرد.

کیون-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌کند، اما انتظار تطابق توضیح با مانور را نداشته باشید.

شکاف استدلال

با این حال، پژوهش بر یک «شکاف استدلال» خطرناک تأکید می‌کند. مدل گاهی محرک‌های متفاوت را با هم اشتباه می‌گیرد؛ مثلاً ممکن است یک چراغ قرمز دوردست و کودکی که وارد جاده می‌شود را رویدادهایی مشابه ببیند که واکنش یکسانی می‌طلبند، در حالی که زمان واکنش در این دو مورد کاملاً متفاوت است. نگران‌کننده‌تر اینکه مانور برنامه‌ریزی شده همیشه با استدلال ارائه شده توسط مدل هم‌راستا نیست.

کوئن-درایو ۱.۰ توضیح می‌دهد چرا ترمز می‌کند، اما انتظار تطابق توضیح با مانور را نداشته باشید

این موضوع نشان می‌دهد که اگرچه مدل از نظر مسیر حرکت (Trajectory) راننده‌ی بهتری شده، اما منطق داخلی آن همچنان یک لایه مجزا و گاهی غیرقابل‌اعتماد است. تیم Qwen این شکاف را با استفاده از محک HopChain اندازه‌گیری کرد؛ جایی که مدل‌های بینایی-زبانی علی‌رغم نمرات بالا در بنچمارک‌های استاندارد، در طبقه‌بندی اشیا و روابط فضایی دچار خطا می‌شدند.

علاوه بر این، سیستم با داده‌های «خارج از توزیع» (Out-of-distribution) مشکل دارد و نرخ تشخیص آن در ویدئوهایی با تنظیمات دوربین متفاوت به‌شدت کاهش می‌یابد.

امنیت و مسیر آینده

اتصال یک مدل زبانی به توابع رانندگی، سطوح حمله جدیدی ایجاد می‌کند. پژوهشگران دانشگاه UC Santa Cruz نشان دادند که با قرار دادن یک تابلوی برچسب‌دار در دید دوربین، می‌توان سیستم DriveLM را فریب داد تا به سمت عابرانی که قبلاً به‌درستی شناسایی کرده بود، منحرف شود.

با چرخش تحقیقات به سمت مدل‌های اقدام جهانی (World Action Models)، تمرکز بر «همراستاسازی تفسیرپذیری» قرار گرفته است. این پژوهش ثابت می‌کند مدلی که در پرسش‌وپاسخ تصویری (VQA) نمره بالایی می‌گیرد، همچنان می‌تواند «کورِ فضایی» باشد. خطر اصلی، هوش مصنوعی‌ای است که توضیحی منطقی و با اعتمادبه‌نفس برای یک مانور می‌دهد، در حالی که آن مانور بر اساس یک محاسبه‌ی فضایی غلط است.

اکنون پژوهشگران می‌توانند این محدودیت‌ها را بررسی کنند، زیرا این مدل به‌صورت رایگان در Hugging Face، ModelScope و GitHub منتشر شده است.

گام بعدی شما

  • اگر توسعه‌دهنده سیستم‌های اتومبیل‌ران هستید، مدل را از Hugging Face دریافت کرده و با داده‌های دوربین‌های متفاوت تست کنید تا نرخ خطای Out-of-distribution را بسنجید.
  • در تحلیل‌های خود، هرگز به توضیحات متنی مدل (Reasoning) به عنوان دلیل قطعیِ یک مانور اعتماد نکنید و آن را با داده‌های BEV تطبیق دهید.
  • مستندات HopChain را مطالعه کنید تا متوجه شوید چرا بنچمارک‌های استاندارد VQA در تشخیص خطاهای فضایی ناتوان‌اند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار داده‌های شبیه‌ساز، ثابت می‌کند که توانایی زبانی هرگز جایگزین درک هندسی نمی‌شود. این یافته برای ایمنی خودروهای خودران حیاتی است زیرا هشدار می‌دهد که توضیحات منطقی مدل می‌تواند پوششی برای خطاهای محاسباتی باشد.

تأثیر برای ایران

این مدل به‌دلیل انتشار با وزن‌های باز در Hugging Face، برای پژوهشگران ایرانی در حوزه بینایی ماشین و خودروهای خودران به‌طور رایگان در دسترس است.

·نگاه ما
تحریریه دات‌هوش

اعتماد به «توضیحات» مدل‌های زبانی در سیستم‌های حساس مانند رانندگی، می‌تواند منجر به توهمی خطرناک شود که در آن مدل منطقی به نظر می‌رسد اما عملی غلط انجام می‌دهد. این شکاف نشان می‌دهد که همراستاسازی (Alignment) در مدل‌های چندوجهی هنوز در سطح سطحی است و مدل‌ها صرفاً یاد گرفته‌اند «شبیه به انسان توضیح دهند» نه اینکه «مانند انسان درک کنند».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.