پرش به محتوای اصلی
پرش به محتوای مقاله

HERMES++: کاهش ۴۱.۶ درصدی خطای پیش‌بینی مسیر در افق ۳ ثانیه‌ای

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه
HERMES++: کاهش ۴۱.۶ درصدی خطای پیش‌بینی مسیر در افق ۳ ثانیه‌ای
اشتراک‌گذاری

اگر در حال طراحی سامانه‌های رانندگی خودکار هستید، دیگر مجبور نیستید بین «دیدن جاده» و «پیش‌بینی آن» یکی را انتخاب کنید. HERMES++ هر دو کار را در یک شبکه انجام می‌دهد؛ یعنی هم به پرس‌وجوهای زبانی پاسخ می‌دهد و هم مسیر پیش‌رو را نقشه‌برداری می‌کند.

تا پیش از این، مهندسان از دو ابزار مجزا استفاده می‌کردند. یکی نمای «دید پرنده» (BEV) — که شبیه نگاه یک پهپاد از بالای جاده است — را بازسازی می‌کرد و دیگری بدون درک معنای صحنه، هندسه‌ی آینده را حدس می‌زد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های چندوجهی (Multimodal) — مدل‌هایی که مثل ما با چند حس مختلف دنیا را می‌خوانند — اشاره کردیم، نبود ارتباط میان ادراک و استدلال، همواره شکافی میان تفکر خودرو و حرکت فیزیکی آن ایجاد می‌کرد.

طبق گزارش منتشر شده در ۱۴ مه ۲۰۲۶، چارچوب HERMES++ از سه سازوکار اصلی بهره می‌برد:

  • فشرده‌سازی نماهای دوربین‌های متعدد در یک نقشه‌ی BEV کم‌حجم برای کاهش مصرف حافظه.
  • استفاده از «پرس‌وجوهای جهانی» برای هدایت ادراک خودرو توسط مدل زبانی.
  • پیوند دادن معنای فعلی صحنه به هندسه‌ی آینده.

به نقل از گزارش dev.to، این رویکرد توانست «فاصله‌ی چمفر» (Chamfer Distance) را در افق ۳ ثانیه‌ای، در مقایسه با مدل پایه ViDAR، تا ۴۱.۶٪ کاهش دهد.

این تغییر یعنی «مغز» خودرو حالا دلیلِ حضور در یک مکان را می‌فهمد. مدل به جای دیدن یک خط ساده، درباره‌ی «لاین قابل راندن» استدلال می‌کند. برای توسعه‌دهندگان، این یعنی نیاز به خط‌لوله‌های (pipelines) جداگانه و سنگین برای ادراک و پیش‌بینی کمتر می‌شود. با این حال، نبود آزمایش‌های مربوط به «نویز محیطی» در دنیای واقعی نشان می‌دهد که این موفقیت فعلاً در سطح آزمایشگاهی است.

گام بعدی شما

  • چک‌پوینت‌های منتشرشده را در یک محیط شبیه‌ساز اجرا کنید.
  • دستوراتی مثل «مسیر قابل راندن را برای دو ثانیه آینده نشان بده» را امتحان کنید تا قدرت مدل را ببینید.
  • تأثیر ادغام زبان بر دقت هندسی را با مدل‌های پایه مقایسه کنید.

اما چالش اصلی، انتقال این موفقیت از آزمایشگاه به خیابان‌های پرتردد است — در تحلیل ما درباره‌ی چالش‌های رایانش لبه (Edge AI) بخوانید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار داده‌های بنچمارک، نشان می‌دهد که مدل‌های زبانی می‌توانند درک هندسی محیط را بهبود بخشند. نتیجه این است که خودروهای خودران در موقعیت‌های پیچیده، تصمیمات ایمن‌تری می‌گیرند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.