پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Robostral Navigate دقت ناوبری ربات‌ها را با یک دوربین RGB به ۷۶.۶٪ رساند

·۲۳ تیر ۱۴۰۵۵ دقیقه مطالعه
ربوسترال نویگیت: مدل ۸ میلیارد پارامتری میسترال برای ناوبری ربات‌ها با یک دوربین RGB در محیط‌های پیچیده
ربوسترال نویگیت: مدل ۸ میلیارد پارامتری میسترال برای ناوبری ربات‌ها با یک دوربین RGB در محیط‌های پیچیده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل حسگرهای عمق و LiDAR با یک دوربین RGB معمولی برای رسیدن به دقت SOTA در ناوبری. همچنین کاهش ۲۲ برابری توکن‌های آموزشی از طریق تکنیک prefix-caching.

۷۶.۶ درصد موفقیت؛ این عددی است که Mistral AI برای مدل Robostral Navigate ثبت کرده است. این مدل ۸ میلیارد پارامتری به ربات‌ها اجازه می‌دهد دستورات زبانی چندمرحله‌ای و پیچیده را در محیط‌هایی که هرگز در مرحله آموزش ندیده‌اند، اجرا کنند. این دستاورد نشان‌دهنده توانایی بالای مدل در تعمیم یادگیری به فضاهای ناشناخته است.

بر اساس مستندات فنی این مدل، سیستم تنها با تکیه بر یک دوربین RGB (دوربین‌های رنگی معمولی) عمل می‌کند و توانسته است آرایه‌های پیچیده لایدار (LiDAR) و حسگرهای عمق‌سنج را شکست دهد؛ آن هم بدون نیاز به سخت‌افزارهای گران‌قیمت تشخیص عمق. این یعنی ربات می‌تواند بدون داشتن نقشه‌های پیش‌فرض یا سنسورهای گران‌بها، محیط را درک کند. چنین رویکردی در تحلیل مرزهای مکانی و درک بصری، یادآور پیشرفت‌های اخیر در مدل‌هایی مانند LingBot-Vision است که بر دقت تحلیل فضایی متمرکز بودند.

همان‌طور که در تحلیل قبلی ما درباره‌ی پیشروی Mistral در حوزه هوش مصنوعی تجسم‌یافته (Embodied AI) اشاره کردیم، این عرضه نشان‌دهنده تغییری استراتژیک از مدل‌های کلی بینایی-زبانی به سمت یک عامل (Agent) تخصصی برای ناوبری است. در حالی که استانداردهای صنعتی فعلی برای نقشه‌برداری سه‌بعدی به تلفیق حسگرهای متعدد تکیه می‌کنند، Robostral Navigate ناوبری را به عنوان امتدادی از مبنی‌سازی (Grounding) می‌بیند؛ یعنی ربات را می‌آموزد تا پیش از حرکت، هدف خود را در میدان دید بصری «نشانه» برود.

زمینه محیطی و عملیاتی

این مدل برای مدیریت فضاهای زنده و پیچیده طراحی شده است؛ محیط‌هایی مملو از انسان‌ها و موانعی که در داده‌های آموزشی حضور نداشتند. این قابلیت باعث می‌شود ربات در محیط‌های پویا دچار سردرگمی نشود. این محیط‌های هدف شامل موارد زیر است:

  • ساختمان‌های مسکونی و تجاری
  • محیط‌های اداری حرفه‌ای
  • فضاهای باز و محیط‌های بیرونی

طبق گزارش وب‌سایت marktechpost.com، این مدل قادر است یک دستور متنی دقیق و مفصل به زبان ساده را پردازش کرده و کل وظیفه را به‌طور مستقل به پایان برساند. برای مثال، می‌توان به ربات دستور داد: «لابی را ترک کن، از راهرو عبور کن، وارد اتاق تجهیزات شو و مقابل دومین قفسه متوقف شو». در این مثال، ربات باید چهار مرحله مختلف را شناسایی و به ترتیب اجرا کند. این نوع کاربرد در محیط‌های اداری، شباهت بسیاری به استراتژی‌های Flexion Robotics دارد که بر آموزش ربات‌های انسان‌نما برای انجام امور اداری متمرکز است.

داده‌های این گزارش نشان می‌دهد که مدل در محک R2R-CE (ناوبری اتاق-به-اتاق در محیط‌های پیوسته) و در بخش «اعتبارسنجی دیده‌نشده» (validation unseen)، به نرخ موفقیت ۷۶.۶٪ دست یافته است. این امتیاز ۹.۷ واحد بیشتر از بهترین روش‌های تک‌دوربینه فعلی است و ۴.۵ واحد بالاتر از برترین سیستم‌های عمق‌سنج یا سیستم‌های چنددوربینه قرار دارد.

معماری فنی و فرآیند تصمیم‌گیری

این مدل از یک فرآیند تصمیم‌گیری دوگانه برای حفظ استواری در برابر تغییرات لنز دوربین (Camera Intrinsics) و مقیاس‌های مختلف جهان واقعی استفاده می‌کند:

  • اشاره‌گذاری (Pointing): مدل مختصات تصویری دقیق هدف را در نمای فعلی پیش‌بینی کرده و جهت‌گیری لازم هنگام رسیدن به مقصد را تعیین می‌کند. این روش باعث می‌شود سیستم در برابر تغییرات سخت‌افزاری دوربین یا ابعاد مختلف محیط مقاوم بماند.
  • جایگزین جابه‌جایی محلی (Local-Displacement Fallback): زمانی که هدف خارج از میدان دید فعلی دوربین باشد، مدل به طور خودکار به حالت جابه‌جایی در مختصات محلی ربات تغییر وضعیت می‌دهد. در این حالت، دستورات به شکل عددی صادر می‌شوند (مثلاً: «۲ متر جلو برو، ۱.۵ متر به چپ برو و ۲۵ درجه به چپ بچرخ») تا ربات بتواند هدف را دوباره در میدان دید خود پیدا کند.

بهینه‌سازی آموزش و داده‌ها

شرکت Mistral AI به‌جای استفاده از مدل‌های بینایی-زبانی (VLM) متن‌باز، این مدل را بر پایه یک VLM اختصاصی برای مبنی‌سازی ساخت. این مدل پایه به‌طور ویژه برای انجام تکالیفی چون شمارش اشیا، اشاره‌گذاری و مکان‌یابی دقیق اشیا طراحی شده است. در این معماری، ناوبری به عنوان یک خروجی طبیعی ظاهر می‌شود: وقتی مدل بفهمد اشیا دقیقاً کجا هستند، یاد می‌گیرد چگونه به سمت آن‌ها حرکت کند.

برای تولید داده‌های آموزشی، آن‌ها یک خط لوله شبیه‌ساز توسعه دادند که تقریباً ۴۰۰,۰۰۰ مسیر (Trajectory) طی‌شده را در ۶,۰۰۰ صحنه متمایز تولید کرد. این حجم گسترده از داده‌های سنتتیک برای پوشاندن طیف وسیعی از سناریوها ضروری بود.

تیم توسعه برای بهینه‌سازی آموزش، از الگوریتم prefix-caching و ماسک‌گذاری توجه مبتنی بر درخت (tree-based attention-masking) استفاده کردند. این رویکرد کل اپیزودها را در یک توالی واحد فشرده می‌کند و اجازه می‌دهد مدل تمام گام‌های زمانی را در یک پاس پیشرو (single forward pass) آموزش ببیند، بدون اینکه نشت اطلاعات بین گام‌ها رخ دهد. این متد، تعداد توکن‌های آموزشی را ۲۲ برابر کاهش داد و زمان آموزش را از چندین ماه به تنها چند روز رساند.

پس از اتمام آموزش نظارت‌شده (Supervised Training)، تیم از الگوریتم CISPO استفاده کرد که یک روش یادگیری تقویتی آنلاین است. این مرحله به مدل اجازه داد تا از طریق آزمون و خطا یاد بگیرد، از شکست‌ها بازیابی کند و رفتارهای اکتشافی به دست آورد. این رویکرد به‌طور خاص مشکل «تغییر توزیع» (distribution shift) را که در روش‌های ساده کپی‌برداری از رفتار (behavior cloning) وجود دارد، حل کرد و نرخ موفقیت را مستقیماً ۳.۲٪ افزایش داد.

محک‌های عملکردی

عملکرد مدل با استفاده از R2R-CE ارزیابی شد که یک استاندارد جهانی مبتنی بر Matterport3D است. در این بنچمارک، عامل‌ها باید دستورات زبانی را در محیط‌های سه‌بعدی پیوسته دنبال کنند. معیارهای سنجش شامل نرخ موفقیت (Success Rate)، نرخ موفقیت اوراکل (Oracle Success Rate)، خطای ناوبری (Navigation Error) و موفقیت وزن‌دهی شده بر اساس طول مسیر است.

نتایج به شرح زیر است:

  • اعتبارسنجی دیده‌شده (Validation Seen): ۷۹.۴٪ نرخ موفقیت
  • اعتبارسنجی دیده‌نشده (Validation Unseen): ۷۶.۶٪ نرخ موفقیت

از منظر معماری، این عرضه این فرض را به چالش می‌کشد که برای رسیدن به سطح SOTA (بهترین وضعیت فعلاً موجود) در ناوبری، حتماً به حسگرهای عمق با دقت بالا نیاز است. با کاهش سخت‌افزار به یک دوربین RGB، Mistral AI سد ورود برای استقرار عامل‌های خودگردان در پلتفرم‌های چرخ‌دار، چهارپایان و حتی پرنده را پایین آورد. همچنین به دلیل استواری در برابر ویژگی‌های دوربین، یک ناوگان از ربات‌هایی با اندازه‌های مختلف می‌توانند از یک مدل واحد و مشترک استفاده کنند.

کاربردهای عملی

تطبیق‌پذیری Robostral Navigate کاربردهای فوری زیر را در دنیای واقعی ممکن می‌کند:

  • تولید صنعتی: جابه‌جایی قطعات بین ایستگاه‌های مختلف تولید بر اساس یک دستور زبانی واحد.
  • لجستیک و انبارداری: استفاده از ربات‌های چرخ‌دار برای جابه‌جایی بسته‌ها در محیط پیچیده انبار.
  • صنعت پذیرایی: به‌کارگیری ربات‌ها برای هدایت مهمانان از لابی هتل به اتاق‌های خاص آن‌ها.

تکیه بر داده‌های سنتتیک در این مقیاس (۴۰۰ هزار مسیر) نشان می‌دهد که شکاف «شبیه‌ساز به واقعیت» (sim-to-real) در تکالیف ناوبری در حال بسته شدن است. همچنین بهره‌وری حاصل از prefix-caching الگویی برای سایر آزمایشگاه‌هایی است که قصد دارند عامل‌های تجسم‌یافته را بدون هزینه‌های محاسباتی کمرشکن آموزش دهند.

متخصصان صنعت باید عملکرد Robostral Navigate را در محیط‌های پرتردد انسانی، خارج از بنچمارک‌های R2R-CE زیر نظر بگیرند. انتقال از موفقیت در شبیه‌ساز به استقرار واقعی در انبارها یا هتل‌ها، آزمون نهایی برای استواری مکانیزم اشاره‌گذاری خواهد بود.

گام بعدی شما

  • بررسی مستندات Mistral AI برای درک نحوه پیاده‌سازی لایه‌های VLM در ربات‌های سبک.
  • تحلیل مقایسه‌ای هزینه‌های سخت‌افزاری سیستم‌های تک‌دوربینه در برابر سیستم‌های مبتنی بر LiDAR در پروژه‌های اتوماسیون.
  • دنبال کردن گزارش‌های مربوط به استقرار واقعی این مدل در محیط‌های غیرشبیه‌سازی شده.

اما تأثیر این رویکرد بر کاهش مصرف انرژی در استنتاج مدل‌های رباتیک حتی خیره‌کننده‌تر است؛ برای بررسی این موضوع به تحلیل ما درباره بهینه‌سازی توکن‌ها در لبه مراجعه کنید.

چرا این موضوع مهم است؟

این موفقیت با تکیه بر تخصص Mistral در مدل‌های زبانی، سد سخت‌افزاری برای ورود به بازار رباتیک را می‌شکند. کاهش نیاز به حسگرهای گران‌قیمت، استقرار عامل‌های هوشمند را در مقیاس صنعتی به‌صرفه و سریع‌تر می‌کند.

تأثیر برای ایران

این مدل به دلیل ماهیت نرم‌افزاری و کاهش نیاز به سخت‌افزارهای گران‌قیمت (مانند LiDAR)، فرصتی برای تیم‌های رباتیک ایرانی است تا با هزینه‌ای کمتر، سیستم‌های ناوبری پیشرفته را پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

حذف وابستگی به LiDAR یک ضربه فنی به سخت‌افزارهای گران‌قیمت است و نشان می‌دهد که «هوش» مدل در درک بصری اکنون می‌تواند جایگزین «دقت» حسگرهای فیزیکی شود. این رویکرد احتمالاً منجر به موجی از ربات‌های ارزان‌قیمت‌تر می‌شود که به جای نقشه‌های دقیق سه‌بعدی، بر اساس درک معنایی محیط حرکت می‌کنند. به نظر ما، نقطه تمرکز صنعت از «جمع‌آوری داده‌های محیطی دقیق» به سمت «بهینه‌سازی استنتاج بصری در لحظه» تغییر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.