پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Alpamayo 2 Super کیفیت داده‌های آموزشی روبوتاکسی را ارتقا می‌دهد؟

·۱۳ مرداد ۱۴۰۵۵ دقیقه مطالعه
ابررایانه Alpamayo 2 انویدیا توسعه ربات‌تاکسی را برای استفاده تجاری ممکن ساخت
ابررایانه Alpamayo 2 انویدیا توسعه ربات‌تاکسی را برای استفاده تجاری ممکن ساخت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر مجوز Alpamayo از پژوهشی به تجاری (OpenMDW-1.1). این نخستین بار است که یک مدل استدلالی با این مقیاس برای کاربردهای عملیاتی روبوتاکسی به‌صورت باز عرضه می‌شود تا به‌عنوان مدل معلم عمل کند.

توسعه‌دهندگان روبوتاکسی‌های تجاری حالا یکی از بزرگ‌ترین موانع مجوز نرم‌افزاری را پشت سر گذاشته‌اند. در ۴ آگوست ۲۰۲۶، شرکت انویدیا (NVIDIA) مدل Alpamayo 2 Super را منتشر کرد؛ یک مدل استدلالی (Reasoning Model) — شبیه شطرنج‌بازی که قبل از هر حرکت، چند گام جلوتر را در ذهن می‌بیند — با ۳۴ میلیارد پارامتر که تحت مجوز OpenMDW-1.1 عرضه شده است. این مجوز به خودروسازان و تأمین‌کنندگان اجازه می‌دهد بدون نیاز به کسب اجازه اضافی، این فناوری را مستقر کرده یا توزیع کنند.

زمینه و مجوزها

بر اساس مستندات منتشرشده، این تغییر رویکرد، انتقال انویدیا از فضای پژوهشی به کاربرد تجاری است. نسخه‌های پیشین خانواده Alpamayo تنها برای کاربردهای تحقیق و توسعه (R&D) محدود بودند. اما اکنون انویدیا مجوز باز و سهل‌گیرانه OpenMDW-1.1 را به‌کار گرفته است. این مجوز که در ۲۸ می ۲۰۲۶ توسط بنیاد لینوکس (Linux Foundation) معرفی و منتشر شد، اکنون در سراسر خط تولید مدل‌های Alpamayo اعمال شده است. این مجوز به‌طور کامل مواردی چون تنظیم دقیق (Fine-tuning)، مدل‌های مشتق شده و توزیع تجاری را پوشش می‌دهد.

این استراتژی جدید در کنار سایر خانواده‌های مدل انویدیا مانند Cosmos، Isaac GR00T، Ising و Nemotron قرار می‌گیرد. تأثیر این اقدام فوری است: توسعه‌دهندگان، سازندگان کامیون و تأمین‌کنندگان قطعات اکنون می‌توانند هرhangi از مدل‌های این خانواده را به‌صورت تجاری مستقر کنند. پاسخ صنعت به این اقدام بسیار شدید بوده است؛ به گونه‌ای که Alpamayo به پرطرفدارترین مدل استدلالی باز برای رانندگی خودکار در پلتفرم Hugging Face تبدیل شده و تعداد دانلودهای آن از مرز ۵۰۰ هزار مورد عبور کرده است.

بسیاری از سیستم‌های خودران در مواجهه با «رویدادهای دم‌دراز» (Long-tail events) شکست می‌خورند؛ یعنی الگوهای ترافیکی نادری و چندعاملی که برنامه‌نویسی دستی آن‌ها تقریباً غیرممکن است و سیستم‌های متداول تشخیص اشیاء و پیش‌بینی حرکت معمولاً در برابر آن‌ها ناتوان هستند. این چالش‌ها دقیقاً همان نقطه‌ای است که جایگزینی خط‌لوله‌های ایستا با سامانه‌های شناختی برای دستیابی به انعطاف‌پذیری بیشتر در محیط‌های پیچیده ضروری می‌گردد. Alpamayo 2 Super این مشکل را با رویکرد «زنجیره علیت» (Chain-of-Causation) حل می‌کند. به جای اینکه فقط یک مختصات یا نقطه بعدی را پیش‌بینی کند، توضیح می‌دهد چرا یک خودرو باید حق تقدم بدهد یا تغییر خط دهد. این مدل درست مثل یک مربی رانندگی باتجربه است که به جای دستور دادن به چرخش فرمان، منطق و دلیل پشت آن تصمیم را برای شاگرد شرح می‌دهد.

معماری فنی و قابلیت‌ها

این مدل برای کنترل مستقیم فرمان یا ترمز خودرو در لحظه (Real-time) طراحی نشده است. بلکه یک مدل «معلم» در فضای ابری است که بر پایه Cosmos 3 Super Reasoner ساخته شده و با استفاده از یادگیری تقویتی (Reinforcement Learning) پس‌-آموزش دیده است. طبق کارت مدل (Model Card) شرکت، معماری آن شامل اجزای زیر است:

  • یک ستون فقرات بینایی-زبانی (Vision-Language Model) با ۳۲ میلیارد پارامتر.
  • یک رمزگشای اقدام بر پایه مدل انتشار (Diffusion Model) — شبیه هنرمندی که از میان نویز و برفک، یک تصویر واضح می‌سازد — با ۲.۳ میلیارد پارامتر.
  • درون‌دادهایی که طیف گسترده‌ای از ویدیوهای چنددوربینه، متن و تاریخچه حرکتی خودرو را شامل می‌شود.

این ساختار پیچیده برای هر موقعیت رانندگی، پنج خروجی جفت‌شده و هم‌زمان تولید می‌کند: یک مسیر برنامه‌ریزی شده (Trajectory)، یک ردپای زنجیره علیت برای توضیح منطق تصمیم، یک اقدام سطح‌بالا (Meta-action) مانند «حق تقدم دادن» یا «تغییر خط»، برچسب‌های استدلالی خودکار برای داده‌های آموزشی و پاسخ به پرسش‌های تصویری (VQA) که مستقیماً به نواحی خاصی از تصاویر دوربین‌ها اشاره دارند.

انویدیا برای اثبات کارایی این مدل، نمره ۷۹.۲ را در معیار Lingo-Judge از بنچمارک LingoQA کسب کرد؛ این بنچمارک یک ارزیابی پاسخ به پرسش‌های تصویری است که در اصل توسط شرکت Wayve توسعه یافته بود. این نتیجه، Alpamayo را در جایگاه اول میان نزدیک به ۴۰ مدل ارزیابی شده قرار می‌دهد. طبق داده‌های داخلی انویدیا، این مدل ۲۳.۲ امتیاز از GPT-4o، ۱۵.۱ امتیاز از Gemini 2.5 Pro و ۱۷ امتیاز از Qwen2.5-VL 72B پیشتاز بوده است. در حالی که مدل‌های تخصصی مانند Alpamayo بر روی استدلال متمرکزند، غول‌های زبانی دیگر نیز در حال گسترش مقیاس خود هستند، همان‌طور که رونمایی علی‌بابا از مدل Qwen3.8-Max با پارامترهایی در مقیاس تریلیون، نشان‌دهنده رقابت شدید در حوزه مدل‌های بزرگ‌زبان است.

جزئیات آموزش و اعتبارسنجی

آموزش این مدل بر روی حجم عظیمی از داده‌ها برای مدیریت سناریوهای پیچیده خودروهای خودران (AV) صورت گرفته است:

  • داده‌های ویدیویی: حدود ۱۱۵ هزار ساعت ویدیو از دوربین‌های مختلف که شامل حاشیه‌نویسی‌های مربوط به حرکت خود خودرو (Egomotion) و مسیرهاست.
  • داده‌های استدلالی: حدود ۳.۷ میلیون زنجیره علیت که از طریق دوربین‌ها، حسگرهای لرزشی (Inertial Sensors) و GPS و با استفاده از ترکیبی از برچسب‌گذاری‌های دستی و خودکار جمع‌آوری شده‌اند.
  • شبیه‌سازی: ارزیابی‌های حلقه-بسته (Closed-loop) در شبیه‌ساز AlpaSim انویدیا روی ۹۱۰ سناریو از مجموعه داده PhysicalAI-AV-NuRec انجام شد.
  • دقت: مدل در ۹۳۷ نمونه دشوار، خطای مسیر باز (Open-loop trajectory error) تنها ۰.۹۱۱ متر در یک بازه زمانی ۶.۴ ثانیه‌ای داشت.

استقرار و ایمنی

به دلیل ابعاد حجیم (۳۴ میلیارد پارامتر)، این مدل به توان محاسباتی قابل توجهی نیاز دارد. انویدیا این سیستم را روی یک واحد پردازش گرافیکی (GPU) مدل H100 دیتاسنتر با ۸۰ گیگابایت حافظه اعتبارسنجی کرد؛ در این حالت، یک چیدمان هفت‌دوربینه، در اوج مصرف به حدود ۷۲ گیگابایت حافظه دستگاه نیاز داشت. معماری‌های دیگر GPU هنوز اعتبارسنجی نشده‌اند. برای استقرار واقعی در خودرو، توسعه‌دهندگان از Alpamayo برای تولید داده‌های مصنوعی و زنجیره‌های استدلالی استفاده می‌کنند و سپس این دانش را از طریق تقطیر (Distillation) — شبیه خلاصه‌سازی یک کتاب هزارصفحه‌ای در یک برگه برای یادگیری سریع — به مدل‌های کوچک‌تر و بهینه برای رایانش لبه (Edge Computing) منتقل می‌کنند تا استنتاج در لحظه روی سخت‌افزار خودرو امکان‌پذیر شود.

ایمنی در این مدل از طریق گردش‌کار اعتبارسنجی Halos در ذات منطق آن گنجانده شده است. با پیوند مستقیم مشاهدات به اقدامات، مدل از همراستایی با استاندارد ISO/PAS 8800، که استاندارد بین‌المللی ایمنی برای هوش مصنوعی در خودروهای جاده‌ای است، پشتیبانی می‌کند. به ادعای انویدیا، این خودکارسازی که به عنوان یک برچسب‌زن خودکار (Autolabeler) روی داده‌های اختصاصی ناوگان عمل می‌کند، می‌تواند چرخه تولید حاشیه‌نویسی‌ها را از چندین ماه به تنها چند روز کاهش دهد.

این عرضه، نقطه culmination یک روند سریع است. پس از معرفی Alpamayo 1 (یک مدل پژوهشی ۱۰ میلیارد پارامتری) در نمایشگاه CES، شرکت مدل Alpamayo 2 Super را در ۳۱ می ۲۰۲۶ در رویداد GTC تایپه معرفی کرد. در آن زمان، تعداد دانلودها نزدیک به ۴۰۰ هزار بود، رقمی که از آن پس به بیش از ۵۰۰ هزار رسید است.

انویدیا اکنون یک اکوسیستم کامل را پیرامون این مدل ایجاد کرده است: AlpaSim برای شبیه‌سازی حلقه-بسته، AlpaGym برای یادگیری تقویتی و یک خط لوله (Pipeline) متن‌باز برای برچسب‌گذاری خودکار. برای مدیران کسب‌وکار در حوزه خودروهای خودران، نتیجه این اتفاق کاهش شدید هزینه‌های تحقیق و توسعه (R&D overhead) است. یک تیم توسعه اکنون می‌تواند مدل استدلالی سطح جهانی را روی داده‌های اختصاصی ناوگان خود تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا در یک حوزه دقیق شود — کند، داده‌های حساس را در داخل سازمان نگه دارد و بدون نیاز به ساخت دوباره قابلیت‌های بنیادی از صفر، محصول تجاری خود را عرضه کند.

سرعت رسیدن به سطح ۴ خودرانی اکنون به این بستگی دارد که خودروسازان با چه سرعتی می‌توانند بینش‌های این «مدل معلم» را به محاسبات لبه‌ای ایمن و سریع تبدیل کنند.

گام بعدی شما

  • اگر در حوزه داده‌های خودران فعال هستید، مدل Alpamayo 2 Super را از Hugging Face برای تولید برچسب‌های استدلالی (Reasoning Labels) امتحان کنید.
  • مستندات مجوز OpenMDW-1.1 را برای بررسی محدودیت‌های توزیع تجاری مطالعه کنید.
  • مسیر تقطیر (Distillation) مدل‌های بزرگ به مدل‌های کوچک برای سخت‌افزارهای On-board را در Roadmap فنی خود بگنجانید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار فنی انویدیا و استانداردهای ISO، ریسک ورود خودروسازان به بازار روبوتاکسی را به‌شدت کاهش می‌دهد. حذف موانع مجوز برای مدل‌های استدلالی، سرعت رسیدن به خودرانی سطح ۴ را از سال‌ها به ماه‌های آینده می‌کشاند.

تأثیر برای ایران

به‌دلیل محدودیت‌های سخت‌افزاری و تحریم‌های GPUهای H100، دسترسی مستقیم به استنتاج این مدل برای شرکت‌های ایرانی دشوار است؛ اما امکان استفاده از وزن‌های باز آن روی سرورهای خارجی برای پژوهشگران حوزه‌ی بینایی ماشین فراهم است.

·نگاه ما
تحریریه دات‌هوش

استراتژی انویدیا در اینجا جابه‌جایی هوشمندانه از فروش «ابزار» به فروش «استاندارد» است. با باز کردن وزن‌های یک مدل استدلالی قدرتمند، انویدیا عملاً تعریف می‌کند که رانندگی خودکار باید چگونه «فکر» کند و بدین ترتیب، تمام اکوسیستم توسعه‌دهندگان را به سمت معماری‌های مورد حمایت سخت‌افزارهای خود سوق می‌دهد. این یعنی تسلط بر لایه‌ی نرم‌افزاری برای تضمین فروش سخت‌افزاری در مقیاس میلیارد دلاری.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.