پرش به محتوای اصلی
پرش به محتوای مقاله

مدل CT-VAM: دستیابی به عملکرد VLAهای غول‌پیکر با تنها ۶۸ میلیون پارامتر

·۱۹ خرداد ۱۴۰۵۱ دقیقه مطالعه
مدل CT-VAM: دستیابی به عملکرد VLAهای غول‌پیکر با تنها ۶۸ میلیون پارامتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نوآوری اصلی در معرفی جریان TARS است که برخلاف مدل‌های VLA سنتی، جریان‌های بصری و کنشی را از هم تفکیک می‌کند تا داده‌های حسی حجیم، دستورات کلیدی وظیفه را خفه نکنند.

اگر تصور می‌کنید برای کنترل دقیق ربات‌ها به مدل‌هایی با میلیاردها پارامتر نیاز است، باید دیدگاه خود را تغییر دهید. مدل جدیدی معرفی شده است که با کسری از آن حجم محاسباتی، همان نتایج عملیاتی را می‌گیرد.

CT-VAM ثابت کرد که دست‌کاری‌های پیچیده رباتیک لزوماً نیازمند مدل‌های حجیم نیست. به نقل از پژوهشی که در ۹ ژوئن ۲۰۲۶ در arxiv.org منتشر شد، این مدل با تنها ۶۸ میلیون پارامتر، در نرخ موفقیت با مدل‌های عظیم بینایی-زبانی-کنشی (VLA) برابری می‌کند و اجازه می‌دهد کنترل سریع و بسته-حلقه (Closed-loop) روی سخت‌افزارهای محدود اجرا شود.

همان‌طور که در بررسی‌های پیشین خود درباره‌ی قوانین مقیاس‌پذیری (Scaling Laws) در رباتیک اشاره کردیم، همواره یک تضاد میان استدلال معنایی پیچیده و تأخیر پایین مورد نیاز برای حرکت فیزیکی وجود داشته است. مدل‌های VLA بزرگ می‌توانند وظایف را برنامه‌ریزی کنند، اما سرعت استنتاج (Inference) آن‌ها اغلب مانع از اجرای فرکانس‌بالا می‌شود. این خلأ، نیاز به یک معماری «ابر-لبه» ایجاد می‌کند که در آن قصد کلی در ابر پردازش شود و اجرای محلی، سبک و سریع باقی بماند.

قلب تپنده CT-VAM، جریان مسیریابی کنشی تالاموسی (TARS) است؛ یک دکودر توجه شرطی که جریان‌های کنش، بصری و وظیفه را به‌طور مستقل مسیریابی می‌کند. طبق مستندات این پژوهش، این مکانیسم مانع از آن می‌شود که توکن‌های حسی متراکم، شرایط فشرده و مرتبط با وظیفه را در هم ببلعند.

مشخصات فنی این مدل عبارتند از:

  • تعداد پارامترها: ۶۸ میلیون پارامتر
  • معیار ارزیابی: نرخ موفقیت رقابتی در بنچمارک LIBERO
  • متد اجرا: مدل‌سازی داخلی جریان-سازگار (Flow-consistent inpainting) برای اجرای تکه‌های ناهمگام
  • سخت‌افزار: بهینه‌شده برای استقرار روی پلتفرم‌های رایانش لبه (Edge Computing)

این معماری، روند فعلی بزرگ‌نمایی تمام اجزای پشته‌ی رباتیک را به چالش می‌کشد. با جداسازی «قصدِ وظیفه» از «اجرا» — که بازتابی از سیستم مخچه-تالاموسی در بیولوژی است — پژوهشگران نشان دادند که هماهنگی حسی-حرکتی، مسئله‌ای کاملاً متمایز از استدلال معنایی است. این چرخش، اعتبار یک سیاست محلی تخصصی را تأیید می‌کند که می‌تواند بدون اتکا به اتصال دائمی و پهنای باند بالای ابر برای ریز-تنظیمات، در لحظه واکنش نشان دهد.

گام بعدی شما

  • بررسی متدهای TARS برای کاهش تأخیر در سیستم‌های کنترل محلی
  • رصد استقرار این مدل‌های فشرده روی سخت‌افزارهای انسان‌نما (Humanoid)
  • مطالعه اثر جداسازی لایه‌ی قصد از لایه‌ی اجرا بر کاهش هزینه‌های پردازشی

اما این بهینه‌سازی نرم‌افزاری تنها نیمی از داستان است؛ برای درک زیرساختی این تحول، تحلیل ما درباره‌ی تراشه‌های تخصصی استنتاج در لبه را بخوانید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معماری‌های عصبی-بیولوژیک، وابستگی ربات‌ها به مراکز داده را کاهش می‌دهد. نتیجه این است که ربات‌های صنعتی و خانگی می‌توانند بدون تأخیرهای شبکه و با امنیت بیشتر، واکنش‌های لحظه‌ای را در محیط‌های پویا اجرا کنند.

تأثیر برای ایران

این پژوهش بیشتر برای توسعه‌دهندگان سیستم‌های کنترل و پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد؛ چرا که امکان پیاده‌سازی قابلیت‌های پیشرفته رباتیک را روی سخت‌افزارهای ارزان‌تر و در دسترس (لبه) ممکن می‌سازد.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که CT-VAM در واقع یک ضربه به «بزرگ‌پرستی» در مدل‌های رباتیک است. این مدل ثابت می‌کند که برای رسیدن به مهارت‌های حرکتی، نیازی به افزایش پارامترهای زبانی نیست، بلکه کلید موفقیت در طراحی مسیرهای تخصصی برای داده‌های حسی است؛ یعنی بازگشت به رویکرد سیستم‌های متخصص اما با قدرت یادگیری مدل‌های بنیادی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.