پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Open-MM-RL توهمات ریاضی در مدل‌های چندوجهی را حذف می‌کند؟

·۵ خرداد ۱۴۰۵۲ دقیقه مطالعه
اشتراک‌گذاری

اگر در حال ساخت یک مدل بینایی-زبانی برای حوزه‌های علمی هستید، بزرگ‌ترین کابوس شما «هک پاداش» است. باید راهی پیدا کنید که به مدل بفهمانید پاسخ درست چیست، بدون اینکه مجبور شوید از یک هوش مصنوعی دیگر بخواهید حدس بزند.

اینجاست که یادگیری تقویت‌شده با پاداش‌های تأییدپذیر (RLVR) وارد می‌شود؛ روشی شبیه به معلمی که به جای گفتن «آفرین»، جواب دقیق ریاضی را با فرمول چک می‌کند. این رویکرد، هدف را از «درست به نظر رسیدن» به «اثبات ریاضی» تغییر می‌دهد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های استدلالی اشاره کردیم، حذف توهمات در داده‌های پیچیده، تنها راه رسیدن به کاربرد واقعی در صنعت است.

به نقل از راهنمای Marktechpost، این سیستم از مجموعه‌داده TuringEnterprises/Open-MM-RL استفاده می‌کند و در سه مرحله اصلی عمل می‌کند:

  • امتیازدهی نمادین: استفاده از کتابخانه SymPy برای تبدیل عبارات LaTeX به ریاضیاتی که کامپیوتر بتواند آن‌ها را تأیید کند.
  • استنتاج مدل: مدل SmolVLM-Instruct — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — مسیرهای استدلالی اولیه را می‌سازد.
  • خروجی GRPO: داده‌ها به ساختار بهینه‌سازی سیاست نسبی گروهی (GRPO) تبدیل می‌شوند؛ روشی شبیه مسابقه‌ای که در آن مدل‌ها با هم مقایسه می‌شوند تا بهترین پاسخ در گروه برنده شود.

این متدولوژی باعث می‌شود مدل به جای یادگیری ترفندهایی برای فریب دادن داور، مجبور شود معادله را واقعاً حل کند. در نتیجه، مدل‌های چندوجهی (Multimodal) — مثل انسانی که هم‌زمان متن را می‌خواند و عکس را می‌بیند تا موضوع را بفهمد — در نهایت روی حقیقت متمرکز می‌شوند.

گام بعدی شما

  • داده‌های چندوجهی خود را به فایل‌های JSONL تبدیل کنید.
  • از کتابخانه TRL و ابزار GRPOTrainer برای آموزش مدل استفاده کنید.
  • برای تأیید پاسخ‌های ریاضی، SymPy را در خط لوله امتیازدهی خود بگنجانید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک هزینه‌های استنتاج در مقیاس بالا، به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با حذف «هک پاداش»، اعتماد به مدل‌های هوش مصنوعی در حوزه‌های حساس مثل پزشکی و مهندسی را افزایش می‌دهد. همچنین نیاز به نظارت انسانی گران‌قیمت برای تأیید پاسخ‌های پیچیده را به‌شدت کاهش می‌دهد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.