پرش به محتوای اصلی
پرش به محتوای مقاله

DiScO: ارتقای استدلال ریاضی در مدل‌های زبانی از طریق متنوع‌سازی طرحواره‌های تفکر

·۱۹ خرداد ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
DiScO: ارتقای استدلال ریاضی در مدل‌های زبانی از طریق متنوع‌سازی طرحواره‌های تفکر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از مقیاس‌گذاری کمی (پارامتر/توکن) به مقیاس‌گذاری کیفی از طریق تنوع‌بخشی به طرحواره‌های تفکر (Thinking Schemata) برای تبدیل خودتصحیری به یک قابلیت ساختاری.

اگر مدل‌های استدلالی شما در مواجهه با مسائل پیچیده ریاضی پس از اولین اشتباه، در یک حلقه تکرار گیر می‌کنند، مشکل در تعداد پارامترها نیست، بلکه در تک‌بعدی بودن مسیرهای تفکر است. باید بدانید که موفقیت در استدلال، بیش از آنکه به حجم حافظه وابسته باشد، به «تنوع مسیرهای رسیدن به جواب» بستگی دارد.

در ۹ ژوئن ۲۰۲۶، پژوهشگران چارچوبی به نام DiScO (بهینه‌سازی سیاست طرحواره‌های متنوع) را معرفی کردند که تنوع در مسیرهای تفکر یا همان طرحواره‌های تفکر (Thinking Schemata) را به عنوان متغیر اصلی برای افزایش دقت ریاضی در نظر می‌گیرد. همان‌طور که در پوشش پیشین ما از قوانین مقیاس‌پذیری (Scaling Laws) دیدیم، افزایش حجم داده‌ها یا پارامترها همیشه منجر به تفکر عمیق‌تر نمی‌شود و مدل‌ها اغلب در مسیرهای تکراری و محدود گیر می‌کنند.

به نقل از مقاله منتشر شده در arxiv.org، مدل‌های استدلالی فعلی با وجود زنجیره‌های تفکر طولانی، توانایی «تغییر مسیر» پس از شکست در رویکرد اولیه را ندارند. چارچوب DiScO برای حل این بن‌بست، از یک فرآیند سه‌مرحله‌ای برای بهینه‌سازی انتقال‌های استدلالی استفاده می‌کند:

  • پیاده‌سازی «آگاهی از طرحواره» در وضعیت داخلی مدل.
  • به‌کارگیری یادگیری تقویت‌شده (Reinforcement Learning) برای تشویق مدل به پیمودن تراژکتوری‌های متنوع.
  • ترویج فعال مسیرهای استدلالی متفاوت در زمان استنتاج (Inference).

طبق گزارش پژوهشگران، آزمایش‌ها روی بنچمارک‌های مختلف ریاضی نشان می‌دهد که DiScO به‌طور مداوم از روش‌های استاندارد مانند GRPO پیشی می‌گیرد. تحلیل‌های انسانی نیز تأیید می‌کند که این مدل اکنون می‌تواند از خطاهای اولیه بازیابی کرده و به جای تکرار اشتباه، استراتژی حل مسئله خود را تغییر دهد. این تحول، مفهوم مقیاس‌گذاری را از تعداد توکن‌ها به تنوع توپولوژیک منطق داخلی مدل تغییر می‌دهد و ما را به سمت «تفکر سیستم ۲» می‌برد؛ جایی که مدل به جای پیش‌بینی توکن بعدی، چندین قاب مفهومی را کاوش و رد می‌کند.

گام بعدی شما

  • اگر روی مدل‌های استدلالی کار می‌کنید، اثر افزودن «جریمه‌های تنوع» (Diversity Penalties) در تابع پاداش خود را بررسی کنید.
  • برای بررسی دقیق نرخ بازیابی خطا (Recovery Rate)، مستندات فنی DiScO در arXiv را مطالعه کنید.
  • پتانسیل ترکیب این متدولوژی با مدل‌های وزن‌باز را برای بهبود استدلال در زبان‌های کم-منبع بسنجید.

اما این تنوع منطقی در مدل‌های بازمتن چگونه با محدودیت‌های سخت‌افزاری سازگار می‌شود؟ به تحلیل ما درباره بهینه‌سازی استنتاج در مدل‌های کوچک مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد، اعتبار مدل‌های استدلالی را در کاربردهای حساس مانند مهندسی و پزشکی افزایش می‌دهد، زیرا احتمال شکست سیستمی در اثر یک توهم اولیه را کاهش داده و قابلیت بازیابی را نهادینه می‌کند. این تغییر، تخصص مدل را از «حفظ کردن الگو» به «کاوش استراتژیک» منتقل می‌کند.

تأثیر برای ایران

این پژوهش بیشتر برای متخصصان مدل‌های بنیادی در ایران اهمیت دارد تا کاربران نهایی؛ چرا که پیاده‌سازی این متدولوژی نیازمند دسترسی به زیرساخت‌های محاسباتی سنگین برای یادگیری تقویت‌شده است.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که DiScO در واقع مفهوم «تفکر» را از یک توالی خطی به یک فضای توپولوژیک تبدیل می‌کند. آنچه از این خبر می‌توان آموخت این است که آینده‌ی هوش مصنوعی نه در مدل‌های بزرگ‌تر، بلکه در مدل‌هایی است که بتوانند «راه‌های مختلف رسیدن به پاسخ» را کشف کنند و خودتصحیری را از یک اتفاق تصادفی به یک قابلیت ساختاری تبدیل نمایند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.