پرش به محتوای اصلی
پرش به محتوای مقاله

چرا مدل‌های پیشرو در ریاضیات همچنان دچار توهمات گسترده می‌شوند؟

·۲۶ مرداد ۱۴۰۵۱۲ دقیقه مطالعه
تحلیل
کیوئن ۳.۵ با وجود استدلال مشابه جی‌ال‌ام-۵.۲، ۸۲ درصد واقعیت‌ها را توهم می‌زند
کیوئن ۳.۵ با وجود استدلال مشابه جی‌ال‌ام-۵.۲، ۸۲ درصد واقعیت‌ها را توهم می‌زند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای استراتژی حذف عمداً دانش فکت‌محور برای بهینه‌سازی استدلال؛ مدل‌ها دیگر برای «دانستن» ساخته نمی‌شوند، بلکه برای «فکر کردن» روی داده‌های خارجی بهینه شده‌اند.

۸۲٪؛ این نرخ توهم (Hallucination) مدل Qwen3.5 (نسخه 9B) هنگام مواجهه با داده‌های فکت‌محوری است که در حافظه‌اش ندارد. طبق تحلیل وب‌سایت Artificial Analysis، این عدد نشان می‌دهد موازنه میان «دانستن» و «فکر کردن» در مدل‌های زبانی به نقطه شکست رسیده است.

این اتفاق یک شکست فنی نیست، بلکه یک انتخاب آگاهانه در طراحی است. آزمایشگاه‌های هوش مصنوعی به‌طور فعال در حال خالی کردن «انبار فکت‌ها» در مدل‌های خود هستند تا فضای بیشتری برای قابلیت‌های استدلال خالص ایجاد کنند. در واقع، بارِ دانش از وزن‌های مدل به سامانه‌های بازیابی خارجی منتقل شده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تکیه بر داده‌های خارجی ریسک‌های جدیدی ایجاد می‌کند. سال‌ها تصور می‌شد پارامترهای بیشتر به معنای مدل بهتر است، اما اکنون مرز رقابت به استدلال قابل‌اثبات در ریاضیات و کدنویسی جابه‌جا شده است. این چرخش باعث می‌شود مدل‌های کوچک‌تر در منطق از غول‌های نسل قبل پیشی بگیرند، حتی اگر در مورد اطلاعات عمومی کاملاً ناتوان باشند.

جهش در استدلال

بنچمارک‌های اخیر جدایی کامل اندازه مدل از هوش آن را نشان می‌دهند. به نقل از گزارش‌های فنی، مدل GLM-5.2 با استفاده از تنها ۴۰ میلیارد پارامتر فعال به ازای هر توکن، ۹۹.۲٪ از مسائل AIME ۲۰۲۶ را حل کرده است. برای مقایسه، GPT-4 (نسخه ۲۰۲۳) با حدود ۲۸۰ میلیارد پارامتر فعال، در مواجهه با همین آزمون به‌شدت دشوار در پیش داشت و تقریباً هیچ مسئله‌ای از این امتحان خاص را حل نکرد.

سایر مدل‌ها نیز همین الگوی استدلالِ نابود شده از دانش را دنبال می‌کنند:

  • Qwen3.5 با تنها ۱۷ میلیارد پارامتر فعال، به امتیاز ۹۱.۳٪ در AIME ۲۰۲۶ رسید.
  • DeepSeek V4-Flash با حدود ۱۳ میلیارد پارامتر فعال به ازای هر توکن عمل می‌کند.
  • مدل Phi-4 از شرکت Microsoft (نسخه 14B) مهارت ریاضی بالایی دارد اما به‌دلیل تکیه شدید بر داده‌های آموزشی سنتتیک (Synthetic Data) شبیه به کتاب‌های درسی، در اطلاعات عمومی ضعیف است.

کیون ۳.۵ با وجود استدلال مشابه جی‌ال‌ام ۵.۲، ۸۲٪ حقایق را توهم می‌زند

هزینه ذخیره‌سازی دانش

داده‌های فکت‌محور فضای فیزیکی در یک شبکه عصبی (Neural Network) اشغال می‌کنند. بر اساس مستندات سری «فیزیک مدل‌های زبانی»، هر پارامتر به‌طور متوسط حدود ۲ بیت دانش فکت‌محور ذخیره می‌کند. برای به‌خاطر سپردن تاریخ تولد ریاضی‌دانان گمنام قرن ۱۹، یا تعداد دقیق جمعیت هر یک از شهرداری‌های هلند، یا ترتیب دقیق آرگومان‌ها برای هر تابع در هر پکیج npm، مدل به تخصیص وزن‌های عظیمی نیاز دارد؛ به همین دلیل مدل‌های پیشرو پیش‌تر به تریلیون‌ها پارامتر می‌رسیدند.

اما استدلال به‌شدت فشرده‌پذیر است. استدلال شامل مجموعه‌ای کوچک از رویه‌های تکرارپذیر است: خرد کردن مسائل به بخش‌های کوچک‌تر، حفظ وضعیت‌های میانی، بازبینی کار خود و بازگشت به عقب (Backtracking) هنگام شکست یک مرحله. از طریق distillation و یادگیری تقویتی روی تکالیف قابل‌اثبات، این رویه‌ها را می‌توان به مدل‌های بسیار کوچک منتقل کرد، بدون اینکه نیازی به دیتابیس عظیم دانش جهانی باشد.

شکاف توهم

وقتی وزن‌های فکت‌محور حذف می‌شوند، «توهم» هوشمندی می‌شکند. در بنچمارک SimpleQA که بازیابی فکت‌ها را بدون ابزار خارجی می‌سنجد، پیشرو فعلی یعنی Gemini 2.5 Pro تنها به دقت ۵۳٪ رسیده است.

مدل‌های کوچک‌تر وضعیت بدتری دارند. نسخه‌های 4B و 9B مدل Qwen3.5 در ۸۰ تا ۸۲٪ مواقع هنگام مواجهه با فکتی که نمی‌دانند، دچار توهم می‌شوند. نکته حیاتی این است که این مدل‌ها نادانی خود را پذیرفته نمی‌کنند، بلکه با اعتمادبه‌نفس کامل، پاسخ‌ها را اختراع می‌کنند.

این وضعیت مدل‌های «عمومیست» خاصی می‌سازد؛ مدل‌هایی که درباره هر چیزی کمی می‌دانند، اما هیچ چیز را به‌طور عمیق نمی‌شناسند. برای مثال، مدل می‌تواند توضیح دهد PostgreSQL چیست و MVCC به‌طور کلی چگونه کار می‌کند، اما اگر بپرسید کدام نسخه دقیقاً یک تابع خاص در Planner را اضافه کرد، احتمالاً پاسخ را از خودش در می‌آورد. این وسعتِ دانش برای درک پرس‌وجو و قضاوت درباره اعتبار منبع مفید است، اما عمقِ دانش برای ذخیره‌سازی گران است و برای جست‌وجو ارزان؛ به همین دلیل اولین هدف برای حذف است.

معماری MoE و «خبره دانش»

این طراحی به لطف معماری ترکیب خبره‌ها (Mixture of Experts یا MoE) ممکن شده است. در این سامانه‌ها، مدل تعداد کل پارامترهای زیادی دارد، اما برای هر توکن تنها زیرمجموعه کوچکی از آن‌ها — پارامترهای فعال — تحریک می‌شوند.

  • DeepSeek V4-Flash: با ۱۳ میلیارد پارامتر فعال استدلال می‌کند، اما تعداد کل پارامترهایش حدود ۲۸۴ میلیارد است.
  • تفکیک: اکثریت این پارامترها موتور استدلال نیستند، بلکه فضای ذخیره‌سازی فکت‌ها هستند.
  • استراتژی: با اختیاری کردن یا حذف این «خبره‌های دانش»، آزمایشگاه‌ها می‌توانند نمرات استدلال را بالا نگه دارند و هم‌زمان هزینه محاسبات فعال را به‌شدت کاهش دهند.

مقایسه عملکرد فنی

مدل پارامترهای فعال به ازای توکن دقت AIME ۲۰۲۶ جزئیات
GLM-5.2 ~۴۰ میلیارد ۹۹.۲٪ معماری MoE؛ اکثر پارامترها در خبره‌های دانش
Qwen3.5 ۱۷ میلیارد ۹۱.۳٪ بهینه‌شده برای سخت‌افزارهای میان‌رده
DeepSeek V4-Flash ~۱۳ میلیارد گزارش نشده ~۲۸۴ میلیارد پارامتر کل، عمدتاً خبره
GPT-4 (۲۰۲۳) ~۲۸۰ میلیارد (تخمینی) پایین فاقد بهینه‌سازی اختصاصی برای استدلال قابل‌اثبات

پیامدهای عملی برای توسعه‌دهندگان

یک مدل Qwen3.5 کوانتیده (Quantized) با اندازه 9B در ۶ گیگابایت VRAM جای می‌گیرد و روی یک لپ‌تاپ گیمینگ معمولی اجرا می‌شود. برای توسعه‌دهندگان عامل‌های (Agents) هوش مصنوعی، این یعنی مدل دیگر نیازی به حفظ کردن تمام سطح APIها ندارد؛ در عوض، عامل می‌تواند مستقیماً پوشه node_modules یا مستندات رسمی را در لحظه بخواند.

این تغییر، مسئولیت صحت را از وزن‌های مدل به «هارنس» (لایه RAG یا ابزارها) منتقل می‌کند. اگر سیستم بازیابی فکت درست را ارائه دهد، قدرت استدلال بالای مدل پاسخ دقیقی می‌سازد. اما اگر بازیابی شکست بخورد، مدل با متقاعدکننده‌ترین منطق ممکن، بر اساس یک دروغ استدلال می‌کند.

تست محلی الگو

این الگو را می‌توان با ابزارهایی مثل Ollama بازتولید کرد. اجرای ollama run qwen2.5:7b اجازه می‌دهد شکاف بین منطق و فکت را تست کنید. پرامپتی که یک مسئله ریاضی گام‌به‌گام را می‌پرسد (مثلاً دو قطار که در زمان‌ها و سرعت‌های مختلف حرکت می‌کنند) احتمالاً موفق می‌شود، اما پرسش درباره یک تاریخ خاص یا شماره نسخه بدون بستر متنی، الگوی توهمی را فعال می‌کند که توسط Walter van der Giessen در w4g1.dev مستند شده است.

برای حل این مشکل، توسعه‌دهندگان از ساختار «بستر تأییدشده» استفاده می‌کنند. به‌جای تکیه بر حافظه، پرامپت را این‌گونه می‌سازند: بستر تأییدشده: [فکت] | پرسش: [سوال] | پاسخ را فقط با استفاده از بستر بالا بده. این کار تضمین می‌کند داده‌ها به‌روز بمانند، فارغ از اینکه تاریخ قطع آموزش مدل چه زمانی بوده است. برای مثال، دریافت آخرین تگ انتشار از API گیت‌هاب و ارسال آن به مدل، اجازه می‌دهد مدل به سوال «آخرین نسخه Ollama چیست؟» پاسخ دهد، بدون اینکه این داده در وزن‌هایش باشد.

اقتصاد جدید مدل‌ها

این روند نحوه «پیر شدن» مدل‌ها را تغییر می‌دهد. مدلی که پر از فکت است، از لحظه پایان آموزش شروع به فاسد شدن می‌کند چون APIها تغییر می‌کنند، قیمت‌ها جابه‌جا می‌شوند و افراد شغل خود را تغییر می‌دهند. اما مدلی که روی رویه‌ها متمرکز است، فارغ از زمان آموزش، همیشگی است؛ چون اگر بتواند روی داده‌های جاریِ موجود در پرامپت استدلال کند، زمان آموزش اهمیتی ندارد.

در نهایت، مرز فنی دیگر ساختن بزرگ‌ترین مغز نیست، بلکه تصمیم‌گیری درباره این است که چه چیزی در وزن‌ها بماند و چه چیزی در زمان پرس‌وجو بازیابی شود. هزینه نگهداری از صرف صدها میلیون دلار برای آموزش مجدد مدل‌های تریلیونی هر چند ماه یک‌بار، به به‌روزرسانی یک ایندکس جست‌وجو یا یک پوشه مستندات تغییر می‌یابد.

ریسک‌ها و محدودیت‌ها

یک خطر جدی در این رویکرد وجود دارد: مدلی که برای استدلال بهینه شده، با همان سطح از اعتمادبه‌نفس پاسخ می‌دهد، چه داده درست باشد و چه اختراعی. دیگر نمی‌توان «اعتمادبه‌نفس مدل» را سیگنالی برای صحت فکت‌ها دانست.

علاوه بر این، مسئولیت صحت کاملاً بر دوش لایه بازیابی است. اگر سیستم بازیابی یک سند را بد ایندکس کند یا یک منبع قدیمی را برگرداند، مدل استدلالی با مهارت بیشتری، استدلالی پیچیده‌تر بر اساس آن داده غلط می‌سازد. برای تکالیفی که منبع خارجی معتبری ندارند — مثل ترکیب ادبیات پراکنده یا نظرات ذهنی — مدل‌های کوچکِ تهی از حافظه، همچنان ضعیف‌تر از مدل‌های غول‌پیکر با دانش داخلی عمیق هستند.

چشم‌انداز آینده

مسیر فعلی نشان می‌دهد استدلال در سطح مدل‌های پیشرو به‌زودی روی یک GPU مصرف‌کننده اجرا خواهد شد. DeepSeek V4-Flash همین حالا با ۱۳ میلیارد پارامتر فعال استدلال می‌کند که در محدوده سخت‌افزارهای خانگی است. ۲۷۱ میلیارد پارامتر باقی‌مانده در خبره‌های آن، عمدتاً ذخیره‌ساز فکت هستند؛ بخشی که به‌نفع لایه‌های بازیابی در حال حذف شدن است.

در این معماری جدید، مدل «منطق» را فراهم می‌کند و هارنس (جست‌وجو، RAG و ابزارها) «فکت‌ها» را. هزینه نگهداری دیگر در وزن‌ها نیست، بلکه در ایندکس منابع خارجی است.

گام بعدی شما

  • اگر از مدل‌های کوچک برای استخراج داده استفاده می‌کنید، هرگز به حافظه مدل اعتماد نکنید و حتماً از یک لایه RAG برای تأمین فکت‌ها استفاده کنید.
  • برای تست میزان توهم مدل‌های محلی خود، از بنچمارک SimpleQA یا پرسش‌های تاریخ‌محورِ بسیار خاص استفاده کنید.
  • در طراحی عامل‌های AI، تمرکز خود را از انتخاب «دانشمندترین مدل» به ساخت «بهترین سیستم بازیابی مستندات» تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد هزینه استنتاج را به‌شدت کاهش داده و اجرای مدل‌های سطح پیشرو را روی سخت‌افزارهای خانگی ممکن می‌کند. با این حال، اعتماد به پاسخ‌های مدل بدون لایه تأیید خارجی، اکنون ریسک توهم‌های متقاعدکننده را به اوج رسانده است.

تأثیر برای ایران

این روند برای توسعه‌دهندگان ایرانی که با محدودیت GPU مواجه‌اند یک خبر عالی است، زیرا مدل‌های کوچک‌تر و ارزان‌تر اکنون استدلال مدل‌های غول‌پیکر را ارائه می‌دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی حافظه با استدلال، مدل‌های زبانی را از «دانشنامه» به «ماشین حساب منطقی» تبدیل می‌کند. این تغییر پارادایم یعنی مدل‌ها دیگر منبع حقیقت نیستند، بلکه پردازشگر حقیقت‌های ورودی‌اند. در نتیجه، برتری رقابتی از کسانی که بزرگ‌ترین مدل‌ها را آموزش می‌دهند به کسانی منتقل می‌شود که دقیق‌ترین لایه‌های بازیابی داده (Retrieval) را طراحی می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.