پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های استدلالی با ترکیب منطق نمادین به صحت ۹۶ درصدی در بنچمارک MATH رسیدند

·۷ مرداد ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
هوش مصنوعی و استدلال چندوجهی ریاضی: از حدس زدن تا تفکر واقعی
هوش مصنوعی و استدلال چندوجهی ریاضی: از حدس زدن تا تفکر واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری ترکیبی نمادین-عصبی و جایگزینی Scaling در آموزش با Scaling در زمان استنتاج؛ مدل‌ها حالا می‌توانند در لحظه پاسخ‌دهی، مقدار محاسبات را بر اساس سختی مسئله تغییر دهند.

دقت ۹۶ درصدی در محک MATH دیگر یک رویا نیست، بلکه واقعیتِ جدیدِ دسته‌ی جدیدی از هوش مصنوعی نمادین-عصبی (Neuro-Symbolic AI) است که عصر «توهم‌های مطمئن» را به پایان رسانده است. برخلاف مدل‌های پیشین که صرفاً کلمه‌ی بعدی را پیش‌بینی می‌کردند، این موتورهای استدلالی از یک چرخه‌ی آگاهانه به‌نام «سیستم ۲» برای حل گام‌به‌گام مسائل پیچیده استفاده می‌کنند.

تا اوایل سال ۲۰۲۶، مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — عمدتاً به عنوان سیستم‌های پیشرفته‌ی تکمیل خودکار متن عمل می‌کردند. آن‌ها در تشخیص الگو، مثل نوشتن غزل یا تقلید از سبک‌های ادبی، عالی بودند اما در منطق پایه شکست می‌خوردند. شما می‌توانستید از یک مدل بخواهید غزلی درباره‌ی یک توستر به سبک شکسپیر بنویسد و او وزن شعر (iambic pentameter) را دقیقاً رعایت می‌کرد. اما همین مدل اگرچه با اطمینان کامل، پاسخ یک معمای منطقی ساده یا محاسبات بار سازه‌ای یک تیر چوبی را اشتباه می‌گفت.

این مدل‌ها بر اساس تفکر «سیستم ۱» عمل می‌کردند: سریع، شهودی و احساسی. این همان بخشی از مغز است که پاسخ ۲+۲ را فوراً می‌دهد. طبق گزارش‌های تخصصی، مدل‌های سال ۲۰۲۴ پاسخ‌ها را در چند میلی‌ثانیه و بر اساس الگوهای احتمالی تولید می‌کردند که در واقع نوعی حدس زدن بود. اگر از آن‌ها می‌خواستید یک اسکریپت پیچیده را عیب‌یابی کنند، اغلب به جای محاسبه‌ی واقعی پاسخ، بر اساس احتمالاتی که در داده‌های آموزشی دیده بودند، حدس می‌زدند.

اکنون توسعه‌دهندگان معماری «سیستم ۲» را یکپارچه کرده‌اند. در روان‌شناسی، سیستم ۲ کند، آگاهانه و منطقی است؛ دقیقاً همان فرآیندی که مغز شما برای محاسبه‌ی ۱۵٪ انعام روی یک صورت‌حساب ۴۷.۸۳ دلاری به کار می‌گیرد. این چرخش معماری به هوش مصنوعی اجازه می‌دهد مکث کند، مسئله را به گام‌های مجزا تقسیم کند و از یک «تخته‌سیاه ذهنی» برای آزمایش فرضیه‌ها استفاده کند. این زنجیره تفکر (Chain-of-Thought) — شبیه وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — به مدل اجازه می‌دهد پیش از ارائه پاسخ نهایی، اشتباهات خود را اصلاح کند و به‌طور موثری مشکل توهمات ریاضی را درمان کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، گذار از پیش‌بینی آماری به استدلال صلب، نقطه‌ی عطف اعتماد به این سیستم‌هاست.

جهش منطق چندوجهی

استدلال دیگر محدود به متن نیست. اگر تا به حال سعی کرده باشید یک نمودار جریان پیچیده یا یک مسئله هندسی را فقط با کلمات توضیح دهید، می‌دانید که کلمات بافتار را از بین می‌برند. مدل‌های پیشرو سال ۲۰۲۶ با استفاده از منطق چندوجهی (Multimodal Logic) — مدلی که هم‌زمان متن، عکس و صدا را می‌فهمد، مثل ما که با چند حس دنیا را می‌خوانیم — متن، تصاویر و کدهای نمادین را به‌طور هم‌زمان در یک چرخه‌ی منطقی واحد پردازش می‌کنند. این پیشرفت‌ها در مسیر رقابت‌های شدیدی است که مدل‌هایی نظیر Claude Opus 5 با ثبت رکوردهای جدید در استدلال ماشینی سعی دارند استانداردهای جدیدی برای تفکر مصنوعی تعریف کنند.

تصور کنید عکسی از یک جدول سودوکو نیمه‌کاره را همراه با یک فایل اکسل به‌هم‌ریخته از قوانین ارسال می‌کنید. هوش مصنوعی در اینجا فقط تصویر را «نمی‌بیند»، بلکه توالی پیچیده‌ای از عملیات را اجرا می‌کند:

  • تحلیل بصری چیدمان جدول و شناسایی خانه‌های خالی.
  • تطبیق چیدمان مکانی با محدودیت‌های عددی ذکر شده در متن اکسل.
  • نوشتن یک اسکریپت پایتون در پس‌زمینه برای حل ریاضیاتی معما.
  • تولید و خروجی دادن به تصویر تکمیل شده.

این سیستم اکنون شکل واقعی مسئله را می‌فهمد، نه فقط کلماتی که آن را توصیف می‌کنند. او دیگر نسبت به بافتار (Context) کور نیست.

هیبرید نمادین-عصبی

این پیشرفت توسط رویکردی ترکیبی به نام هوش مصنوعی نمادین-عصبی هدایت می‌شود. این روش، شبکه عصبی (Neural Network) — شبکه‌ای از سلول‌های کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب می‌رساند — را با هوش مصنوعی نمادین (سیستم‌های قدیمی مبتنی بر قانون) جفت می‌کند. این دقیقاً شبیه به شاعری نابغه است که به‌طور اتفاقی دکتری ریاضیات دارد.

  • شبکه‌های عصبی: در تشخیص الگوهای داده‌های نامنظم، مثل زبان انسان و تصاویر، عالی هستند. آن‌ها ابهامات و ظرافت‌های نحوه صحبت کردن انسان‌ها را مدیریت می‌کنند.
  • هوش مصنوعی نمادین: در ریاضیات و منطق بی‌نقص است اما با ظرافت‌های زبانی مشکل دارد. این موتورها قوانین منطقی سخت و تغییرناپذیری را برای محاسبات اجرا می‌کنند.

با ترکیب این دو، هوش مصنوعی می‌تواند پرامپت‌های مبهم را بفهمد اما هنگام محاسبه پاسخ نهایی، منطقی صلب و ریاضیاتی را اعمال کند.

کمی‌سازی تغییرات

به نقل از داده‌های The AI Prism، این جهش عملکرد در محک‌های حیاتی قابل اندازه‌گیری است. داده‌ها داستان واضحی از جهش توانمندی‌ها را روایت می‌کنند:

  • GPQA (پرسش‌وپاسخ علوم سطح دکتری): این محک استدلال‌های علمی در سطح PhD را می‌سنجد. دقت مدل‌های پیشرو از ۵۵٪ در اوایل ۲۰۲۵ به ۸۱٪ در اواسط ۲۰۲۶ رسید.
  • محک MATH: این بنچمارک ریاضیات در سطح مسابقات را پوشش می‌دهد. صحت پاسخ‌ها از ۷۸٪ در اوایل ۲۰۲۵ به ۹۶٪ در اواسط ۲۰۲۶ جهش کرد که با عملکرد ۱٪ برتر شرکت‌کنندگان انسانی در مسابقات ریاضی برابری می‌کند.

یک معیار حیاتی دیگر، «نرخ خود-اصلاحی» است که توسط مرکز پژوهش مدل‌های بنیادی استنفورد مطالعه شده است. پژوهشگران آزمونی طراحی کردند که در آن به مدل‌ها بازخورد داده شد که پاسخشان غلط است، حتی زمانی که پاسخ در واقع درست بود.

در سال ۲۰۲۴، مدل‌ها به‌راحتی تحت تأثیر قرار می‌گرفتند و در بیش از ۴۰٪ موارد پاسخ درست را به غلط تغییر می‌دادند. اما مدل‌های ۲۰۲۶ در ۸۹٪ موارد بر موضع درست خود پافشاری می‌کنند. وقتی آن‌ها پاسخ خود را تغییر می‌دهند، به این دلیل است که واقعاً یک نقص در استدلال اولیه خود شناسایی کرده‌اند. این نشان‌دهنده‌ی شکل‌گیری «اعتقاد روشنفکرانه» به‌جای پیروی کورکورانه از دستورات است. در این راستا، ابزارهایی مانند SDF برای شناسایی تمایل مدل‌ها به «فریب مدل پاداش» توسعه یافته‌اند تا اطمینان حاصل شود که این پافشاری مدل‌ها بر اساس منطق است، نه تلاش برای خوش‌سوسان کردن کاربر.

با این حال، حسابرسان EleutherAI درباره‌ی «آلودگی بنچمارک» (Benchmark Contamination) هشدار می‌دهند؛ جایی که مدل‌ها به‌طور تصادفی روی داده‌های آزمون آموزش دیده‌اند. در مجموعه‌های داده‌ی کاملاً جدید، منتشرنشده و تخصصی، بهبود کمتر است — حدود ۱۵ درصد بیشتر از مدل‌های ۲۰۲۵ — اما همچنان معنادار است. این تایید می‌کند که پیشرفت‌ها واقعی هستند، حتی اگر اعداد تیتروار کمی اغراق‌آمیز باشند.

استقرارهای با ریسک بالا

این دستاوردهای تئوریک در دنیای واقعی به نتایج ملموسی در حوزه‌های حساس تبدیل شده‌اند. در پژوهش‌های داروسازی، شرکت Insilico Medicine در آوریل ۲۰۲۶ گزارش داد که سیستم استدلالی‌اش یک کاندید دارویی جدید برای فیبروز ریوی ایدیوپاتیک را تنها در ۱۸ ماه شناسایی کرده است؛ فرآیندی که به‌طور سنتی ۴ تا ۶ سال زمان می‌برد. این سیستم فقط میل ترکیبی مولکولی را پیش‌بینی نکرد، بلکه مسیرهای سمیت، پایداری متابولیک و امکانیت سنتز را به‌طور هم‌زمان تحلیل کرد. این قابلیت به مدل اجازه داد هزاران کاندید را که روی کاغذ امیدوارکننده بودند اما در مراحل بعدی شکست می‌خوردند، رد کند. این کاندید اکنون وارد آزمایش‌های بالینی فاز ۱ شده است.

در ریاضیات محض، همکاری DeepMind و دانشگاه سیدنی منجر به کشف ارتباط جدیدی بین نظریه گره‌ها (Knot Theory) و نظریه نمایش (Representation Theory) شد؛ کشفی که دهه‌ها از دسترس پژوهشگران انسانی دور بود. هوش مصنوعی صرفاً ادبیات موضوع را جستجو نکرد، بلکه حدس‌های جدیدی فرموله کرد، آن‌ها را به‌صورت محاسباتی آزمایش کرد و قضیه را در یک زبان رسمی برای تایید ارائه داد. در فوریه ۲۰۲۶، این نتیجه در یک مجله ریاضیات داوری‌شده منتشر شد و برای نخستین بار یک سیستم هوش مصنوعی به عنوان نویسنده همکار در یک مقاله ریاضی محض لیست شد.

انقلاب محاسبات زمان استنتاج

شاید مخرب‌ترین تغییر، «مقیاس‌بندی محاسبات زمان استنتاج» (Test-time compute scaling) باشد. پیش از این، هزینه محاسبات در مرحله آموزش متمرکز (Front-loaded) بود. فرقی نمی‌کرد مدل به سؤال «۲+۲ چند می‌شود» جواب دهد یا «یک خرک یا ترس پل مهندسی طراحی کند»، هزینه استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی نه دوره آموزش آشپز — تقریباً یکسان بود. برای کاهش اثرات منفی این هزینه‌ها و بهینه کردن پاسخ‌دهی، راهکارهای معماری ابری ترکیبی برای حذف تأخیر در پاسخ‌دهی لحظه‌ای در حال توسعه هستند تا سرعت استنتاج را با کیفیت استدلال وفق دهند.

مدل‌های استدلالی این الگو را تغییر دادند. آن‌ها برای سؤالات ساده با زنجیره‌های تفکر کوتاه، از مقدار اندکی محاسبات استفاده می‌کنند اما منابع را به‌طور نمایی به مسائل سخت اختصاص می‌دهند. آن‌ها در واقع وقتی مسئله سخت است، «بیشتر فکر می‌کنند».

تحقیقات داخلی OpenAI در مارس ۲۰۲۶ قدرت این رویکرد را نشان داد:

  • اختصاص ۱۰۰ برابر محاسبات بیشتر در زمان استنتاج برای یک سؤال بیولوژی سطح دکتری، دقت را از ۶۲٪ به ۹۱٪ رساند.
  • در مقابل، آموزش یک مدل ۱۰۰ برابر بزرگ‌تر روی همین مسئله، تنها ۳ درصد بهبود ایجاد کرد.

این بدان معناست که وسواس صنعت روی مدل‌های به‌شدت بزرگ و افزایش پارامترها، تا حدی اشتباه بود. مرز بعدی نه مدل‌های بزرگ‌تر، بلکه مدل‌هایی است که از محاسبات در زمان استنتاج هوشمندانه استفاده می‌کنند. این موضوع پیامدهای اقتصادی عمیقی دارد؛ آموزش مدل‌های عظیم صدها میلیون دلار هزینه دارد، اما افزودن محاسبات در زمان استنتاج، تنها چند سنت برای هر پرس‌وجو هزینه می‌برد. به همین دلیل است که تمام آزمایشگاه‌های بزرگ هوش مصنوعی در سال ۲۰۲۶ به سمت معماری‌های استدلالی تغییر مسیر دادند.

نقاط کور باقی‌مانده

با این حال، مدل‌های استدلالی خطاناپذیر نیستند. آن‌ها هنوز در مسائلی که نیاز به درک بدیهی (Common-sense) از دنیای فیزیکی دارند — دانشی که انسان‌ها از طریق تجربه بدنی و تعامل با محیط کسب می‌کنند — شکست می‌خورند. یک مدل می‌تواند یک معادله دیفرانسیل پیچیده را حل کند اما شاید نفهمد چرا نمی‌توان یک گالن شیر را در یک لیوان کوچک ریخت. این شکاف‌ها در برابر رویکرد نمادین-عصبی مقاوم مانده‌اند.

همچنین مشکل «بیش‌فکر کردن» (Overthinking) وجود دارد. به دلیل طراحی گام‌به‌گام، این مدل‌ها گاهی کارهای ساده را پیچیده می‌کنند. آن‌ها ممکن است زنجیره‌های استدلالی مفصلی برای مسائلی تولید کنند که انسان فوراً حل می‌کند و در این مسیر، منابع محاسباتی را هدر می‌دهند یا حتی با بررسی احتمالات نامربوط، خودشان را به اشتباه می‌اندازند.

یافتن تعادل بهینه بین تفکر سیستم ۱ و سیستم ۲ همچنان یک سؤال پژوهشی باز است. با این حال، این چرخش به این معناست که انسان‌ها می‌توانند بالاخره از برخورد با هوش مصنوعی به عنوان یک «کارآموز غیرقابل‌اعتماد» دست بردارند. ما دیگر مجبور نیستیم هر منبع را دوباره چک کنیم یا آن‌ها را از وظایف حیاتی دور نگه داریم. وقتی مدلی بتواند منطق خود را توضیح دهد و مراحل کارش را نشان دهد، سد اعتماد بالاخره فرو می‌ریزد.

گام بعدی شما

  • در ابزارهای استدلالی جدید، از مدل بخواهید «مراحل تفکر خود را باز کند» تا نقاط شکست منطقی را شناسایی کنید.
  • برای تحلیل داده‌های پیچیده، به‌جای تکیه بر یک خروجی سریع، از روش‌های «زنجیره تفکر» در پرامپت‌ها استفاده کنید.
  • اگر توسعه‌دهنده هستید، استراتژی مدل‌های خود را از «افزایش پارامتر» به «بهینه‌سازی محاسبات زمان استنتاج» تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار نتایج بنچمارک‌های ریاضی و علوم، اعتماد به AI را در حوزه‌های حساس (مثل پزشکی و مهندسی) جابه‌جا می‌کند. جایگزینی حدس آماری با منطق نمادین، خطای بحرانی در سیستم‌های خودکار را کاهش می‌دهد.

تأثیر برای ایران

این پیشرفت‌ها بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان داده در ایران اهمیت دارد تا کاربر عادی. دسترسی به این مدل‌های پیشرو همچنان نیازمند ابزارهای دور زنی محدودیت‌های API است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «مقیاسِ آموزش» به «مقیاسِ استنتاج» تغییر کرده است. این یعنی قدرت مدل دیگر فقط در حجم داده‌های آموزشی نیست، بلکه در توانایی مدل برای مدیریت منابع محاسباتی در لحظه پاسخ‌دهی نهفته است. احتمالاً به زودی شاهد مدل‌های کوچک‌تری خواهیم بود که با «فکر کردن بیشتر»، مدل‌های غول‌پیکر فعلی را در تحلیل‌های تخصصی شکست می‌دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.