تصور کنید یک مدل هوش مصنوعی در آزمونهای تئوری نمره کامل میگیرد، اما در مواجهه با یک مجموعه داده واقعی، تصمیمی میگیرد که رتبه شما را از ۱۰ به ۷۰۰ میرساند. این شکاف خطرناک بین «شناخت» و «استدلال» در مدلهای پیشرو، حقیقتِ پنهان پشت نمرات بالای بنچمارکهاست.
طبق گزارشی که در ۹ اکتبر ۲۰۲۶ منتشر شد، یک بنچمارک جدید فاش کرد که بین شناخت پاسخ درست و استدلال برای رسیدن به آن، یک شکاف سیستماتیک وجود دارد. این پژوهش ۱۱ مدل برتر، از جمله GPT-6.1 Sol و Claude Sonnet 5.5 را مورد بررسی قرار داد. این مدلها در مواجهه با «تصمیمات قضاوتی» (Judgment Calls) شکست خوردهاند؛ یعنی همان تصمیمات ظریفی در رقابتهای دادههای جدولی که در آنها قواعد کلی کتابخانهای (Heuristics) اغلب شکست میخورند.
در دنیای رقابتهای یادگیری ماشین، تکیه بر یک قاعده کلی بهجای شواهد اندازهگیری شده، میتواند تفاوت بین یک رتبه تکرقمی و رتبه ۷۰۰ باشد. نویسنده پژوهش مثالی شخصی میزند: در یک رقابت، اجازه دادن به پلتفرم برای انتخاب خودکار بهترین فایلهای ارسالی (Auto-pick)، منجر به رتبه ۷۰۸ از ۳۵۷۵ شد، در حالی که یک اجرای صادقانه و دستی میتوانست رتبهای بسیار بالاتر کسب کند.
همانطور که در تحلیل قبلی ما دربارهی ساختارهای مقاوم در خط لولههای داده (SaaS pipelines) و استفاده از Fallbackهای پویا اشاره کردیم، این یافتهها نشان میدهد که اتکا به مدلهای زبانی برای تصمیمات معماری حساس، نیازمند چیزی فراتر از نمرات بالا در بنچمارکهاست. ما به مدلی نیاز داریم که مکانیسم زیربنایی داده را بفهمد، نه اینکه صرفاً محتملترین توکن بعدی را پیشبینی کند.
طراحی محک
این پژوهش بر اساس ۳۶ مورد واقعی از رقابتهای Kaggle Playground (S6E9 و S6E10) که در سپتامبر تا اکتبر ۲۰۲۶ برگزار شده بودند، طراحی شده است. این تست ۱۲ موضوع مختلف را پوشش میدهد که در هر کدام سه متغیر عددی وجود دارد. تمرکز اصلی بر مواردی است که شواهد تجربی، قواعد رایج و کلی را نقض میکنند.
جزئیات فنی و یافتههای اندازهگیری شده
این محک مکانیسمهای فنی دقیقی را میسنجد. برخی از نمونههای کلیدی عبارتاند از:
- مقادیر p در نمونههای بزرگ (T01): ۱۹ ویژگی از ۲۱ مورد، p < 1e-300 داشتند (که طبق قواعد کلی باید بسیار مهم باشند)، اما AUC تکمتغیره آنها بین ۰.۸۴۰ تا ۰.۵۰۶ متغیر بود.
- پیرسون در برابر اسپیرمن (T02): در ستونهای تأخیر که ۹۱٪ آنها صفر مطلق بودند، ضریب پیرسون ۰.۸۴ اما ضریب اسپیرمن ۰.۴۷ بود.
- معنای عدد «۰» (T03): در رتبهبندیهای وایفای، مقدار «۰» (که به معنای عدم کاربرد یا Not Applicable بود) نرخ رضایت ۰.۸۸۷ را نشان داد، در حالی که این نرخ برای مقدار ۱ برابر ۰.۳۹۱ و برای مقدار ۵ برابر ۰.۹۵۰ بود.
- AUC در برابر اطلاعات متقابل (T04): یک رتبهبندی بر اساس AUC در جایگاه ۱۰ از ۲۱ بود، اما بر اساس MI و Cramér's V در جایگاه ۳ قرار گرفت.
- اعتبارسنجی متقابل در برابر لیدربورد (T05): خطای استاندارد لیدربورد عمومی حدود ۰.۰۰۰۳ بود؛ بنابراین بهبودهای کوچک ۰.۰۰۰۰۵ در CV هرگز در لیدربورد ظاهر نشدند.
- الحاق مجموعه داده (T06): افزودن سطرها به دادهها منجر به کاهش ۰.۰۰۰۲۵ شد، اما استفاده از پیشبینی مدل روی دادههای اصلی به عنوان یک ویژگی جدید، بهبود ۰.۰۰۰۷ ایجاد کرد.
- تلهٔ Foldهای بیشتر (T07): انتقال از ۵-fold به CV ۱۰-لایه، مقدار OOF را ۰.۰۰۰۱۲ افزایش داد اما تأثیری روی لیدربورد نداشت (تغییر ۰.۰۰۰۰).
- شکار نشت داده (T08): علیرغم نبود هیچ تکراری و عدم همپوشانی بین دادههای آموزش و آزمون، ۱۷ سطر از ۱۲۹,۸۸۰ سطر اصلی بین دو مجموعه مشترک بودند.
- کالیبراسیون (T09): چون AUC مبتنی بر رتبه است، یک کالیبراسیون یکنواخت (Monotone Recalibration) نمیتواند آن را افزایش دهد.
- تنوع ترکیب مدلها (T10): مدلهای GBM همبستگی بسیار بالای ۰.۹۹۸۵ تا ۰.۹۹۹۴ داشتند؛ در مقابل، یک شبکه عصبی (NN) ضعیفتر ارزش بیشتری به استک (Stack) اضافه کرد.
- انتخاب فایل ارسالی (T11): استراتژی انتخاب خودکار بهترین فایلهای عمومی منجر به شکست و رتبه ۷۰۸ از ۳۵۷۵ شد.
- ویژگیهای پلهای (T12): مقادیر هدف در سن ۳۹ سال جهش و در سن ۶۱ سال افت کردند.
برای سنجش مدلها از دو متد متمایز استفاده شد:
۱. ds-judgment (شناخت): فرمت چهارگزینهای که در آن مدل باید بین چهار گزینه یکی را انتخاب کند: پاسخ اندازهگیری شده، تلهٔ کلاسیک (قاعده کتابخانهای که اندازهگیریها آن را نقض کردند) و دو گزینه پرت. برای جلوگیری از استراتژی «انتخاب بلندترین گزینه»، طول گزینهها یکسان شد؛ به طوری که گزینه درست تنها در ۸ مورد از ۳۶ مورد، بلندترین گزینه بود.
۲. ds-judgment-open (تولید): فرمت باز که مدل باید توصیه و دلیل خود را در کمتر از ۱۲۰ کلمه بنویسد. یک مدل داور ثابت (Gemini 3.8 Flash) پاسخهای آزاد را به چهار جایگاه قبلی نگاشت کرد یا در صورت پاسخ مبهم/محتاطانه، نمره «E» اختصاص داد. این رویکرد استفاده از مدلهای داور برای ارزیابی خروجیها، یادآور ترکیب کد قطعی و مدلهای زبانی است که پیشتر توانست هزینه ارزیابی پاسخهای فنی را تا ۹۶٪ کاهش دهد.
شکاف عملکردی
نتایج تضاد شدیدی را نشان میدهد. در حالت چهارگزینهای، صحت مدلها بین ۹۴٪ تا ۱۰۰٪ بود. اما در حالت تولیدی (Open-ended)، این رقم به ۵۶٪ تا ۸۱٪ سقوط کرد.
به نقل از دادههای این پژوهش، Grok 4.20 Reasoning و Gemini 3.8 Flash هر دو در حالت چهارگزینهای نمره کامل (۳۶/۳۶) گرفتند، اما در حالت باز به ۲۶/۳۶ رسیدند. Claude Haiku 4.5 شدیدترین سقوط را داشت و از نمره کامل در حالت گزینهای به ۲۰/۳۶ در حالت باز رسید. این حساسیت شدید مدلهای کوچکتر به تغییر فرمت یا کیفیت ورودی، با کاهش ۲۲ درصدی دقت Claude Haiku 4.5 در مواجهه با ابزارهای مسموم که پیشتر گزارش شد، همسو است. سایر نمرات شامل Claude Sonnet 5.5 (۲۹/۳۶) و Gemma 4 26B-A4B (۲۷/۳۶) بود.
نقاط شکست مدلها
شکستها یکنواخت نبودند. در حالی که ۷ موضوع تقریباً حل شده بودند (صحت ≥ ۰.۹۷)، ۴ حوزه باعث لغزش تقریباً تمام مدلها شد:
- پیرسون در برابر اسپیرمن (T02): صحت در حالت باز ۰.۰۰ بود. مدلها نتوانستند درک کنند که چگونه ۹۱٪ صفرهای تکراری، همبستگی اسپیرمن را مخدوش میکند و در نتیجه نتیجهگیری غلطی درباره تکراری بودن دادهها کردند.
- صفرهای عدم کاربرد (T03): صحت ۰.۰۳ بود. مدلها اغلب One-hot Encoding را برای مقادیر «۰» توصیه کردند و متوجه نشدند که ۰ به معنای «عدم کاربرد» است، نه یک رتبه عددی.
- انتخاب ارسالی نهایی (T11): صحت ۰.۲۴ بود. مدلها در استراتژی انتخاب فایلهای نهایی مشکل داشتند، هرچند نویسنده اشاره کرد که کلید نمرهدهی او برای این موضوع احتمالاً بیش از حد سختگیرانه بوده است.
- تلهٔ Foldهای بیشتر (T07): صحت ۰.۳۰ بود. مدلها درست توصیه کردند که به CV ۵-لایه بازگردند، اما دلیل آن را «نویز» دانستند، نه اثر اندازه دادههای آموزشی بر پیشبینیهای OOF.
اقدام درست، دلیل غلط
نکته کلیدی این است که مدلها در حالت باز، بهندرت در تلهٔ کلاسیک (قاعده کتابخانهای) افتادند. از ۱۲۲ مورد شکست، هیچکدام در جایگاه تله نبودند. در عوض، آنها توصیه درست را ارائه دادند اما دلیل فنی اشتباهی آوردند (که با E علامتگذاری شد).
برای مثال در مورد تلهٔ Foldها (T07)، مدلها درست توصیه کردند که برای صرفهجویی در محاسبات به ۵-fold برگردند، اما ادعا کردند بهبود ۰.۰۰۰۱۲ ناشی از «نویز» است. مکانیسم واقعی این است که ۱۰-fold روی ۹۰٪ دادهها آموزش میبیند (در مقابل ۸۰٪ در ۵-fold)، که پیشبینیهای OOF را بالا میبرد اما پیشبینیهای میانگین تست را بدون تغییر باقی میگذارد.
در مورد پیرسون و اسپیرمن (T02)، مدلها متوجه ۹۱٪ صفرهای تکراری شدند اما مقدار ρ = ۰.۴۷ را به عنوان یک توافق متوسط خواندند و نتیجه گرفتند که ستونها تقریباً تکراری نیستند. این اشتباه است؛ زیرا ρ که توسط تکرارها رقیق شده است، چیزی درباره سطرهایی که تأخیر دارند نمیگوید، در حالی که در آن سطرها، دو تأخیر دقیقاً یکدیگر را دنبال میکنند.
در مورد تفکیک CV و لیدربورد (T05)، مدل GPT-6.1 Sol پاسخی ارائه داد که از نظر فنی درباره دقت ارسالیهای همبسته برتر بود، حتی اگر با کلید پاسخ نویسنده مطابقت نداشت. این نشان میدهد برخی مدلها در حال توسعه درکی ظریفتر از آن چیزی هستند که بنچمارکهای فعلی ثبت میکنند.
روندهای خانوادههای مدل
دادهها نشان میدهد اندازه مدل با کیفیت استدلال در فرمتهای باز رابطه خطی ندارد. Gemma 4 26B-A4B کمی بهتر از مدل بزرگتر Gemma 4 31B عمل کرد (۲۷ در برابر ۲۶). همچنین Gemini 3.8 Flash از Gemini 3.1 Pro پیشی گرفت (۲۶ در برابر ۲۵).
برخی مدلها به طور کامل تست نشدند. Grok 4.6 خطای «مدل یافت نشد» داد، در حالی که GPT-5.5 و gpt-oss-120b به دلیل محدودیتهای هزینه و سهمیه روزانه دچار خطا شدند. Claude Opus 5.5 نیز به دلیل هزینه بالای اجرای مجدد نسخه نهایی از لیدربورد حذف شد.
این موضوع نشان میدهد برای قضاوتهای تخصصی دادهکاوی، کارایی معماری یا تنظیمات خاص (Tuning) مؤثرتر از تعداد خام پارامترهاست.
این شکاف در استدلال، این فرض را که مدلی که آزمون گواهینامه را پاس میکند میتواند یک دانشمند داده مستقل و قابل اعتماد باشد، تغییر میدهد. ثابت شد که مدلهای زبانی هنوز عمدتاً «تطبیقدهندههای الگو» (Pattern-matchers) برای توصیههای درستبهنظر هستند، نه استدلالکنندگانی بر اساس اصول اولیه (First-principles reasoners).
برای متخصصان، این یعنی حضور انسان در چرخه (Human-in-the-loop) صرفاً یک بررسی ایمنی نیست، بلکه یک ضرورت فنی است. شما نمیتوانید به توصیه مدل اعتماد کنید اگر مدل نتواند مکانیسمی را که آن توصیه را درست میکند، به طور دقیق بازسازی کند.
گام بعدی شما
- هنگام دریافت توصیه فنی از LLM، از آن بخواهید مکانیسم دقیق ریاضی یا منطقی پشت آن توصیه را توضیح دهد تا متوجه شوید آیا مدل در حال استدلال است یا صرفاً الگو را تکرار میکند.
- در پروژههای حساس، هرگز بر اساس خروجی مدل تصمیم به تغییر استراتژی اعتبارسنجی (مانند تعداد Foldها) نگیرید مگر اینکه شواهد تجربی را بررسی کرده باشید.
- برای تست مدل خود، سناریوهایی طراحی کنید که در آن قواعد کلی با دادههای واقعی تضاد دارند تا میزان توهم استدلالی مدل را بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو