پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک Kaggle: مدل‌های زبانی در ۴ مورد کلیدی استدلال داده‌کاوی شکست خوردند

·۱۷ مهر ۱۴۰۵۸ دقیقه مطالعه
پاسخ‌های متفاوت مدل‌های زبانی بزرگ به یک مسئله علم داده: ارزیابی ۳۶ تصمیم‌گیری در Kaggle
پاسخ‌های متفاوت مدل‌های زبانی بزرگ به یک مسئله علم داده: ارزیابی ۳۶ تصمیم‌گیری در Kaggle
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف شکاف آماری دقیق بین «شناخت پاسخ» (Accuracy نزدیک به ۱۰۰٪) و «تولید استدلال» (سقوط تا ۵۶٪) در مسائل تخصصی داده‌کاوی؛ اثبات اینکه مدل‌ها حتی با پاسخ درست، دلیل فنی اشتباه می‌سازند.

تصور کنید یک مدل هوش مصنوعی در آزمون‌های تئوری نمره کامل می‌گیرد، اما در مواجهه با یک مجموعه داده واقعی، تصمیمی می‌گیرد که رتبه شما را از ۱۰ به ۷۰۰ می‌رساند. این شکاف خطرناک بین «شناخت» و «استدلال» در مدل‌های پیشرو، حقیقتِ پنهان پشت نمرات بالای بنچمارک‌هاست.

طبق گزارشی که در ۹ اکتبر ۲۰۲۶ منتشر شد، یک بنچمارک جدید فاش کرد که بین شناخت پاسخ درست و استدلال برای رسیدن به آن، یک شکاف سیستماتیک وجود دارد. این پژوهش ۱۱ مدل برتر، از جمله GPT-6.1 Sol و Claude Sonnet 5.5 را مورد بررسی قرار داد. این مدل‌ها در مواجهه با «تصمیمات قضاوتی» (Judgment Calls) شکست خورده‌اند؛ یعنی همان تصمیمات ظریفی در رقابت‌های داده‌های جدولی که در آن‌ها قواعد کلی کتابخانه‌ای (Heuristics) اغلب شکست می‌خورند.

در دنیای رقابت‌های یادگیری ماشین، تکیه بر یک قاعده کلی به‌جای شواهد اندازه‌گیری شده، می‌تواند تفاوت بین یک رتبه تک‌رقمی و رتبه ۷۰۰ باشد. نویسنده پژوهش مثالی شخصی می‌زند: در یک رقابت، اجازه دادن به پلتفرم برای انتخاب خودکار بهترین فایل‌های ارسالی (Auto-pick)، منجر به رتبه ۷۰۸ از ۳۵۷۵ شد، در حالی که یک اجرای صادقانه و دستی می‌توانست رتبه‌ای بسیار بالاتر کسب کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی ساختارهای مقاوم در خط لوله‌های داده (SaaS pipelines) و استفاده از Fallbackهای پویا اشاره کردیم، این یافته‌ها نشان می‌دهد که اتکا به مدل‌های زبانی برای تصمیمات معماری حساس، نیازمند چیزی فراتر از نمرات بالا در بنچمارک‌هاست. ما به مدلی نیاز داریم که مکانیسم زیربنایی داده را بفهمد، نه اینکه صرفاً محتمل‌ترین توکن بعدی را پیش‌بینی کند.

طراحی محک

این پژوهش بر اساس ۳۶ مورد واقعی از رقابت‌های Kaggle Playground (S6E9 و S6E10) که در سپتامبر تا اکتبر ۲۰۲۶ برگزار شده بودند، طراحی شده است. این تست ۱۲ موضوع مختلف را پوشش می‌دهد که در هر کدام سه متغیر عددی وجود دارد. تمرکز اصلی بر مواردی است که شواهد تجربی، قواعد رایج و کلی را نقض می‌کنند.

جزئیات فنی و یافته‌های اندازه‌گیری شده

این محک مکانیسم‌های فنی دقیقی را می‌سنجد. برخی از نمونه‌های کلیدی عبارت‌اند از:

  • مقادیر p در نمونه‌های بزرگ (T01): ۱۹ ویژگی از ۲۱ مورد، p < 1e-300 داشتند (که طبق قواعد کلی باید بسیار مهم باشند)، اما AUC تک‌متغیره آن‌ها بین ۰.۸۴۰ تا ۰.۵۰۶ متغیر بود.
  • پیرسون در برابر اسپیرمن (T02): در ستون‌های تأخیر که ۹۱٪ آن‌ها صفر مطلق بودند، ضریب پیرسون ۰.۸۴ اما ضریب اسپیرمن ۰.۴۷ بود.
  • معنای عدد «۰» (T03): در رتبه‌بندی‌های وای‌فای، مقدار «۰» (که به معنای عدم کاربرد یا Not Applicable بود) نرخ رضایت ۰.۸۸۷ را نشان داد، در حالی که این نرخ برای مقدار ۱ برابر ۰.۳۹۱ و برای مقدار ۵ برابر ۰.۹۵۰ بود.
  • AUC در برابر اطلاعات متقابل (T04): یک رتبه‌بندی بر اساس AUC در جایگاه ۱۰ از ۲۱ بود، اما بر اساس MI و Cramér's V در جایگاه ۳ قرار گرفت.
  • اعتبارسنجی متقابل در برابر لیدربورد (T05): خطای استاندارد لیدربورد عمومی حدود ۰.۰۰۰۳ بود؛ بنابراین بهبودهای کوچک ۰.۰۰۰۰۵ در CV هرگز در لیدربورد ظاهر نشدند.
  • الحاق مجموعه داده (T06): افزودن سطرها به داده‌ها منجر به کاهش ۰.۰۰۰۲۵ شد، اما استفاده از پیش‌بینی مدل روی داده‌های اصلی به عنوان یک ویژگی جدید، بهبود ۰.۰۰۰۷ ایجاد کرد.
  • تلهٔ Foldهای بیشتر (T07): انتقال از ۵-fold به CV ۱۰-لایه، مقدار OOF را ۰.۰۰۰۱۲ افزایش داد اما تأثیری روی لیدربورد نداشت (تغییر ۰.۰۰۰۰).
  • شکار نشت داده (T08): علی‌رغم نبود هیچ تکراری و عدم هم‌پوشانی بین داده‌های آموزش و آزمون، ۱۷ سطر از ۱۲۹,۸۸۰ سطر اصلی بین دو مجموعه مشترک بودند.
  • کالیبراسیون (T09): چون AUC مبتنی بر رتبه است، یک کالیبراسیون یکنواخت (Monotone Recalibration) نمی‌تواند آن را افزایش دهد.
  • تنوع ترکیب مدل‌ها (T10): مدل‌های GBM همبستگی بسیار بالای ۰.۹۹۸۵ تا ۰.۹۹۹۴ داشتند؛ در مقابل، یک شبکه عصبی (NN) ضعیف‌تر ارزش بیشتری به استک (Stack) اضافه کرد.
  • انتخاب فایل ارسالی (T11): استراتژی انتخاب خودکار بهترین فایل‌های عمومی منجر به شکست و رتبه ۷۰۸ از ۳۵۷۵ شد.
  • ویژگی‌های پله‌ای (T12): مقادیر هدف در سن ۳۹ سال جهش و در سن ۶۱ سال افت کردند.

برای سنجش مدل‌ها از دو متد متمایز استفاده شد:

۱. ds-judgment (شناخت): فرمت چهارگزینه‌ای که در آن مدل باید بین چهار گزینه یکی را انتخاب کند: پاسخ اندازه‌گیری شده، تلهٔ کلاسیک (قاعده کتابخانه‌ای که اندازه‌گیری‌ها آن را نقض کردند) و دو گزینه پرت. برای جلوگیری از استراتژی «انتخاب بلندترین گزینه»، طول گزینه‌ها یکسان شد؛ به طوری که گزینه درست تنها در ۸ مورد از ۳۶ مورد، بلندترین گزینه بود.

۲. ds-judgment-open (تولید): فرمت باز که مدل باید توصیه و دلیل خود را در کمتر از ۱۲۰ کلمه بنویسد. یک مدل داور ثابت (Gemini 3.8 Flash) پاسخ‌های آزاد را به چهار جایگاه قبلی نگاشت کرد یا در صورت پاسخ مبهم/محتاطانه، نمره «E» اختصاص داد. این رویکرد استفاده از مدل‌های داور برای ارزیابی خروجی‌ها، یادآور ترکیب کد قطعی و مدل‌های زبانی است که پیش‌تر توانست هزینه ارزیابی پاسخ‌های فنی را تا ۹۶٪ کاهش دهد.

شکاف عملکردی

نتایج تضاد شدیدی را نشان می‌دهد. در حالت چهارگزینه‌ای، صحت مدل‌ها بین ۹۴٪ تا ۱۰۰٪ بود. اما در حالت تولیدی (Open-ended)، این رقم به ۵۶٪ تا ۸۱٪ سقوط کرد.

به نقل از داده‌های این پژوهش، Grok 4.20 Reasoning و Gemini 3.8 Flash هر دو در حالت چهارگزینه‌ای نمره کامل (۳۶/۳۶) گرفتند، اما در حالت باز به ۲۶/۳۶ رسیدند. Claude Haiku 4.5 شدیدترین سقوط را داشت و از نمره کامل در حالت گزینه‌ای به ۲۰/۳۶ در حالت باز رسید. این حساسیت شدید مدل‌های کوچک‌تر به تغییر فرمت یا کیفیت ورودی، با کاهش ۲۲ درصدی دقت Claude Haiku 4.5 در مواجهه با ابزارهای مسموم که پیش‌تر گزارش شد، هم‌سو است. سایر نمرات شامل Claude Sonnet 5.5 (۲۹/۳۶) و Gemma 4 26B-A4B (۲۷/۳۶) بود.

نقاط شکست مدل‌ها

شکست‌ها یکنواخت نبودند. در حالی که ۷ موضوع تقریباً حل شده بودند (صحت ≥ ۰.۹۷)، ۴ حوزه باعث لغزش تقریباً تمام مدل‌ها شد:

  • پیرسون در برابر اسپیرمن (T02): صحت در حالت باز ۰.۰۰ بود. مدل‌ها نتوانستند درک کنند که چگونه ۹۱٪ صفرهای تکراری، همبستگی اسپیرمن را مخدوش می‌کند و در نتیجه نتیجه‌گیری غلطی درباره تکراری بودن داده‌ها کردند.
  • صفرهای عدم کاربرد (T03): صحت ۰.۰۳ بود. مدل‌ها اغلب One-hot Encoding را برای مقادیر «۰» توصیه کردند و متوجه نشدند که ۰ به معنای «عدم کاربرد» است، نه یک رتبه عددی.
  • انتخاب ارسالی نهایی (T11): صحت ۰.۲۴ بود. مدل‌ها در استراتژی انتخاب فایل‌های نهایی مشکل داشتند، هرچند نویسنده اشاره کرد که کلید نمره‌دهی او برای این موضوع احتمالاً بیش از حد سخت‌گیرانه بوده است.
  • تلهٔ Foldهای بیشتر (T07): صحت ۰.۳۰ بود. مدل‌ها درست توصیه کردند که به CV ۵-لایه بازگردند، اما دلیل آن را «نویز» دانستند، نه اثر اندازه داده‌های آموزشی بر پیش‌بینی‌های OOF.

اقدام درست، دلیل غلط

نکته کلیدی این است که مدل‌ها در حالت باز، به‌ندرت در تلهٔ کلاسیک (قاعده کتابخانه‌ای) افتادند. از ۱۲۲ مورد شکست، هیچ‌کدام در جایگاه تله نبودند. در عوض، آن‌ها توصیه درست را ارائه دادند اما دلیل فنی اشتباهی آوردند (که با E علامت‌گذاری شد).

برای مثال در مورد تلهٔ Foldها (T07)، مدل‌ها درست توصیه کردند که برای صرفه‌جویی در محاسبات به ۵-fold برگردند، اما ادعا کردند بهبود ۰.۰۰۰۱۲ ناشی از «نویز» است. مکانیسم واقعی این است که ۱۰-fold روی ۹۰٪ داده‌ها آموزش می‌بیند (در مقابل ۸۰٪ در ۵-fold)، که پیش‌بینی‌های OOF را بالا می‌برد اما پیش‌بینی‌های میانگین تست را بدون تغییر باقی می‌گذارد.

در مورد پیرسون و اسپیرمن (T02)، مدل‌ها متوجه ۹۱٪ صفرهای تکراری شدند اما مقدار ρ = ۰.۴۷ را به عنوان یک توافق متوسط خواندند و نتیجه گرفتند که ستون‌ها تقریباً تکراری نیستند. این اشتباه است؛ زیرا ρ که توسط تکرارها رقیق شده است، چیزی درباره سطرهایی که تأخیر دارند نمی‌گوید، در حالی که در آن سطرها، دو تأخیر دقیقاً یکدیگر را دنبال می‌کنند.

در مورد تفکیک CV و لیدربورد (T05)، مدل GPT-6.1 Sol پاسخی ارائه داد که از نظر فنی درباره دقت ارسالی‌های همبسته برتر بود، حتی اگر با کلید پاسخ نویسنده مطابقت نداشت. این نشان می‌دهد برخی مدل‌ها در حال توسعه درکی ظریف‌تر از آن چیزی هستند که بنچمارک‌های فعلی ثبت می‌کنند.

روندهای خانواده‌های مدل

داده‌ها نشان می‌دهد اندازه مدل با کیفیت استدلال در فرمت‌های باز رابطه خطی ندارد. Gemma 4 26B-A4B کمی بهتر از مدل بزرگ‌تر Gemma 4 31B عمل کرد (۲۷ در برابر ۲۶). همچنین Gemini 3.8 Flash از Gemini 3.1 Pro پیشی گرفت (۲۶ در برابر ۲۵).

برخی مدل‌ها به طور کامل تست نشدند. Grok 4.6 خطای «مدل یافت نشد» داد، در حالی که GPT-5.5 و gpt-oss-120b به دلیل محدودیت‌های هزینه و سهمیه روزانه دچار خطا شدند. Claude Opus 5.5 نیز به دلیل هزینه بالای اجرای مجدد نسخه نهایی از لیدربورد حذف شد.

این موضوع نشان می‌دهد برای قضاوت‌های تخصصی داده‌کاوی، کارایی معماری یا تنظیمات خاص (Tuning) مؤثرتر از تعداد خام پارامترهاست.

این شکاف در استدلال، این فرض را که مدلی که آزمون گواهینامه را پاس می‌کند می‌تواند یک دانشمند داده مستقل و قابل اعتماد باشد، تغییر می‌دهد. ثابت شد که مدل‌های زبانی هنوز عمدتاً «تطبیق‌دهنده‌های الگو» (Pattern-matchers) برای توصیه‌های درست‌به‌نظر هستند، نه استدلال‌کنندگانی بر اساس اصول اولیه (First-principles reasoners).

برای متخصصان، این یعنی حضور انسان در چرخه (Human-in-the-loop) صرفاً یک بررسی ایمنی نیست، بلکه یک ضرورت فنی است. شما نمی‌توانید به توصیه مدل اعتماد کنید اگر مدل نتواند مکانیسمی را که آن توصیه را درست می‌کند، به طور دقیق بازسازی کند.

گام بعدی شما

  • هنگام دریافت توصیه فنی از LLM، از آن بخواهید مکانیسم دقیق ریاضی یا منطقی پشت آن توصیه را توضیح دهد تا متوجه شوید آیا مدل در حال استدلال است یا صرفاً الگو را تکرار می‌کند.
  • در پروژه‌های حساس، هرگز بر اساس خروجی مدل تصمیم به تغییر استراتژی اعتبارسنجی (مانند تعداد Foldها) نگیرید مگر اینکه شواهد تجربی را بررسی کرده باشید.
  • برای تست مدل خود، سناریوهایی طراحی کنید که در آن قواعد کلی با داده‌های واقعی تضاد دارند تا میزان توهم استدلالی مدل را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر داده‌های تجربی Kaggle ثابت می‌کند که مدل‌های زبانی در استدلال‌های اولیه‌ای (First-principles reasoning) ناتوان‌اند. این موضوع اعتبار اتکای کامل به AI در تصمیمات حساس مهندسی داده را زیر سؤال می‌برد.

تأثیر برای ایران

این خبر برای پژوهشگران یادگیری ماشین در ایران که در رقابت‌های جهانی مانند Kaggle فعال هستند، اهمیت دارد تا در تحلیل‌های خود بیش از حد به توصیه‌های مدل‌های زبانی اعتماد نکنند.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها نشان می‌دهد که ما با یک «توهمِ صلاحیت» در مدل‌های زبانی روبرو هستیم؛ مدل‌ها یاد گرفته‌اند که پاسخ‌های درست را شناسایی کنند، اما هنوز نمی‌توانند آن‌ها را استدلال کنند. این یعنی مدل‌های استدلالی فعلی، بیشتر در حال شبیه‌سازی ظاهرِ استدلال هستند تا اجرای واقعی آن. برای توسعه‌دهندگان، این یک هشدار جدی است که نمرات بنچمارک را با توانایی عملی مدل در محیط‌های تولیدی اشتباه نگیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.