پرش به محتوای اصلی
پرش به محتوای مقاله

فقط ۲۰ مورد از ۱۶۲ شکافِ بنچمارک مدل‌های هوش مصنوعی قابل تأیید هستند

·۱۷ مهر ۱۴۰۵۵ دقیقه مطالعه
بررسی ۱۶۲ معیار ارزیابی هوش مصنوعی: تنها ۲۰ مورد جامع بودند؛ مشکل اصلی نبود داده کافی بود.
بررسی ۱۶۲ معیار ارزیابی هوش مصنوعی: تنها ۲۰ مورد جامع بودند؛ مشکل اصلی نبود داده کافی بود.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین حسابرسی سیستماتیک روی ۱۶۲ مقایسه مدل که ثابت می‌کند بیش از ۸۷٪ از برتری‌های اعلام‌شده در بنچمارک‌های هوش مصنوعی، از نظر آماری غیرقابل تأیید یا بی‌معنی هستند.

تصور کنید بر اساس یک اختلاف ۰.۵ درصدی در یک جدول، میلیون‌ها دلار بودجه را به یک مدل هوش مصنوعی اختصاص دهید، در حالی که این اختلاف صرفاً یک نویز آماری است. این واقعیت تلخ، هسته مرکزی گزارشی است که نشان می‌دهد اکثر رتبه‌بندی‌های فعلی صنعت، بیشتر شبیه به بازاریابی هستند تا علم داده.

طبق گزارشی که در ۹ اکتبر ۲۰۲۶ توسط Driftproof منتشر شد، تنها ۲۰ مورد از ۱۶۲ شکافِ گزارش‌شده بین مدل‌ها در محک (Benchmark)ها، پس از حسابرسی آماری دقیق، به‌طور شفاف تفکیک شدند. اکثریت قریب به اتفاق برتری‌های اعلام‌شده در لیدربوردهای هوش مصنوعی یا حل‌نشده باقی مانده‌اند و یا به‌دلیل نبود داده‌های خام، غیرقابل تأیید هستند.

این یافته در حالی منتشر می‌شود که صنعت به‌شدت به اختلاف‌های تک‌رقمی برای توجیه برتری مدل‌ها تکیه می‌کند. با تکیه بر پوشش‌های خبری قبلی ما درباره اینکه چگونه مدل‌های هوش مصنوعی پیش از این فیلدهای داده‌ای گمشده را برای پر کردن شکاف‌ها اختراع کرده‌اند، این حسابرسی نشان می‌دهد که مشکل تنها جعل داده‌ها نیست، بلکه یک فقدان بنیادین در شفافیت نحوه گزارش نمرات است. این عدم شفافیت در ارزیابی‌ها، دقیقاً همان چالشی است که باعث شده تشخیص تغییرات واقعی در بازار تامین‌کنندگان LLM به دلیل نوسانات سریع و مبهم دشوار شود.

برای درک این بحران، یک لیدربورد را تصور کنید که در آن مدلی با ۶.۴ امتیاز پیشتاز است و غالب به نظر می‌رسد. در واقعیت، اگر آن محک تنها شامل ۳۰۰ مسئله باشد، این برتری کاملاً در محدوده خطای آماری قرار می‌گیرد؛ به این معنا که دو مدل از نظر آماری هیچ تفاوتی با هم ندارند و غیرقابل تشخیص هستند.

زمینه و هدف حسابرسی

این حسابرسی برای پاسخ به یک پرسش بسیار محدود و دقیق طراحی شده بود: وقتی کسی دو نمره بنچمارک را کنار هم می‌گذارد و یکی را بالاتر می‌نامد، آیا شواهد منتشرشده ثابت می‌کند که این شکاف بزرگ‌تر از عدم‌قطعیت (Uncertainty) است که ما در واقعیت می‌توانیم محاسبه کنیم؟

این یک ادعا نیست که نمرات بنچمارک «جعلی» هستند یا مدل‌ها در واقع به‌طور مخفیانه با هم برابرند. بلکه یافته‌ای است مبنی بر اینکه نمودارهای بنچمارک هوش مصنوعی اغلب بسیار دقیق‌تر از آن چیزی به نظر می‌رسند که شواهد عمومی اجازه تأیید آن‌ها را به ما می‌دهد.

بحران شفافیت در داده‌ها

این تیم شش پست معرفی مدل‌های پیشرو و نه لیدربورد عمومی را تحلیل کرد. نتایج، یک بحران شدید شفافیت را برجسته می‌کند:

  • شکست در پست‌های معرفی: از ۴۴ شکاف ذکر شده در متون معرفی، تنها ۱۱ مورد تفکیک شدند، ۵ مورد تفکیک نشدند و ۲۸ مورد به‌دلیل عدم انتشار شواهد لازم، به‌طور صادقانه قابل بررسی نبودند.
  • نویز در لیدربوردها: از ۱۱۸ جفت مدل مجاور در لیدربوردها، تنها ۹ مورد تفکیک آماری معناداری داشتند.
  • فقدان سیستماتیک اطلاعات: در یک حسابرسی گسترده‌تر روی ۶۱۷ ردیف منبع — که شامل یک پیوست از تضادهای منحنی تلاش (effort-curve contrasts) بود — ۴۸۳ مقایسه فاقد بازه‌های آگاه از تکرار (repeat-aware intervals) بودند که برای تأیید ضروری است.

مدل‌های خاصی به‌دلیل مستندات ناکافی مورد انتقاد قرار گرفتند. متریال معرفی Gemini 4 Argon شامل ۱۵ مقایسه بود که هیچ‌کدام از آن‌ها بر اساس داده‌های منتشرشده، بازه آماری صادقانه‌ای را پشتیبانی نمی‌کردند. Mistral Large 4 نیز با ۹ مقایسه، همگی در همین تست شکست خورد.

چرا داده‌ها «غیرقابل بررسی» هستند؟

دلایل این شکاف‌ها متفاوت است. در بسیاری از موارد، نمرات از میان چندین اجرای تکراری میانگین گرفته شده‌اند، بدون اینکه تعداد دفعات تکرار منتشر شود. در موارد دیگر، از ابزارهای ارزیابی (Harnesses) یا تنظیمات تلاش (effort settings) متفاوتی برای دو طرف مقایسه استفاده شده است.

برخی موارد نیز به‌دلیل نبود نتایج تفکیک‌شده برای هر مسئله (per-task results)، امکان بازسازی مقایسه جفتی را نداشتند. پژوهشگران برای پر کردن این خلأها، دقت مصنوعی ایجاد نکردند و به‌جای آن، این موارد را «غیرقابل بررسی» علامت زدند؛ این بدان معناست که شواهد لازم برای تصمیم‌گیری اصلاً منتشر نشده بود. این رویکرد سخت‌گیرانه در اعتبارسنجی، مشابه سیستم‌های جدید اعتبارسنجی پرامپت‌هاست که برای پایان دادن به توهمات بصری و ادعاهای اثبات‌نشده طراحی شده‌اند.

مثال SWE-bench

محک SWE-bench Multilingual این مشکل به‌وضوح نشان می‌دهد. در یک برش زمانی، دو رتبه اول با نمرات ۷۲.۷٪ در برابر ۶۶.۳٪ ثبت شده‌اند. اگرچه برتری ۶.۴ امتیازی قابل توجه به نظر می‌رسد، اما این محک تنها ۳۰۰ مسئله دارد.

در بدترین حالت دقت آماری در این مقیاس، رزولوشن محافظه‌کارانه تقریباً ۲۴ مسئله است. برای این جفت خاص، بازه کاربردی همچنان عدد صفر را شامل می‌شود. در نتیجه، این بنچمارک نتوانست تفکیکی بین آن‌ها ایجاد کند. در واقع، ۶ جایگاه در آن لیدربورد را نمی‌توان از رتبه اول متمایز کرد.

متدولوژی فنی

برای تضمین عینیت، پژوهشگران پیش از بررسی نمرات، روش تحلیل خود را منجمد و هش (Hash) کردند. برای نرخ‌های بنچمارک باینری با تعداد سؤالات مشخص، آن‌ها از بازه‌های ۹۵٪ ویلسون (Wilson intervals) و بازه ترکیبی نیوکومب (Newcombe hybrid Wilson interval) برای تفاوت‌ها استفاده کردند.

آن‌ها سلسله‌مراتب سخت‌گیرانه‌ای برای شواهد تعریف کردند:

  • داده‌های جفتی: در صورت وجود داده‌های جفتی معتبر برای هر مسئله، اولویت با شواهد جفتی است.
  • عدم‌قطعیت منتشرشده: اگر منبع، عدم‌قطعیت تکرارهای اجرا را منتشر کرده باشد، اولویت با آن است تا اینکه تکرارهای اجرا را به عنوان سؤالات مستقل در نظر بگیریم.
  • اطلاعات ناقص: در صورت نبود اطلاعات، پاسخ «غیرقابل محاسبه از داده‌های منتشرشده» ثبت می‌شود.

فرآیند حسابرسی و اصلاح

تیم یک اصلاح داخلی سخت‌گیرانه انجام داد. در دور اول که منجمد شده بود، ۲۱ شکاف تفکیک‌شده شناسایی شدند. اما پس از بررسی هر مقایسه در برابر نوع واقعی نمره و اطلاعات عدم‌قطعیت منتشرشده، ۵ مورد از این احکام اولیه حذف شدند.

در مقابل، ۴ شکاف که در تحلیل ساده‌تر حل‌نشده به نظر می‌رسیدند، با استفاده از بازه‌های خودِ منبع، تفکیک شدند. این روند تعداد نهایی را به ۲۰ مورد رساند. تمام احکام اولیه و اصلاح‌شده به‌همراه دلایل تغییر در مجموعه داده‌ها به‌صورت موازی ثبت شده است.

تغییر پارادایم بنچمارک‌ها

برای جامعه فنی، این موضوع این فرض را تغییر می‌دهد که عدد بالاتر در لیدربورد لزوماً به معنای مدل بهتر است. این نشان می‌دهد «دقیق بودن» در بازاریابی هوش مصنوعی، اغلب توهمی است که از حذف بازه‌های عدم‌قطعیت ایجاد شده است.

این تحول، صنعت را به سمت ارزیابی‌های «آگاه از تکرار» (Repeat-aware) سوق می‌دهد. اگر یک برتری تحت رزولوشن محافظه‌کارانه از صفر متمایز نباشد، بنچمارک در ایجاد تفکیک شکست خورده است، فارغ از اینکه درصد اسمی چقدر باشد. در واقع، برای عبور از این نقاط کور، استفاده از متدهای امتیازدهی اعتماد داده (Data Trust Scoring) می‌تواند جایگزین مناسب‌تری برای نظارت‌های سنتی و سطحی باشد.

در نهایت، این حسابرسی ثابت می‌کند که نویز نمونه‌برداری در بنچمارک‌ها، محرک اصلی رتبه‌بندی‌های ادراکی مدل‌ها است. این یک هشدار به توسعه‌دهندگان است که انتخاب مدل بر اساس برتری ۲ یا ۳ درصدی در یک جدول عمومی، اغلب قمار روی نویز است، نه سیگنال.

برای تأیید شکاف‌های خاص، تیم یک محاسبه‌گر عمومی در driftproof.com/benchmark-gap منتشر کرده است که برتری‌های درصدی را به تعداد واقعی سؤالات مورد نیاز برای معناداری تبدیل می‌کند. خط لوله تحلیل، شامل محاسبات بازه و استخراج منابع، با استفاده از Claude Code ساخته و اجرا شده است.

گام بعدی شما

  • هنگام بررسی لیدربوردهای عمومی، به‌جای تمرکز بر درصدها، به تعداد مسائل (Sample Size) در هر محک توجه کنید.
  • برای مقایسه مدل‌ها در پروژه‌های حساس، از ابزار محاسبه‌گر Driftproof برای تبدیل درصدها به تعداد سؤالات مورد نیاز برای معناداری استفاده کنید.
  • در گزارش‌های فنی خود، به‌جای تک‌عدد، بازه عدم‌قطعیت یا انحراف معیار را ذکر کنید تا از توهم دقت پرهیز شود.

اما داستان سخت‌افزاری این تحول و تأثیر آن بر هزینه استنتاج حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر متدولوژی آماری ویلسون، اعتبار لیدربوردهای فعلی را زیر سؤال می‌برد و نشان می‌دهد تصمیمات استراتژیک بر اساس نمرات بنچمارک اغلب فاقد پایه علمی است. این موضوع توسعه‌دهندگان را مجبور می‌کند از معیارهای سخت‌گیرانه‌تر برای انتخاب مدل استفاده کنند.

تأثیر برای ایران

این خبر برای پژوهشگران و توسعه‌دهندگان ایرانی که به‌دلیل محدودیت منابع سخت‌افزاری، بر اساس بنچمارک‌ها مدل‌های بازمتن را انتخاب می‌کنند، حیاتی است تا در تله‌ی نویزهای آماری نیفتند.

·نگاه ما
تحریریه دات‌هوش

اعتماد به لیدربوردهای فعلی در وضعیت بحرانی است و ما با نوعی «بث‌وارگی» در گزارش‌های فنی مواجهیم که در آن دقت ظاهری جایگزین صحت آماری شده است. این وضعیت نشان می‌دهد که صنعت هوش مصنوعی برای عبور از مرحله هایپ، نیازمند استانداردهای گزارش‌دهی است که در آن بازه خطا (Error Bar) به اندازه خودِ نمره اهمیت داشته باشد. در واقع، ما در حال گذار از عصر «رتبه‌بندی‌های اسمی» به عصر «ارزیابی‌های احتمالی» هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.