تصور کنید بر اساس یک اختلاف ۰.۵ درصدی در یک جدول، میلیونها دلار بودجه را به یک مدل هوش مصنوعی اختصاص دهید، در حالی که این اختلاف صرفاً یک نویز آماری است. این واقعیت تلخ، هسته مرکزی گزارشی است که نشان میدهد اکثر رتبهبندیهای فعلی صنعت، بیشتر شبیه به بازاریابی هستند تا علم داده.
طبق گزارشی که در ۹ اکتبر ۲۰۲۶ توسط Driftproof منتشر شد، تنها ۲۰ مورد از ۱۶۲ شکافِ گزارششده بین مدلها در محک (Benchmark)ها، پس از حسابرسی آماری دقیق، بهطور شفاف تفکیک شدند. اکثریت قریب به اتفاق برتریهای اعلامشده در لیدربوردهای هوش مصنوعی یا حلنشده باقی ماندهاند و یا بهدلیل نبود دادههای خام، غیرقابل تأیید هستند.
این یافته در حالی منتشر میشود که صنعت بهشدت به اختلافهای تکرقمی برای توجیه برتری مدلها تکیه میکند. با تکیه بر پوششهای خبری قبلی ما درباره اینکه چگونه مدلهای هوش مصنوعی پیش از این فیلدهای دادهای گمشده را برای پر کردن شکافها اختراع کردهاند، این حسابرسی نشان میدهد که مشکل تنها جعل دادهها نیست، بلکه یک فقدان بنیادین در شفافیت نحوه گزارش نمرات است. این عدم شفافیت در ارزیابیها، دقیقاً همان چالشی است که باعث شده تشخیص تغییرات واقعی در بازار تامینکنندگان LLM به دلیل نوسانات سریع و مبهم دشوار شود.
برای درک این بحران، یک لیدربورد را تصور کنید که در آن مدلی با ۶.۴ امتیاز پیشتاز است و غالب به نظر میرسد. در واقعیت، اگر آن محک تنها شامل ۳۰۰ مسئله باشد، این برتری کاملاً در محدوده خطای آماری قرار میگیرد؛ به این معنا که دو مدل از نظر آماری هیچ تفاوتی با هم ندارند و غیرقابل تشخیص هستند.
زمینه و هدف حسابرسی
این حسابرسی برای پاسخ به یک پرسش بسیار محدود و دقیق طراحی شده بود: وقتی کسی دو نمره بنچمارک را کنار هم میگذارد و یکی را بالاتر مینامد، آیا شواهد منتشرشده ثابت میکند که این شکاف بزرگتر از عدمقطعیت (Uncertainty) است که ما در واقعیت میتوانیم محاسبه کنیم؟
این یک ادعا نیست که نمرات بنچمارک «جعلی» هستند یا مدلها در واقع بهطور مخفیانه با هم برابرند. بلکه یافتهای است مبنی بر اینکه نمودارهای بنچمارک هوش مصنوعی اغلب بسیار دقیقتر از آن چیزی به نظر میرسند که شواهد عمومی اجازه تأیید آنها را به ما میدهد.
بحران شفافیت در دادهها
این تیم شش پست معرفی مدلهای پیشرو و نه لیدربورد عمومی را تحلیل کرد. نتایج، یک بحران شدید شفافیت را برجسته میکند:
- شکست در پستهای معرفی: از ۴۴ شکاف ذکر شده در متون معرفی، تنها ۱۱ مورد تفکیک شدند، ۵ مورد تفکیک نشدند و ۲۸ مورد بهدلیل عدم انتشار شواهد لازم، بهطور صادقانه قابل بررسی نبودند.
- نویز در لیدربوردها: از ۱۱۸ جفت مدل مجاور در لیدربوردها، تنها ۹ مورد تفکیک آماری معناداری داشتند.
- فقدان سیستماتیک اطلاعات: در یک حسابرسی گستردهتر روی ۶۱۷ ردیف منبع — که شامل یک پیوست از تضادهای منحنی تلاش (effort-curve contrasts) بود — ۴۸۳ مقایسه فاقد بازههای آگاه از تکرار (repeat-aware intervals) بودند که برای تأیید ضروری است.
مدلهای خاصی بهدلیل مستندات ناکافی مورد انتقاد قرار گرفتند. متریال معرفی Gemini 4 Argon شامل ۱۵ مقایسه بود که هیچکدام از آنها بر اساس دادههای منتشرشده، بازه آماری صادقانهای را پشتیبانی نمیکردند. Mistral Large 4 نیز با ۹ مقایسه، همگی در همین تست شکست خورد.
چرا دادهها «غیرقابل بررسی» هستند؟
دلایل این شکافها متفاوت است. در بسیاری از موارد، نمرات از میان چندین اجرای تکراری میانگین گرفته شدهاند، بدون اینکه تعداد دفعات تکرار منتشر شود. در موارد دیگر، از ابزارهای ارزیابی (Harnesses) یا تنظیمات تلاش (effort settings) متفاوتی برای دو طرف مقایسه استفاده شده است.
برخی موارد نیز بهدلیل نبود نتایج تفکیکشده برای هر مسئله (per-task results)، امکان بازسازی مقایسه جفتی را نداشتند. پژوهشگران برای پر کردن این خلأها، دقت مصنوعی ایجاد نکردند و بهجای آن، این موارد را «غیرقابل بررسی» علامت زدند؛ این بدان معناست که شواهد لازم برای تصمیمگیری اصلاً منتشر نشده بود. این رویکرد سختگیرانه در اعتبارسنجی، مشابه سیستمهای جدید اعتبارسنجی پرامپتهاست که برای پایان دادن به توهمات بصری و ادعاهای اثباتنشده طراحی شدهاند.
مثال SWE-bench
محک SWE-bench Multilingual این مشکل بهوضوح نشان میدهد. در یک برش زمانی، دو رتبه اول با نمرات ۷۲.۷٪ در برابر ۶۶.۳٪ ثبت شدهاند. اگرچه برتری ۶.۴ امتیازی قابل توجه به نظر میرسد، اما این محک تنها ۳۰۰ مسئله دارد.
در بدترین حالت دقت آماری در این مقیاس، رزولوشن محافظهکارانه تقریباً ۲۴ مسئله است. برای این جفت خاص، بازه کاربردی همچنان عدد صفر را شامل میشود. در نتیجه، این بنچمارک نتوانست تفکیکی بین آنها ایجاد کند. در واقع، ۶ جایگاه در آن لیدربورد را نمیتوان از رتبه اول متمایز کرد.
متدولوژی فنی
برای تضمین عینیت، پژوهشگران پیش از بررسی نمرات، روش تحلیل خود را منجمد و هش (Hash) کردند. برای نرخهای بنچمارک باینری با تعداد سؤالات مشخص، آنها از بازههای ۹۵٪ ویلسون (Wilson intervals) و بازه ترکیبی نیوکومب (Newcombe hybrid Wilson interval) برای تفاوتها استفاده کردند.
آنها سلسلهمراتب سختگیرانهای برای شواهد تعریف کردند:
- دادههای جفتی: در صورت وجود دادههای جفتی معتبر برای هر مسئله، اولویت با شواهد جفتی است.
- عدمقطعیت منتشرشده: اگر منبع، عدمقطعیت تکرارهای اجرا را منتشر کرده باشد، اولویت با آن است تا اینکه تکرارهای اجرا را به عنوان سؤالات مستقل در نظر بگیریم.
- اطلاعات ناقص: در صورت نبود اطلاعات، پاسخ «غیرقابل محاسبه از دادههای منتشرشده» ثبت میشود.
فرآیند حسابرسی و اصلاح
تیم یک اصلاح داخلی سختگیرانه انجام داد. در دور اول که منجمد شده بود، ۲۱ شکاف تفکیکشده شناسایی شدند. اما پس از بررسی هر مقایسه در برابر نوع واقعی نمره و اطلاعات عدمقطعیت منتشرشده، ۵ مورد از این احکام اولیه حذف شدند.
در مقابل، ۴ شکاف که در تحلیل سادهتر حلنشده به نظر میرسیدند، با استفاده از بازههای خودِ منبع، تفکیک شدند. این روند تعداد نهایی را به ۲۰ مورد رساند. تمام احکام اولیه و اصلاحشده بههمراه دلایل تغییر در مجموعه دادهها بهصورت موازی ثبت شده است.
تغییر پارادایم بنچمارکها
برای جامعه فنی، این موضوع این فرض را تغییر میدهد که عدد بالاتر در لیدربورد لزوماً به معنای مدل بهتر است. این نشان میدهد «دقیق بودن» در بازاریابی هوش مصنوعی، اغلب توهمی است که از حذف بازههای عدمقطعیت ایجاد شده است.
این تحول، صنعت را به سمت ارزیابیهای «آگاه از تکرار» (Repeat-aware) سوق میدهد. اگر یک برتری تحت رزولوشن محافظهکارانه از صفر متمایز نباشد، بنچمارک در ایجاد تفکیک شکست خورده است، فارغ از اینکه درصد اسمی چقدر باشد. در واقع، برای عبور از این نقاط کور، استفاده از متدهای امتیازدهی اعتماد داده (Data Trust Scoring) میتواند جایگزین مناسبتری برای نظارتهای سنتی و سطحی باشد.
در نهایت، این حسابرسی ثابت میکند که نویز نمونهبرداری در بنچمارکها، محرک اصلی رتبهبندیهای ادراکی مدلها است. این یک هشدار به توسعهدهندگان است که انتخاب مدل بر اساس برتری ۲ یا ۳ درصدی در یک جدول عمومی، اغلب قمار روی نویز است، نه سیگنال.
برای تأیید شکافهای خاص، تیم یک محاسبهگر عمومی در driftproof.com/benchmark-gap منتشر کرده است که برتریهای درصدی را به تعداد واقعی سؤالات مورد نیاز برای معناداری تبدیل میکند. خط لوله تحلیل، شامل محاسبات بازه و استخراج منابع، با استفاده از Claude Code ساخته و اجرا شده است.
گام بعدی شما
- هنگام بررسی لیدربوردهای عمومی، بهجای تمرکز بر درصدها، به تعداد مسائل (Sample Size) در هر محک توجه کنید.
- برای مقایسه مدلها در پروژههای حساس، از ابزار محاسبهگر Driftproof برای تبدیل درصدها به تعداد سؤالات مورد نیاز برای معناداری استفاده کنید.
- در گزارشهای فنی خود، بهجای تکعدد، بازه عدمقطعیت یا انحراف معیار را ذکر کنید تا از توهم دقت پرهیز شود.
اما داستان سختافزاری این تحول و تأثیر آن بر هزینه استنتاج حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو