اگر برای انتخاب مدلهای تولیدی در محیط عملیاتی به بنچمارکها اعتماد میکنید، باید بدانید که معیارهای سنجش هوش مصنوعی در حال سختتر شدن هستند. پلتفرم AGI Ranker در ۲۹ جولای ۲۰۲۶ متدولوژی نسخه ۲.۰.۰ را منتشر کرد که منجر به سقوط نمرات تقریباً تمام مدلهای پیشرو شد.
این تحول در حالی رخ میدهد که صنعت با اشباع شدن محکهای سنجش دستوپنجه نرم میکند. بسیاری از آزمایشگاهها مدعی رسیدن به سطح توانایی انسان شدهاند، اما این ادعاها اغلب بر محور معیارهای داخلی استوار است که در برابر بازرسیهای خارجی تاب نمیآورند. همانطور که در تحلیل قبلی ما دربارهی نشت دادهها در مجموعههای آزمون اشاره کردیم، مشکل اصلی اکنون نه فقط دادههای آلوده، بلکه اعتبار خودِ مقیاسهای سنجش است.
اصلاح سقف انسانی (Human Ceiling) — یعنی همان نقطهای که عملکرد انسان به عنوان معیار حداکثری در نظر گرفته میشود تا توان مدل با آن مقایسه شود — هسته اصلی این بهروزرسانی است. پیش از این، نمرات با تقسیم نتایج خام بر یک بنچمارک انسانی نرمال میشدند. طبق اعلام AGI Ranker، اگر این سقف بیش از حد پایین تعیین میشد (که اغلب بر اساس سیاستهای احتمالی بود نه یافتههای واقعی)، مانند یک پیچ تنظیم عمل میکرد و نمرات مدلها را به طور مصنوعی افزایش میداد. این چالش در تعریف مرزهای توانایی انسان و ماشین، یادآور اتفاقاتی است که در تستهای امنیتی NexaVerify مشاهده شد و در آنجا متخصصان انسانی در برابر سرعت تحلیل مدلهای هوش مصنوعی شکست خوردند.
به عنوان مثال، محک Humanity’s Last Exam (HLE) پیشتر روی مقدار ۰.۵۰ تنظیم شده بود. بازرسیهای جدید نشان داد این عدد تنها یک حدس بوده است، نه یک یافته علمی؛ اتفاقی که اثر HLE را در امتیاز کلی AGI عملاً دو برابر کرده بود. اکنون سقفها یا بر اساس نتایج منتشرشده انسانی تحت پروتکلهای مشابه مدلها تعیین میشوند یا در صورت نبود داده، مقدار حداکثری (۱.۰۰) در نظر گرفته میشوند.
بر اساس مستندات جدید، تنها چهار محک از این بازرسی سالم بیرون آمدند:
- GPQA Diamond (۰.۸۱)
- OSWorld (۰.۷۲)
- FrontierMath (۰.۳۵)
- SimpleBench (۰.۸۳۷)
یازده بنچمارک دیگر به سقف ۱.۰۰ منتقل شدند و ادعاهای «برابری با انسان» که دادهای برای پشتیبانی نداشتند، حذف شدند. این تغییر به تنهایی باعث کاهش ۶ امتیازی نمرات شد. در بهروزرسانی بعدی (v2.0.2)، پلتفرم پذیرفت که در سه بخش مختلف، این لنگرهای انسانی را بیش از حد بیان کرده بود.
در کنار تغییر مقیاس، بخش عاملمحور (Agentic) — یعنی توانایی مدل در طراحی و اجرای گامهای متوالی برای رسیدن به هدف، شبیه مهندسی که ابتدا نقشه میکشد و سپس اجرا میکند — از پایه بازسازی شد. برای جلوگیری از سوگیری توسط یک منبع واحد، این بخش اکنون بر چهار رکن و سه ارزیاب مستقل استوار است:
- SWE-bench Verified
- Terminal-Bench 2.1
- τ³-Banking
- LiveBench Agentic Coding
به گزارش AGI Ranker، منبع تامین دادههای Terminal-Bench برای کاهش وابستگی به یک تامینکننده، از Artificial Analysis به vals.ai تغییر یافت. نکته جالب این است که نتایج τ³-Banking نشان داد بهترین مدلهای فعلی تنها حدود یکسوم از گردشهای کاری بانکی مبتنی بر وضعیت (stateful) را به درستی تکمیل میکنند.
پلتفرم همچنین برای مقابله با «تمرکز ارزیاب» اقدام کرد. پیش از این، ۴۵٪ کل تخته امتیازات و ۱۰۰٪ بخش استدلال بصری توسط یک ارزیاب تامین میشد. برای توزیع ریسک، محکهای GPQA Diamond و MMMU-Pro به vals.ai منتقل شدند. این جابجایی باعث شد سهم Artificial Analysis به ۲۶٪ کاهش یابد.
این تغییرات تأثیرات مستقیمی بر جایگاه مدلها گذاشت:
- GPT-5.6 Sol با امتیاز تقریبی ۹۲.۶ همچنان رتبه اول را دارد، هرچند فاصله مدلها کمتر شده است. هزینه API این مدل ۵ دلار برای ورودی و ۳۰ دلار برای خروجی به ازای هر میلیون توکن است.
- Grok 4.5 به دلیل تناقض دادهها در MMMU-Pro سه رتبه سقوط کرد.
- Kimi K3 پس از افزودن نتایج SWE-bench Verified از طریق vals.ai، به رتبه ۲ رسید، اما امتیاز کلی آن به دلیل کاهش توان در بخش عاملمحور، از ۸۹.۸۷ به ۸۸.۳۸ افت کرد.
- Claude Opus 5 با امتیاز ۹۷.۳۱ به عنوان مدل «موقت» وارد شد، زیرا هنوز دادههای کافی در بخش عاملمحور ندارد تا رتبه رسمی بگیرد.
در اقدامی نادر، این پلتفرم یک صفحه عذرخواهی اختصاصی برای مدل DeepSeek منتشر کرد. باراک لانیادو، مدیرعامل AGI Ranker، بابت نسبت دادن نادرست یک امتیاز در ARC-AGI-2 به DeepSeek V4 Pro عذرخواهی کرد. اکنون داشتن منبع ثبتشده، شرط لازم برای ثبت امتیاز است و تمامی ۱۵۶ سلول امتیازدهی دارای منبع هستند.
در بخش رابط کاربری نیز تغییرات گستردهای رخ داد. تبهای تخصصی اکنون به جای مقیاس ۰-۱۰۰، از شاخص ۰-۱۰ استفاده میکنند تا هرگونه توهم درباره برابری با انسان حذف شود. همچنین برای کاربران موبایل، یک نوار ناوبری فشرده و دکمه بازگشت به بالا اضافه شد تا دسترسی به دادههای حجیم تسهیل گردد.
این بازنگری کلی، سیگنالی از تغییر رویکرد از «ردیابی اعداد» به «حسابرسی شواهد» است. با پذیرش این واقعیت که اکثر محکها سقف انسانی معتبری ندارند، پلتفرم گفتگوهای صادقانهتری را درباره فاصله واقعی ما تا هوش مصنوعی عمومی (AGI) آغاز کرده است.
گام بعدی شما
- در بخش Value View پلتفرم، نمودار توانایی در برابر هزینه API را بررسی کنید تا بهینه ترین مدل را برای بودجه خود بیابید.
- هنگام تحلیل بنچمارکها، به جای عدد نهایی، به «منبع ارزیاب» توجه کنید تا اثر سوگیریهای احتمالی را بسنجید.
- برای مدلهای عاملمحور، نتایج LiveBench را به عنوان معیار سختگیرانهتر در نظر بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو