پرش به محتوای اصلی
پرش به محتوای مقاله

درون متدولوژی جدید AGI Ranker برای اصلاح سوگیری‌های ارزیابی

·۸ مرداد ۱۴۰۵۳۲ دقیقه مطالعه۱ بازدید
رتبه‌بندی AGI - امتیاز باز AGI برای مدل‌های پیشرو هوش مصنوعی
رتبه‌بندی AGI - امتیاز باز AGI برای مدل‌های پیشرو هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی سقف‌های انسانی حدسی با مقادیر حداکثری ۱.۰۰ و انتقال داده‌های ارزیابی از یک منبع متمرکز به ارزیاب‌های متنوع برای جلوگیری از سوگیری سیستماتیک.

اگر برای انتخاب مدل‌های تولیدی در محیط عملیاتی به بنچمارک‌ها اعتماد می‌کنید، باید بدانید که معیارهای سنجش هوش مصنوعی در حال سخت‌تر شدن هستند. پلتفرم AGI Ranker در ۲۹ جولای ۲۰۲۶ متدولوژی نسخه ۲.۰.۰ را منتشر کرد که منجر به سقوط نمرات تقریباً تمام مدل‌های پیشرو شد.

این تحول در حالی رخ می‌دهد که صنعت با اشباع شدن محک‌های سنجش دست‌وپنجه نرم می‌کند. بسیاری از آزمایشگاه‌ها مدعی رسیدن به سطح توانایی انسان شده‌اند، اما این ادعاها اغلب بر محور معیارهای داخلی استوار است که در برابر بازرسی‌های خارجی تاب نمی‌آورند. همان‌طور که در تحلیل قبلی ما درباره‌ی نشت داده‌ها در مجموعه‌های آزمون اشاره کردیم، مشکل اصلی اکنون نه فقط داده‌های آلوده، بلکه اعتبار خودِ مقیاس‌های سنجش است.

اصلاح سقف انسانی (Human Ceiling) — یعنی همان نقطه‌ای که عملکرد انسان به عنوان معیار حداکثری در نظر گرفته می‌شود تا توان مدل با آن مقایسه شود — هسته اصلی این به‌روزرسانی است. پیش از این، نمرات با تقسیم نتایج خام بر یک بنچمارک انسانی نرمال می‌شدند. طبق اعلام AGI Ranker، اگر این سقف بیش از حد پایین تعیین می‌شد (که اغلب بر اساس سیاست‌های احتمالی بود نه یافته‌های واقعی)، مانند یک پیچ تنظیم عمل می‌کرد و نمرات مدل‌ها را به طور مصنوعی افزایش می‌داد. این چالش در تعریف مرزهای توانایی انسان و ماشین، یادآور اتفاقاتی است که در تست‌های امنیتی NexaVerify مشاهده شد و در آنجا متخصصان انسانی در برابر سرعت تحلیل مدل‌های هوش مصنوعی شکست خوردند.

به عنوان مثال، محک Humanity’s Last Exam (HLE) پیش‌تر روی مقدار ۰.۵۰ تنظیم شده بود. بازرسی‌های جدید نشان داد این عدد تنها یک حدس بوده است، نه یک یافته علمی؛ اتفاقی که اثر HLE را در امتیاز کلی AGI عملاً دو برابر کرده بود. اکنون سقف‌ها یا بر اساس نتایج منتشرشده انسانی تحت پروتکل‌های مشابه مدل‌ها تعیین می‌شوند یا در صورت نبود داده، مقدار حداکثری (۱.۰۰) در نظر گرفته می‌شوند.

بر اساس مستندات جدید، تنها چهار محک از این بازرسی سالم بیرون آمدند:

  • GPQA Diamond (۰.۸۱)
  • OSWorld (۰.۷۲)
  • FrontierMath (۰.۳۵)
  • SimpleBench (۰.۸۳۷)

یازده بنچمارک دیگر به سقف ۱.۰۰ منتقل شدند و ادعاهای «برابری با انسان» که داده‌ای برای پشتیبانی نداشتند، حذف شدند. این تغییر به تنهایی باعث کاهش ۶ امتیازی نمرات شد. در به‌روزرسانی بعدی (v2.0.2)، پلتفرم پذیرفت که در سه بخش مختلف، این لنگرهای انسانی را بیش از حد بیان کرده بود.

در کنار تغییر مقیاس، بخش عامل‌محور (Agentic) — یعنی توانایی مدل در طراحی و اجرای گام‌های متوالی برای رسیدن به هدف، شبیه مهندسی که ابتدا نقشه می‌کشد و سپس اجرا می‌کند — از پایه بازسازی شد. برای جلوگیری از سوگیری توسط یک منبع واحد، این بخش اکنون بر چهار رکن و سه ارزیاب مستقل استوار است:

  • SWE-bench Verified
  • Terminal-Bench 2.1
  • τ³-Banking
  • LiveBench Agentic Coding

به گزارش AGI Ranker، منبع تامین داده‌های Terminal-Bench برای کاهش وابستگی به یک تامین‌کننده، از Artificial Analysis به vals.ai تغییر یافت. نکته جالب این است که نتایج τ³-Banking نشان داد بهترین مدل‌های فعلی تنها حدود یک‌سوم از گردش‌های کاری بانکی مبتنی بر وضعیت (stateful) را به درستی تکمیل می‌کنند.

پلتفرم همچنین برای مقابله با «تمرکز ارزیاب» اقدام کرد. پیش از این، ۴۵٪ کل تخته امتیازات و ۱۰۰٪ بخش استدلال بصری توسط یک ارزیاب تامین می‌شد. برای توزیع ریسک، محک‌های GPQA Diamond و MMMU-Pro به vals.ai منتقل شدند. این جابجایی باعث شد سهم Artificial Analysis به ۲۶٪ کاهش یابد.

این تغییرات تأثیرات مستقیمی بر جایگاه مدل‌ها گذاشت:

  • GPT-5.6 Sol با امتیاز تقریبی ۹۲.۶ همچنان رتبه اول را دارد، هرچند فاصله مدل‌ها کمتر شده است. هزینه API این مدل ۵ دلار برای ورودی و ۳۰ دلار برای خروجی به ازای هر میلیون توکن است.
  • Grok 4.5 به دلیل تناقض داده‌ها در MMMU-Pro سه رتبه سقوط کرد.
  • Kimi K3 پس از افزودن نتایج SWE-bench Verified از طریق vals.ai، به رتبه ۲ رسید، اما امتیاز کلی آن به دلیل کاهش توان در بخش عامل‌محور، از ۸۹.۸۷ به ۸۸.۳۸ افت کرد.
  • Claude Opus 5 با امتیاز ۹۷.۳۱ به عنوان مدل «موقت» وارد شد، زیرا هنوز داده‌های کافی در بخش عامل‌محور ندارد تا رتبه رسمی بگیرد.

در اقدامی نادر، این پلتفرم یک صفحه عذرخواهی اختصاصی برای مدل DeepSeek منتشر کرد. باراک لانیادو، مدیرعامل AGI Ranker، بابت نسبت دادن نادرست یک امتیاز در ARC-AGI-2 به DeepSeek V4 Pro عذرخواهی کرد. اکنون داشتن منبع ثبت‌شده، شرط لازم برای ثبت امتیاز است و تمامی ۱۵۶ سلول امتیازدهی دارای منبع هستند.

در بخش رابط کاربری نیز تغییرات گسترده‌ای رخ داد. تب‌های تخصصی اکنون به جای مقیاس ۰-۱۰۰، از شاخص ۰-۱۰ استفاده می‌کنند تا هرگونه توهم درباره برابری با انسان حذف شود. همچنین برای کاربران موبایل، یک نوار ناوبری فشرده و دکمه بازگشت به بالا اضافه شد تا دسترسی به داده‌های حجیم تسهیل گردد.

این بازنگری کلی، سیگنالی از تغییر رویکرد از «ردیابی اعداد» به «حسابرسی شواهد» است. با پذیرش این واقعیت که اکثر محک‌ها سقف انسانی معتبری ندارند، پلتفرم گفتگوهای صادقانه‌تری را درباره فاصله واقعی ما تا هوش مصنوعی عمومی (AGI) آغاز کرده است.

گام بعدی شما

  • در بخش Value View پلتفرم، نمودار توانایی در برابر هزینه API را بررسی کنید تا بهینه ترین مدل را برای بودجه خود بیابید.
  • هنگام تحلیل بنچمارک‌ها، به جای عدد نهایی، به «منبع ارزیاب» توجه کنید تا اثر سوگیری‌های احتمالی را بسنجید.
  • برای مدل‌های عامل‌محور، نتایج LiveBench را به عنوان معیار سخت‌گیرانه‌تر در نظر بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اصلاحیه با تکیه بر استقلال ارزیاب‌ها و حذف داده‌های خوداظهاری، اعتبار بنچمارک‌های AGI را افزایش می‌دهد. نتیجه این است که فاصله واقعی مدل‌ها تا توانایی انسان آشکارتر شده و مانع از تصمیمات تجاری بر اساس داده‌های متورم می‌شود.

تأثیر برای ایران

این به‌روزرسانی برای توسعه‌دهندگان ایرانی که به دلیل محدودیت بودجه به دنبال بهینه‌ترین مدل (Value Frontier) هستند، معیار دقیق‌تری برای انتخاب مدل بر اساس هزینه-عملکرد فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تلاش AGI Ranker برای حذف «سقف انسانی»، در واقع اعترافی است به اینکه ما هنوز ابزاری برای اندازه‌گیری دقیق هوش انسان در سطح مدل‌های زبانی نداریم. وقتی معیار مقایسه (Human Baseline) یک حدس باشد، تمام رتبه‌بندی‌ها تبدیل به توهمات آماری می‌شوند. این حرکت نشان می‌دهد که صنعت از دوران «رقابت برای اعداد بالاتر» وارد دوران «اعتبارسنجی متدولوژی» شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.