تصور کنید دنیایی را که در آن عملکرد مدلهای پیشرو دیگر صرفاً یک عدد گزارششده نیست، بلکه یک حقیقت علمی قابل راستیآزمایی است. برای دستیابی به این هدف، مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) در تلاش است تا «جعبه سیاه» بنچمارکهای هوش مصنوعی را از بین ببرد. این مؤسسه برای رسیدن به این هدف، زیرساخت گزارشدهی باز ائتلاف EvalEval را پذیرفته و از طرحواره Every Eval Ever (EEE) استفاده میکند.
زمینه همکاری
برای مدتی طولانی، ارزیابیهای هوش مصنوعی در قالبهای پراکنده و در پلتفرمهای مختلف گزارش میشدند. این گزارشها اغلب فاقد دادههای پیکربندی لازم برای بازتولید مستقل بودند. این فقدان شفافیت شکافی ایجاد کرده بود که در آن امتیازات گزارششده لزوماً بازتابدهنده عملکرد واقعی سیستم در شرایط مختلف نبودند. علاوه بر این، اجرای مجدد این ارزیابیها برای تأیید نتایج، اغلب هزینهای گزاف و بازدارنده داشت.
همانطور که در بحثهای گذشته ما دربارهی استانداردهای ارزیابی مدلهای بازمتن اشاره کردیم، نبود یک زبان مشترک برای گزارش نتایج، مقایسه مدلها را دشوار میکرد. همکاری AISI و EvalEval که از یک کارگاه مشترک در جریان کنفرانس NeurIPS ۲۰۲۵ آغاز شد، اکنون به دنبال بستن این شکاف از طریق گزارشدهی استاندارد است. بازخوردهای مستقیم مؤسسه AISI به شکلدهی طرحواره Every Eval Ever (EEE) کمک کرده و این مشارکت را از یک مرحله پژوهشی به کاربرد عملی منتقل کرده است.
این ابتکار بر پایه تلاشهای پیشین AISI برای بهبود علم ارزیابی استوار است، از جمله:
- OptStop: ابزاری که برای بهینه کردن و افزایش بهرهوری فرآیند ارزیابی طراحی شده است.
- HiBayES: متدی با تمرکز بر افزایش دقت و سختگیری آماری در نتایج.
- استانداردسازی: تلاشهایی در زمینههای استخراج قابلیتها (Capability Elicitation) و تحلیل تراکنشها (Transcript Analysis).
این رویکرد به دنبال کاهش نوسانات در نتایج ارزیابی است، مشابه آنچه در بهکارگیری حفاظهای مهندسی برای کاهش نرخ خطای تستهای تولیدشده با AI مشاهده شد که منجر به پایداری بیشتر نتایج گشت.
طبق گزارشی که در ۲۲ سپتامبر ۲۰۲۶ در huggingface.co منتشر شد، این مؤسسه اکنون نتایج تأییدشده و دادههای پیکربندی را از طریق کارتهای ارزیابی (Evaluation Cards) منتشر میکند. این انتشار بر پنج محک (Benchmark) اصلی متمرکز است:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
جزئیات فنی و محدوده مدلها
دادههای منتشر شده، شش مدل پیشرو را پوشش میدهند که عبارتاند از: Claude Opus 4، Claude Opus 4.5، Claude Opus 4.6، GPT-5، GPT-5.2 و GPT-5.4. علاوه بر این، این انتشار شامل ارزیابیهای تخصصی حوزه سایبری است که از Cyber CTFs و The Last Ones استخراج شدهاند؛ این بخش از ارزیابیها از مجموعهای متفاوت و تا حدی همپوشان از مدلها استفاده میکند.
این نتایج همراه با مقاله پژوهشی AISI با عنوان «چگونه محاسبات استنتاج شکلدهنده ارزیابی LLMهای پیشرو است» منتشر شده است. این مطالعه بر یک نکته فنی حیاتی تأکید دارد: عملکرد در محکهایی مانند Humanity's Last Exam بر اساس پروتکل ارزیابی و میزان محاسبات (Compute) در زمان استنتاج (Inference) نوسان میکند. در این راستا، رفع محدودیتهای سختافزاری برای بهینهسازی این محاسبات اهمیت یافته است، همانطور که پروژه EUCLYD با جذب سرمایه کلانی بر رفع محدودیت پهنای باند حافظه تمرکز کرده است.
سازوکارهای کلیدی شناساییشده در این پژوهش عبارتاند از:
- همبستگی تعداد توکن: هر منحنی در این مطالعه، سهم تجمعی از تسکهای تلاششده را نشان میدهد که در یک تعداد توکن مشخص حل شدهاند.
- بازخورد اوراکل: مدلها زمانی که پس از هر تلاش، بازخورد صحت (Correctness Feedback) را از یک منبع مرجع یا اوراکل دریافت میکردند، با افزایش مصرف توکن، به حل تسکهای بیشتری موفق شدند.
- ردیابی موفقیت: برای اندازهگیری دقیق عملکرد، دادهها از اولین موفقیت مشاهدهشده برای هر تسک استفاده میکنند.
این چرخش به سمت شفافیت در سطح تراکنش (Transcript-level transparency)، مفروضات بنیادی بنچمارکهای هوش مصنوعی را تغییر میدهد. پژوهشگران اکنون میتوانند تحلیل کنند که چگونه انتخابهای خاص در تنظیمات — مانند میزان محاسبات استنتاج — بر نتیجه نهایی اثر میگذارد. این رویکرد، میدان را از «رقابت برای صدر جدول» (Leaderboard Chasing) به سمت یک علم تشخیصی، دقیق و سختگیرانه میبرد.
برای اکوسیستم گستردهتر هوش مصنوعی، این اقدام یک نقطه مرجع تأییدشده فراهم میکند. وقتی آزمایشگاههای دیگر نتایجی را بدون جزئیات کامل پیکربندی گزارش میکنند، دادههای AISI به عنوان خطکشی برای تفسیر عمل میکند تا مشخص شود آیا آن ادعاها واقعبینانه هستند یا نتیجهی پروتکلهای ارزیابی بهینهشده (Optimized) میباشند. برای مثال، نتایج Terminal-Bench 2.0 اکنون در تنظیمات مختلف ارزیابی برای مدلهای یکسان قابل مقایسه است.
توسعهدهندگان مدل و پژوهشگران ارزیابی اکنون تشویق شدهاند تا برای حمایت از متا-پژوهشهای قابلاعتمادتر، از طرحواره EEE استفاده کنند. با استانداردسازی نحوه گزارش بنچمارکها، جامعه فنی میتواند شکافهای موجود در روشهای ارزیابی فعلی را بهتر تشخیص دهد.
در آینده باید رصد کرد که سایر مؤسسات ایمنی ملی هوش مصنوعی چگونه این استانداردهای باز را میپذیرند تا یک چارچوب جهانی و متقابل (Interoperable) برای ارزیابی ریسک هوش مصنوعی ایجاد شود.
گام بعدی شما
- بررسی کارتهای ارزیابی AISI برای درک تأثیر میزان توکن مصرفی بر دقت مدلهای GPT-5 و Claude 4.6.
- تطبیق نتایج مدلهای داخلی خود با استانداردهای EEE برای افزایش اعتبار گزارشهای فنی.
- دنبال کردن نحوه پذیرش این استانداردهای باز توسط سایر مؤسسات ایمنی ملی برای ایجاد یک چارچوب جهانی ارزیابی ریسک.
اما تأثیر این شفافیت بر رقابت سختافزاری بین انویدیا و رقبا حتی پیچیدهتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو