پرش به محتوای اصلی
پرش به محتوای مقاله

درون استراتژی AISI برای راستی‌آزمایی مدل‌های هوش مصنوعی پیشرو

·۳۱ شهریور ۱۴۰۵۴ دقیقه مطالعه
لوگوی UK AISI و EvalEval در کنار هم، نماد همکاری برای قابل‌تکرار کردن نتایج ارزیابی مدل‌های هوش مصنوعی
لوگوی UK AISI و EvalEval در کنار هم، نماد همکاری برای قابل‌تکرار کردن نتایج ارزیابی مدل‌های هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از گزارش «امتیاز نهایی» به انتشار «داده‌های سطح تراکنش» و پیکربندی کامل؛ این یعنی برای اولین بار می‌توان دقیقاً دید یک مدل پیشرو چگونه و با چه هزینه‌ای به جواب رسیده است.

تصور کنید دنیایی را که در آن عملکرد مدل‌های پیشرو دیگر صرفاً یک عدد گزارش‌شده نیست، بلکه یک حقیقت علمی قابل راستی‌آزمایی است. برای دستیابی به این هدف، مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) در تلاش است تا «جعبه سیاه» بنچمارک‌های هوش مصنوعی را از بین ببرد. این مؤسسه برای رسیدن به این هدف، زیرساخت گزارش‌دهی باز ائتلاف EvalEval را پذیرفته و از طرحواره Every Eval Ever (EEE) استفاده می‌کند.

زمینه همکاری

برای مدتی طولانی، ارزیابی‌های هوش مصنوعی در قالب‌های پراکنده و در پلتفرم‌های مختلف گزارش می‌شدند. این گزارش‌ها اغلب فاقد داده‌های پیکربندی لازم برای بازتولید مستقل بودند. این فقدان شفافیت شکافی ایجاد کرده بود که در آن امتیازات گزارش‌شده لزوماً بازتاب‌دهنده عملکرد واقعی سیستم در شرایط مختلف نبودند. علاوه بر این، اجرای مجدد این ارزیابی‌ها برای تأیید نتایج، اغلب هزینه‌ای گزاف و بازدارنده داشت.

همان‌طور که در بحث‌های گذشته ما درباره‌ی استانداردهای ارزیابی مدل‌های بازمتن اشاره کردیم، نبود یک زبان مشترک برای گزارش نتایج، مقایسه مدل‌ها را دشوار می‌کرد. همکاری AISI و EvalEval که از یک کارگاه مشترک در جریان کنفرانس NeurIPS ۲۰۲۵ آغاز شد، اکنون به دنبال بستن این شکاف از طریق گزارش‌دهی استاندارد است. بازخوردهای مستقیم مؤسسه AISI به شکل‌دهی طرحواره Every Eval Ever (EEE) کمک کرده و این مشارکت را از یک مرحله پژوهشی به کاربرد عملی منتقل کرده است.

این ابتکار بر پایه تلاش‌های پیشین AISI برای بهبود علم ارزیابی استوار است، از جمله:

  • OptStop: ابزاری که برای بهینه کردن و افزایش بهره‌وری فرآیند ارزیابی طراحی شده است.
  • HiBayES: متدی با تمرکز بر افزایش دقت و سخت‌گیری آماری در نتایج.
  • استانداردسازی: تلاش‌هایی در زمینه‌های استخراج قابلیت‌ها (Capability Elicitation) و تحلیل تراکنش‌ها (Transcript Analysis).

این رویکرد به دنبال کاهش نوسانات در نتایج ارزیابی است، مشابه آنچه در به‌کارگیری حفاظ‌های مهندسی برای کاهش نرخ خطای تست‌های تولیدشده با AI مشاهده شد که منجر به پایداری بیشتر نتایج گشت.

طبق گزارشی که در ۲۲ سپتامبر ۲۰۲۶ در huggingface.co منتشر شد، این مؤسسه اکنون نتایج تأییدشده و داده‌های پیکربندی را از طریق کارت‌های ارزیابی (Evaluation Cards) منتشر می‌کند. این انتشار بر پنج محک (Benchmark) اصلی متمرکز است:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

جزئیات فنی و محدوده مدل‌ها

داده‌های منتشر شده، شش مدل پیشرو را پوشش می‌دهند که عبارت‌اند از: Claude Opus 4، Claude Opus 4.5، Claude Opus 4.6، GPT-5، GPT-5.2 و GPT-5.4. علاوه بر این، این انتشار شامل ارزیابی‌های تخصصی حوزه سایبری است که از Cyber CTFs و The Last Ones استخراج شده‌اند؛ این بخش از ارزیابی‌ها از مجموعه‌ای متفاوت و تا حدی هم‌پوشان از مدل‌ها استفاده می‌کند.

این نتایج همراه با مقاله پژوهشی AISI با عنوان «چگونه محاسبات استنتاج شکل‌دهنده ارزیابی LLMهای پیشرو است» منتشر شده است. این مطالعه بر یک نکته فنی حیاتی تأکید دارد: عملکرد در محک‌هایی مانند Humanity's Last Exam بر اساس پروتکل ارزیابی و میزان محاسبات (Compute) در زمان استنتاج (Inference) نوسان می‌کند. در این راستا، رفع محدودیت‌های سخت‌افزاری برای بهینه‌سازی این محاسبات اهمیت یافته است، همان‌طور که پروژه EUCLYD با جذب سرمایه کلانی بر رفع محدودیت پهنای باند حافظه تمرکز کرده است.

سازوکارهای کلیدی شناسایی‌شده در این پژوهش عبارت‌اند از:

  • همبستگی تعداد توکن: هر منحنی در این مطالعه، سهم تجمعی از تسک‌های تلاش‌شده را نشان می‌دهد که در یک تعداد توکن مشخص حل شده‌اند.
  • بازخورد اوراکل: مدل‌ها زمانی که پس از هر تلاش، بازخورد صحت (Correctness Feedback) را از یک منبع مرجع یا اوراکل دریافت می‌کردند، با افزایش مصرف توکن، به حل تسک‌های بیشتری موفق شدند.
  • ردیابی موفقیت: برای اندازه‌گیری دقیق عملکرد، داده‌ها از اولین موفقیت مشاهده‌شده برای هر تسک استفاده می‌کنند.

این چرخش به سمت شفافیت در سطح تراکنش (Transcript-level transparency)، مفروضات بنیادی بنچمارک‌های هوش مصنوعی را تغییر می‌دهد. پژوهشگران اکنون می‌توانند تحلیل کنند که چگونه انتخاب‌های خاص در تنظیمات — مانند میزان محاسبات استنتاج — بر نتیجه نهایی اثر می‌گذارد. این رویکرد، میدان را از «رقابت برای صدر جدول» (Leaderboard Chasing) به سمت یک علم تشخیصی، دقیق و سخت‌گیرانه می‌برد.

برای اکوسیستم گسترده‌تر هوش مصنوعی، این اقدام یک نقطه مرجع تأییدشده فراهم می‌کند. وقتی آزمایشگاه‌های دیگر نتایجی را بدون جزئیات کامل پیکربندی گزارش می‌کنند، داده‌های AISI به عنوان خط‌کشی برای تفسیر عمل می‌کند تا مشخص شود آیا آن ادعاها واقع‌بینانه هستند یا نتیجه‌ی پروتکل‌های ارزیابی بهینه‌شده (Optimized) می‌باشند. برای مثال، نتایج Terminal-Bench 2.0 اکنون در تنظیمات مختلف ارزیابی برای مدل‌های یکسان قابل مقایسه است.

توسعه‌دهندگان مدل و پژوهشگران ارزیابی اکنون تشویق شده‌اند تا برای حمایت از متا-پژوهش‌های قابل‌اعتمادتر، از طرحواره EEE استفاده کنند. با استانداردسازی نحوه گزارش بنچمارک‌ها، جامعه فنی می‌تواند شکاف‌های موجود در روش‌های ارزیابی فعلی را بهتر تشخیص دهد.

در آینده باید رصد کرد که سایر مؤسسات ایمنی ملی هوش مصنوعی چگونه این استانداردهای باز را می‌پذیرند تا یک چارچوب جهانی و متقابل (Interoperable) برای ارزیابی ریسک هوش مصنوعی ایجاد شود.

گام بعدی شما

  • بررسی کارت‌های ارزیابی AISI برای درک تأثیر میزان توکن مصرفی بر دقت مدل‌های GPT-5 و Claude 4.6.
  • تطبیق نتایج مدل‌های داخلی خود با استانداردهای EEE برای افزایش اعتبار گزارش‌های فنی.
  • دنبال کردن نحوه پذیرش این استانداردهای باز توسط سایر مؤسسات ایمنی ملی برای ایجاد یک چارچوب جهانی ارزیابی ریسک.

اما تأثیر این شفافیت بر رقابت سخت‌افزاری بین انویدیا و رقبا حتی پیچیده‌تر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار مؤسسه AISI، استانداردی را ایجاد می‌کند که ادعاهای شرکت‌های بزرگ را از حالت بازاریابی خارج و به حوزه علم تجربی می‌برد. در نتیجه، قابلیت‌های واقعی مدل‌های پیشرو برای اولین بار به صورت بازتولیدپذیر تعریف می‌شوند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان ابزارهای ارزیابی در ایران اهمیت دارد تا بازار مصرف؛ چرا که چارچوب EEE یک استاندارد باز برای سنجش دقیق مدل‌هاست.

·نگاه ما
تحریریه دات‌هوش

جایگزینی امتیازات ایستا با داده‌های سطح تراکنش، پایان عصر «تبلیغات بنچمارک» است. وقتی متغیرهایی مثل محاسبات زمان استنتاج (Inference-time compute) آشکار شوند، برتری یک مدل دیگر یک ویژگی ذاتی نیست، بلکه تابعی از هزینه و تنظیمات است. این تغییر، ارزیابی AI را از یک مسابقه سرعت به یک تحلیل مهندسی تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.