پرش به محتوای اصلی
پرش به محتوای مقاله

Claude Fable 5.1 در شاخص جدید هوش مصنوعی Artificial Analysis پیشتاز شد

·۱۴ شهریور ۱۴۰۵۴ دقیقه مطالعه
اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲
اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افزایش سهم داده‌های خصوصی در وزن‌دهی شاخص به ۴۰٪ و معرفی دو محک اختصاصی AA-Briefcase و GDP.pdf برای سنجش واقعی توانایی‌های عامل‌محور و استدلال روی اسناد.

اگر به دنبال این هستید که بدانید کدام مدل واقعاً در کارهای پیچیده اداری و تحلیلی دقیق‌تر است، دیگر نمی‌توانید به بنچمارک‌های عمومی تکیه کنید. رقابت برای رسیدن به مرز هوش مصنوعی اکنون به سمتی رفته است که تمرکز اصلی بر بنچمارک‌های خصوصی و غیرقابل‌دست‌کاری (non-gameable) معطوف شده است. مدل‌ها یاد گرفته‌اند چگونه در آزمون‌های عمومی تقلب کنند، نه اینکه واقعاً باهوش‌تر شوند.

به همین دلیل، پلتفرم Artificial Analysis در ۵ سپتامبر ۲۰۲۶، نسخه ۴.۲ از شاخص هوش مصنوعی (Intelligence Index) خود را منتشر کرد. این به‌روزرسانی میان‌مدت برای مقابله با پدیده «گیمینگ» یا بهینه‌سازی مدل‌ها برای کسب نمره در آزمون‌های عمومی طراحی شده است. آزمایشگاه‌های هوش مصنوعی به طور فزاینده‌ای مدل‌های خود را برای بنچمارک‌های عمومی بهینه می‌کنند که این امر باعث ایجاد یک اثر ماسک‌کننده بر شکاف‌های عملکردی در دنیای واقعی می‌شود. هدف از تغییر وزن‌دهی این شاخص، ارائه ارزیابی صادقانه‌تری از نحوه مدیریت کارهای دانش‌محور، پیچیده و چندمرحله‌ای توسط مدل‌ها است.

زمینه و زمان‌بندی

از زمان عرضه نسخه ۴ این شاخص در ژانویه، هشت ماه می‌گذرد. تیم توسعه‌دهنده تعمداً به‌روزرسانی‌ها را به تأخیر انداخته بود تا در طول عرضه مدل‌های بزرگ اخیر، پایداری سیستم حفظ شود. با این حال، از آنجایی که مرزهای تکنولوژی در هفته‌های اخیر با سرعت بسیار زیادی جابجا شده‌اند، این به‌روزرسانی میان‌مدت تسریع شد تا اطمینان حاصل شود که شاخص همچنان مرتبط و کاربردی باقی می‌ماند.

این تغییرات در واقع به عنوان پلی برای رسیدن به نسخه ۵ عمل می‌کنند؛ نسخه‌ای که تیم ماه‌هاست در حال برنامه‌ریزی و ساخت آن است. انتظار می‌رود در آینده نزدیک، نسخه‌های تکمیلی و تدریجی بیشتری نیز منتشر شود.

اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

چارچوب‌های ارزیابی جدید

برای افزایش استواری و استحکام ارزیابی‌ها، شاخص v4.2 دو ستون اصلی ارزیابی را معرفی کرده است:

  • AA-Briefcase: یک ارزیابی خصوصی و داخلی است که بر کارهای عامل‌محور (Agentic) تمرکز دارد. این سیستم مدل‌ها را در پروژه‌های چند هفته‌ای می‌سنجد که توسط متخصصان صنعت طراحی شده و شامل هزاران فایل منبع و بسیاری از وظایف مرتبط با یکدیگر است. این رویکرد در راستای تحولی است که اجرای ایده‌ها را از محیط‌های ساده‌ی چت به سمت معماری‌های عامل‌محور و سریع‌تر سوق می‌دهد. برای اندازه‌گیری موفقیت قابل تأیید در انجام وظایف، کیفیت تحلیلی و کیفیت ارائه، از ترکیبی از سیستم‌های روبریگی (Rubric) و درجه‌بندی جفتی (Pairwise) استفاده می‌شود.
  • GDP.pdf: این محک که توسط Surge AI توسعه یافته، توانایی استدلال روی اسناد حرفه‌ای را در قالب تک-گام (single-turn) در ۱۰۰ فایل PDF و ۱۰ حوزه مختلف بررسی می‌کند. مدل‌ها باید شواهدی را که در ۴۵۹۲ صفحه توزیع شده‌اند (شامل متن، جداول، نمودارها، پاورقی‌ها و موارد استثنا شده) ترکیب و سنتز کنند. پاسخ‌ها بر اساس ۱۲۷۵ معیار اتمیک (atomic criteria) که توسط متخصصان نوشته شده‌اند، درجه‌بندی می‌شوند؛ به گونه‌ای که یک وظیفه تنها زمانی پذیرفته می‌شود که تک‌تک این معیارها برآورده شده باشند.

معرفی شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

جدول رده‌بندی جدید

طبق گزارش Artificial Analysis، مدل Claude Fable 5.1 از شرکت Anthropic در حال حاضر در صدر کل شاخص قرار دارد. در رتبه دوم، GPT-6 Astra از شرکت OpenAI قرار گرفته است که پیشرفت ۴ امتیازی را نسبت به مدل قبلی خود، یعنی GPT-5.6 Sol، نشان می‌دهد. شرکت Meta به عنوان سومین آزمایشگاه توانمند رتبه‌بندی شده و پس از آن به ترتیب SpaceXAI، Moonshot/Kimi، Z.AI و Google قرار دارند.

اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

در دسته‌های تخصصی، نتایج متفاوت است. مدل‌های Claude Fable 5.1 و Opus 5 در وظایف عامل‌محور AA-Briefcase پیشتاز هستند، هرچند GPT-6 Astra در این دسته پیشرفت قابل توجهی (حدود ۸۵ امتیاز Elo) نسبت به GPT-5.6 Sol نشان داد. برای استدلال روی اسناد با بافت طولانی (GDP.pdf)، مدل GPT-6 Astra با نرخ موفقیت کلی ۳۳.۲٪ تسلط دارد و پس از آن GPT-5.6 Sol با ۲۸.۲٪ و Claude Fable 5.1 با ۲۶.۲٪ قرار گرفته‌اند.

معرفی شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

بهره‌وری و هزینه

فراتر از هوش خام، این به‌روزرسانی به «مرز پارتو» هزینه در هر وظیفه (Cost per Task) پرداخته است که در حال حاضر توسط شرکت‌های Anthropic، OpenAI، Meta و Z.AI اشغال شده است.

مدل GPT-6 Astra به عنوان توکن‌بهینه‌ترین مدل در نزدیکی مرز هوش شناسایی شده است. این مدل نسبت به تقریباً تمام مدل‌های هم‌رده خود بهینه‌تر است. در مقابل، مدل‌هایی مانند Claude Fable 5.1، Grok 4.5 و Gemini 3.5 Flash-Lite در دو انتهای منحنی بهره‌وری قرار دارند (البته مدل‌هایی که نمره زیر ۲۵ در شاخص کسب کرده‌اند، از این مقایسه حذف شده‌اند).

اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

ارتقای زیرساخت‌های فنی

برای تضمین پایداری نمرات، تیم زیرساخت‌های درجه‌بندی خود را ارتقا داده است:

  • AA-LCR v1.1: یک پرامپت سیستم برای درجه‌بندی اضافه شد و خطاها و ابهامات در کلیدهای پاسخ برای بهبود دقت نمره‌دهی اصلاح گردید.
  • GDPval-AA v2 و AA-Briefcase: نمونه‌برداری‌ها بهبود یافت و مقیاس Elo مجدداً لنگر انداخته شد (re-anchored) تا با اضافه شدن مدل‌های جدید، رتبه‌بندی‌ها پایدارتر بمانند.
  • SciCode: محیط‌های اجرای کد (Sandboxes) تقویت شدند تا اطمینان حاصل شود کدهایی که اجرای کندی دارند اما صحیح هستند، دیگر به عنوان شکست (failure) علامت‌گذاری نشوند. این بهینه‌سازی‌های زیرساختی در حالی صورت می‌گیرد که در سطح سخت‌افزاری نیز راهکارهایی مانند معماری ویفری برای حذف گلوگاه‌های ارتباطی و افزایش سرعت استنتاج در حال توسعه هستند.

اعلام شاخص هوش مصنوعی تحلیلی نسخه ۴.۲

این چرخش به سمت داده‌های خصوصی، یک تغییر بنیادین در متدولوژی بنچمارک‌گذاری است. با اختصاص ۴۰٪ از وزن شاخص به داده‌های خصوصی — که دو برابر مقدار ۲۰٪ در نسخه ۴.۱ است — Artificial Analysis مدل‌ها را مجبور می‌کند تا از تعقیب نمرات بنچمارک‌های عمومی فاصله بگیرند. این داده‌های پنهان شامل AA-Briefcase، AA-Omniscience و پاسخ‌های CritPt است. انتظار می‌رود درصد داده‌های پنهان در نسخه ۵ حتی بیشتر شود.

در حالی که تیم برای عرضه کامل نسخه ۵ آماده می‌شود، صنعت باید نظاره‌گر باشد که آیا سایر ارزیابان نیز برای مقابله با اشباع تست‌های استدلال علمی عمومی (مانند GPQA Diamond)، از وزن‌دهی‌های مشابه برای مجموعه‌های خصوصی استفاده می‌کنند یا خیر.

گام بعدی شما

  • اگر از مدل‌های Claude برای مدیریت پروژه‌های حجیم استفاده می‌کنید، روی قابلیت‌های عامل‌محور آن در محیط‌های پیچیده تمرکز کنید.
  • برای تحلیل اسناد PDF بسیار طولانی و استخراج داده‌های دقیق، GPT-6 Astra را به عنوان گزینه اول در نظر بگیرید.
  • تغییرات در وزن‌دهی بنچمارک‌ها را دنبال کنید تا متوجه شوید کدام مدل‌ها در دنیای واقعی (و نه فقط در کاغذ) پیشرفت کرده‌اند.

اما تأثیر این تغییر در متدولوژی ارزیابی بر مدل‌های متن‌باز حتی پیچیده‌تر است — به تحلیل ما درباره‌ی مدل‌های Llama و رقابت با مدل‌های بسته مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار داده‌های خصوصی، استانداردهای صنعت را از نمرات تئوریک به نتایج عملی تغییر می‌دهد. در نتیجه، شرکت‌ها دیگر نمی‌توانند با دست‌کاری داده‌های آموزشی، ادعای برتری کاذب در هوش مصنوعی داشته باشند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به مدل‌های پیشتاز مانند GPT-6 Astra و Claude Fable 5.1 همچنان نیازمند ابزارهای واسط است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بنچمارک‌های عمومی با مجموعه‌های داده خصوصی، پایان عصر «بهینه‌سازی برای آزمون» است. این تغییر نشان می‌دهد که مدل‌های پیشرو به سقف توانایی در داده‌های موجود در وب رسیده‌اند و حالا تنها راه تمایز، عملکرد در سناریوهای پیچیده و واقعی است که در اینترنت یافت نمی‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.