اگر امروز مدلهای زبانی را بر اساس تعداد پارامترها یا نمرات کلی میسنجید، باید بدانید که معیار بازی تغییر کرده است. در ۱۹ سپتامبر ۲۰۲۶، پلتفرم Artificial Analysis شاخص Intelligence Index v4.3 را منتشر کرد. این چارچوب طراحی شده است تا فراتر از پرسشوپاسخهای ایستا حرکت کرده و عملکرد مدلها را در محیطهای حرفهای و واقعی بسنجد.
این بهروزرسانی در حالی رخ میدهد که صنعت هوش مصنوعی برای تعریف دقیق «هوش» در مقابل «حجم پارامترها» در تکاپو است. همانطور که در تحلیل قبلی ما دربارهی دستاوردهای شاخص GPT-6 Astra اشاره کردیم، اکنون هدف این است که هزینه یک تسک استدلالی موفق بهجای هزینه هر توکن استاندارد شود.
متدولوژی و بستر ارزیابی
طبق اعلام Artificial Analysis، نسخه ۴.۳ برای سنجش عملکرد در قابلیتها و صنایع خاص طراحی شده است. در حالی که هوش عمومی معمولاً در کاربردهای مختلف قابل انتقال است، این پلتفرم اشاره میکند که ارزیابیهای تخصصی برای برخی کاربردهای حرفهای مرتبطتر هستند.
این چارچوب مدلها را بر اساس نوع وزنها به دو دسته وزنهای باز (Open Weights) و اختصاصی (Proprietary) تقسیم میکند. همچنین برای شفافیت بیشتر، مدلهایی که مجوز استفاده تجاری ندارند با برچسب «غیرتجاری» (Non-commercial) مشخص شدهاند. همچنین مدلهایی که شرایط خاصی برای استفاده تجاری دارند، با برچسب «محدود به استفاده تجاری» (Commercial Use Restricted) علامتگذاری شدهاند.
مجموعه ارزیابیهای نسخه ۴.۳
به نقل از مستندات این پلتفرم، ۱۰ ارزیابی مجزا برای محاسبه امتیاز نهایی هوش به کار گرفته شده است که عبارتاند از:
- AA-Briefcase: محک کارهای دانشی عاملمحور (Agentic). این بنچمارک از AA-Briefcase Elo استفاده میکند که یک معیار ترکیبی از نرخ پذیرش دستورالعمل (Rubric pass rate)، کیفیت تحلیلی (Analytical quality Elo) و کیفیت ارائه (Presentation Elo) است. عملکرد در دستورالعملها از طریق مسابقات شبیهسازی شدهی رودررو به Elo تبدیل میشود و کرانهای آن در عدد ۰ محدود شده است.
- AA-Omniscience: شاخص قابلیت اطمینان که میزان توهم (Hallucination) و دقت دانش را میسنجد. این شاخص پاسخهای درست را پاداش داده و توهمات را جریمه میکند، اما برای امتناع از پاسخ دادن جریمهای در نظر نمیگیرد. امتیازات بین ۱۰۰- تا ۱۰۰ متغیر است و عدد ۰ نشاندهنده تعداد برابر پاسخهای درست و غلط است.
- Terminal-Bench 4.0 و AutomationBench-AA: این دو ارزیابی بهطور خاص بر کدنویسی عاملمحور و توانایی استفاده از ترمینال متمرکز هستند.
- SciCode و Humanity's Last Exam: برای تست استدلالهای سطح بالای علمی و استدلالهای عمومی پیچیده.
- GDPval-AA v2، GDP.pdf، CritPt و AA-LCR v1.1: ارزیابیهای تخصصی استدلال در متون طولانی، از جمله استدلالهای پزشکی در متون طولانی و استدلال روی اسناد حرفهای (All-pass).
معیارهای هزینه و عملکرد
این پلتفرم اکنون فراتر از نمرات خام، «میانگین هزینه وزنی هر تسک در شاخص هوش» را ردیابی میکند. این معیار مجموع دلارهای هزینه شده برای ورودی، ضربههای حافظه (Cache Hits)، نوشتن در حافظه (Cache Writes) و توکنهای استدلالی را محاسبه کرده و بر تعداد تسکها تقسیم میکند، در حالی که هر ارزیابی بر اساس وزن خود در شاخص هوش اثر میگذارد.
علاوه بر این، معیاری برای تعداد توکنهای خروجی در هر تسک معرفی شده است. این عدد از ضرب توکنهای خروجی هر ارزیابی در وزن نسبی آن بنچمارک در شاخص و سپس تقسیم بر تعداد تسکها (بدون احتساب تکرارها) به دست میآید. این داده به توسعهدهندگان اجازه میدهد بفهمند مدل برای رسیدن به یک پاسخ درست، چقدر «پرگویی» (Verbosity) یا تولید توکن اضافی نیاز دارد. این رویکرد دقیق در تحلیل دادهها، مشابه بهکارگیری تحلیلهای معنایی در مقابل دادههای فنی است که برای پیشبینیهای دقیقتر در بازارهای مالی استفاده میشود.
زیرساخت و کارایی RAG
در جریانهای کاری تولید بازیابیافزا (RAG)، این شاخص بر رابطه بین پنجرهٔ زمینه (Context Window) — یعنی حداکثر تعداد توکنهای ترکیبی ورودی و خروجی — و توانایی مدل در استدلال روی مجموعهدادههای بزرگ تأکید میکند.
همچنین قیمتگذاری برای پرامپتهای ذخیرهشده (Cache Hits) به ازای هر میلیون توکن ردیابی میشود. این قابلیت معمولاً تخفیف قابلتوجهی نسبت به قیمت ورودی عادی دارد، هرچند هزینه نوشتن در حافظه و ذخیرهسازی توسط ارائهدهندگان بهطور جداگانه محاسبه میشود.
این تغییر در بنچمارکها، فرضهای بنیادین این حوزه را دگرگون میکند و با هوش بهمثابه کالایی با برچسب قیمتی قابلاندازهگیری مینگرد. با جریمه کردن توهمات در شاخص AA-Omniscience و پاداش دادن به موفقیتهای عاملمحور در AA-Briefcase، صنعت از ارزیابیهای حسی (Vibes-based) به سمت مدلهای سختگیرانه «هزینه بهازای واحد هوش» حرکت میکند.
توسعهدهندگان اکنون باید انتخاب مدل خود را بر اساس شاخص قابلیتهای خاص — مانند استدلال پزشکی در متون طولانی — انجام دهند، نه بر اساس یک امتیاز کلی. باید دید این معیارهای جدید چگونه استراتژیهای قیمتگذاری ارائهدهندگان بزرگ را تحت تأثیر قرار میدهد، زیرا آنها اکنون بهجای هزینه توکن، بر سر «کارایی هوش» با یکدیگر رقابت میکنند.
گام بعدی شما
- بهجای تکیه بر امتیاز کلی مدلها، بر اساس نیاز خود (مثلاً استدلال پزشکی در متون طولانی) مدل را انتخاب کنید.
- نرخ توکنهای خروجی را برای بهینهسازی هزینههای استنتاج در اپلیکیشن خود بررسی کنید.
- استراتژیهای قیمتگذاری ارائهدهندگان را از منظر «کارایی هوش» دنبال کنید، نه فقط هزینه توکن.
اما تأثیر این تغییرات بر رقابت مدلهای بازمتن و بسته حتی پیچیدهتر است — به تحلیل ما دربارهی اقتصاد مدلهای Llama مراجعه کنید.




گفتگو