پرش به محتوای اصلی
پرش به محتوای مقاله

شاخص Intelligence Index v4.3 معیار سنجش هوش را به سمت کاربرد عامل‌محور برد

·۲۸ شهریور ۱۴۰۵۴ دقیقه مطالعه
پیش‌نمایش مرحله ۵ - تحلیل هوش، عملکرد و قیمت | تحلیل مصنوعی
پیش‌نمایش مرحله ۵ - تحلیل هوش، عملکرد و قیمت | تحلیل مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متدولوژی «هزینه به‌ازای واحد هوش» و جریمهٔ عددی توهمات در شاخص AA-Omniscience؛ تغییری از ارزیابی‌های کیفی به مدل‌های اقتصادی-سنجشی.

اگر امروز مدل‌های زبانی را بر اساس تعداد پارامترها یا نمرات کلی می‌سنجید، باید بدانید که معیار بازی تغییر کرده است. در ۱۹ سپتامبر ۲۰۲۶، پلتفرم Artificial Analysis شاخص Intelligence Index v4.3 را منتشر کرد. این چارچوب طراحی شده است تا فراتر از پرسش‌وپاسخ‌های ایستا حرکت کرده و عملکرد مدل‌ها را در محیط‌های حرفه‌ای و واقعی بسنجد.

این به‌روزرسانی در حالی رخ می‌دهد که صنعت هوش مصنوعی برای تعریف دقیق «هوش» در مقابل «حجم پارامترها» در تکاپو است. همان‌طور که در تحلیل قبلی ما درباره‌ی دستاوردهای شاخص GPT-6 Astra اشاره کردیم، اکنون هدف این است که هزینه یک تسک استدلالی موفق به‌جای هزینه هر توکن استاندارد شود.

متدولوژی و بستر ارزیابی

طبق اعلام Artificial Analysis، نسخه ۴.۳ برای سنجش عملکرد در قابلیت‌ها و صنایع خاص طراحی شده است. در حالی که هوش عمومی معمولاً در کاربردهای مختلف قابل انتقال است، این پلتفرم اشاره می‌کند که ارزیابی‌های تخصصی برای برخی کاربردهای حرفه‌ای مرتبط‌تر هستند.

این چارچوب مدل‌ها را بر اساس نوع وزن‌ها به دو دسته وزن‌های باز (Open Weights) و اختصاصی (Proprietary) تقسیم می‌کند. همچنین برای شفافیت بیشتر، مدل‌هایی که مجوز استفاده تجاری ندارند با برچسب «غیرتجاری» (Non-commercial) مشخص شده‌اند. همچنین مدل‌هایی که شرایط خاصی برای استفاده تجاری دارند، با برچسب «محدود به استفاده تجاری» (Commercial Use Restricted) علامت‌گذاری شده‌اند.

مجموعه ارزیابی‌های نسخه ۴.۳

به نقل از مستندات این پلتفرم، ۱۰ ارزیابی مجزا برای محاسبه امتیاز نهایی هوش به کار گرفته شده است که عبارت‌اند از:

  • AA-Briefcase: محک کارهای دانشی عامل‌محور (Agentic). این بنچمارک از AA-Briefcase Elo استفاده می‌کند که یک معیار ترکیبی از نرخ پذیرش دستورالعمل (Rubric pass rate)، کیفیت تحلیلی (Analytical quality Elo) و کیفیت ارائه (Presentation Elo) است. عملکرد در دستورالعمل‌ها از طریق مسابقات شبیه‌سازی شده‌ی رودررو به Elo تبدیل می‌شود و کران‌های آن در عدد ۰ محدود شده است.
  • AA-Omniscience: شاخص قابلیت اطمینان که میزان توهم (Hallucination) و دقت دانش را می‌سنجد. این شاخص پاسخ‌های درست را پاداش داده و توهمات را جریمه می‌کند، اما برای امتناع از پاسخ دادن جریمه‌ای در نظر نمی‌گیرد. امتیازات بین ۱۰۰- تا ۱۰۰ متغیر است و عدد ۰ نشان‌دهنده تعداد برابر پاسخ‌های درست و غلط است.
  • Terminal-Bench 4.0 و AutomationBench-AA: این دو ارزیابی به‌طور خاص بر کدنویسی عامل‌محور و توانایی استفاده از ترمینال متمرکز هستند.
  • SciCode و Humanity's Last Exam: برای تست استدلال‌های سطح بالای علمی و استدلال‌های عمومی پیچیده.
  • GDPval-AA v2، GDP.pdf، CritPt و AA-LCR v1.1: ارزیابی‌های تخصصی استدلال در متون طولانی، از جمله استدلال‌های پزشکی در متون طولانی و استدلال روی اسناد حرفه‌ای (All-pass).

معیارهای هزینه و عملکرد

این پلتفرم اکنون فراتر از نمرات خام، «میانگین هزینه وزنی هر تسک در شاخص هوش» را ردیابی می‌کند. این معیار مجموع دلارهای هزینه شده برای ورودی، ضربه‌های حافظه (Cache Hits)، نوشتن در حافظه (Cache Writes) و توکن‌های استدلالی را محاسبه کرده و بر تعداد تسک‌ها تقسیم می‌کند، در حالی که هر ارزیابی بر اساس وزن خود در شاخص هوش اثر می‌گذارد.

علاوه بر این، معیاری برای تعداد توکن‌های خروجی در هر تسک معرفی شده است. این عدد از ضرب توکن‌های خروجی هر ارزیابی در وزن نسبی آن بنچمارک در شاخص و سپس تقسیم بر تعداد تسک‌ها (بدون احتساب تکرارها) به دست می‌آید. این داده به توسعه‌دهندگان اجازه می‌دهد بفهمند مدل برای رسیدن به یک پاسخ درست، چقدر «پرگویی» (Verbosity) یا تولید توکن اضافی نیاز دارد. این رویکرد دقیق در تحلیل داده‌ها، مشابه به‌کارگیری تحلیل‌های معنایی در مقابل داده‌های فنی است که برای پیش‌بینی‌های دقیق‌تر در بازارهای مالی استفاده می‌شود.

زیرساخت و کارایی RAG

در جریان‌های کاری تولید بازیابی‌افزا (RAG)، این شاخص بر رابطه بین پنجرهٔ زمینه (Context Window) — یعنی حداکثر تعداد توکن‌های ترکیبی ورودی و خروجی — و توانایی مدل در استدلال روی مجموعه‌داده‌های بزرگ تأکید می‌کند.

همچنین قیمت‌گذاری برای پرامپت‌های ذخیره‌شده (Cache Hits) به ازای هر میلیون توکن ردیابی می‌شود. این قابلیت معمولاً تخفیف قابل‌توجهی نسبت به قیمت ورودی عادی دارد، هرچند هزینه نوشتن در حافظه و ذخیره‌سازی توسط ارائه‌دهندگان به‌طور جداگانه محاسبه می‌شود.

این تغییر در بنچمارک‌ها، فرض‌های بنیادین این حوزه را دگرگون می‌کند و با هوش به‌مثابه کالایی با برچسب قیمتی قابل‌اندازه‌گیری می‌نگرد. با جریمه کردن توهمات در شاخص AA-Omniscience و پاداش دادن به موفقیت‌های عامل‌محور در AA-Briefcase، صنعت از ارزیابی‌های حسی (Vibes-based) به سمت مدل‌های سخت‌گیرانه «هزینه به‌ازای واحد هوش» حرکت می‌کند.

توسعه‌دهندگان اکنون باید انتخاب مدل خود را بر اساس شاخص قابلیت‌های خاص — مانند استدلال پزشکی در متون طولانی — انجام دهند، نه بر اساس یک امتیاز کلی. باید دید این معیارهای جدید چگونه استراتژی‌های قیمت‌گذاری ارائه‌دهندگان بزرگ را تحت تأثیر قرار می‌دهد، زیرا آن‌ها اکنون به‌جای هزینه توکن، بر سر «کارایی هوش» با یکدیگر رقابت می‌کنند.

گام بعدی شما

  • به‌جای تکیه بر امتیاز کلی مدل‌ها، بر اساس نیاز خود (مثلاً استدلال پزشکی در متون طولانی) مدل را انتخاب کنید.
  • نرخ توکن‌های خروجی را برای بهینه‌سازی هزینه‌های استنتاج در اپلیکیشن خود بررسی کنید.
  • استراتژی‌های قیمت‌گذاری ارائه‌دهندگان را از منظر «کارایی هوش» دنبال کنید، نه فقط هزینه توکن.

اما تأثیر این تغییرات بر رقابت مدل‌های بازمتن و بسته حتی پیچیده‌تر است — به تحلیل ما درباره‌ی اقتصاد مدل‌های Llama مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر متدولوژی با تکیه بر اعتبار داده‌های عملیاتی Artificial Analysis، استانداردهای ارزیابی را از پاسخ‌های ایستا به سمت کاربردهای عامل‌محور می‌برد. این امر باعث می‌شود توسعه‌دهندگان بتوانند بازگشت سرمایه (ROI) هر تسک استدلالی را به‌طور دقیق محاسبه کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه API مواجه‌اند، این شاخص ابزاری حیاتی برای انتخاب مدل‌هایی با کمترین توکن خروجی و بیشترین دقت است تا هزینه‌های استنتاج کاهش یابد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «حس کلی» با «هزینه هر واحد هوش»، مدل‌های زبانی را از ابزارهای چت به قطعات صنعتی تبدیل می‌کند. این رویکرد باعث می‌شود مدل‌هایی که پاسخ‌های کوتاه‌تر و دقیق‌تری می‌دهند، حتی اگر در بنچمارک‌های عمومی ضعیف‌تر باشند، در محیط‌های تولیدی برنده شوند. در واقع، بهره‌وری در استدلال جایگزین حجم دانش خام می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.