اگر امروز بر اساس بنچمارکهای قدیمی مدل خود را انتخاب میکنید، احتمالاً پتانسیل واقعی مدلهای جدید را نادیده گرفتهاید. یک جهش ۴ امتیازی در آخرین شاخص هوش، حالا فاصله بین GPT-6 Astra و نسل قبلی آن یعنی Sol را به وضوح نشان میدهد.
طبق گزارش Artificial Analysis، این تغییرات در ۵ سپتامبر ۲۰۲۶ در نسخه ۴.۲ بنچمارکها اعمال شد تا تردیدهای موجود درباره پیشرفت واقعی Astra برطرف شود. این بهروزرسانی در حالی رخ میدهد که بحثهای داغی درباره رسیدن OpenAI به عصر AGI در جریان است؛ بهویژه پس از آنکه مدل GPT-6 Astra نمره خیرهکننده ۹۹.۹٪ را در محک ARC-AGI-3 ثبت کرد و گام بزرگی به سوی هوش مصنوعی عمومی برداشت. همانطور که در تحلیل قبلی ما درباره راهنمای پرامپتهای Astra برای رفع لکنت عاملها اشاره کردیم، صنعت اکنون منتظر است ببیند آیا این امتیازات به قابلیت اطمینان در دنیای واقعی تبدیل میشوند یا خیر.
به نقل از این گزارش، رتبهبندی جدید مدلها به شرح زیر است:
- رتبه اول: Claude Fable 5.1
- رتبه دوم: GPT-6 Astra
- رتبه سوم: Meta
این بازنگری شامل تغییرات ساختاری مهمی است. ابتدا، محکهای جدیدی مثل AA-Briefcase برای کارهای اداری و GDP.pdf برای تحلیل اسناد اضافه شدند. در مقابل، آزمون GPQA-Diamond حذف شد چون مدلهای پیشرو عملاً آن را حل کردهاند. همچنین برای جلوگیری از تقلب مدلها، دادههای آزمون خصوصی اکنون ۴۰٪ وزن کل امتیاز را تشکیل میدهند.

مدل Astra همچنین در بهرهوری خیرهکننده است و برای هر وظیفه، کمتر از هر مدل پیشرو دیگری از توکن (Token) — مثل برشهای کوچک یک کیک که مدل تکهتکه میخورد — استفاده میکند. از نظر نسبت هزینه به عملکرد, OpenAI در کنار Anthropic, Meta و Zhipu AI در صدر جدول قرار دارد.
این اصلاحات نشان میدهد که محکهای ایستا نمیتوانند با سرعت انتشار مدلها پیش بروند. وقتی صدر جدول اینقدر سریع تغییر میکند، خطر تکیه بر معیارهای قدیمی که جهشهای واقعی هوش را پنهان میکنند، افزایش مییابد.
گام بعدی شما
- اگر از Astra استفاده میکنید، عملکرد آن را در تحلیل اسناد پیچیده (GDP.pdf) تست کنید.
- برای کاهش هزینهها، میزان توکنهای مصرفی Astra را با مدلهای رقیب مقایسه کنید.
- منتظر انتشار نسخه ۵ شاخص باشید که تستهای خصوصی سختگیرانهتری دارد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو