اگر امروز برای استقرار مدلهای استدلالی بودجهبندی میکنید، باید بدانید که سرعت تولید توکن دیگر تنها معیار موفقیت نیست. طبق گزارش فنی Artificial Analysis که در ۲۳ سپتامبر ۲۰۲۶ منتشر شد، مدل Mercury 2.5 اکنون تحت یک کالبدشکافی دقیق قرار گرفته تا مشخص شود آیا هوش بالای آن با هزینههای عملیاتی توجیهپذیر است یا خیر. این ارزیابی فراتر از بنچمارکهای سادهی چت میرود تا اندازهگیری کند که مدل چگونه وظایف پیچیده، عاملمحور و واقعی را مدیریت میکند.
این تحلیل در حالی رخ میدهد که صنعت هوش مصنوعی از اندازهگیری توانمندیهای کلی به سمت سنجش «هوش به ازای هر دلار» حرکت کرده است. همانطور که در تحلیل قبلی ما دربارهی پیشتازی مدل MiMo-V2.6-Pro در حوزه هوش مدلهای وزنباز اشاره کردیم، اکنون نقطه تمرکز بر روی هزینههای عملیاتی برای حفظ آن سطح از هوش در محیطهای تولید (Production) است.
شاخص هوش v4.3.2
به نقل از مستندات این گزارش، مدل مذکور با استفاده از شاخص هوش v4.3.2 مورد آزمایش قرار گرفت که ترکیبی از ۱۰ ارزیابی مجزا است. این رویکرد در واقع تکامل یافتهی شاخص Intelligence Index v4.3 است که معیار سنجش هوش را به سمت کاربردهای عاملمحور سوق داد تا دقت ارزیابیها در محیطهای عملیاتی افزایش یابد. این معیارها عبارتاند از:
- AA-Briefcase v1.1: سنجش کارهای دانشی عاملمحور (Agentic) از طریق یک معیار ترکیبی شامل نرخ پذیرش دستورالعملها (Rubric Pass Rate)، کیفیت تحلیلی و امتیاز Elo در ارائه. در این بخش، عملکرد دستورالعملها از طریق مسابقات شبیهسازی شدهی رودررو به امتیاز Elo تبدیل میشود و کرانهای آن در عدد ۰ محدود شده است.
- AA-Omniscience: شاخصی برای سنجش قابلیت اطمینان (از ۱۰۰- تا ۱۰۰+) که پاسخهای درست را پاداش داده و به توهم (Hallucination) جریمه میدهد. امتیاز ۰ نشاندهنده تعداد برابر پاسخهای درست و غلط است، در حالی که امتیازات منفی به معنای غلبه پاسخهای نادرست است. نکته مهم این است که برای امتناع از پاسخ دادن، جریمهای در نظر گرفته نشده است.
- محکهای تخصصی: شامل SciCode، Humanity's Last Exam و Terminal-Bench 4.0 برای ارزیابی دقیق تواناییهای کدنویسی و تعامل با ترمینال.
- سایر ارزیابیها: این شاخص همچنین شامل GDPval-AA v2.1، AutomationBench-AA، GDP.pdf، CritPt و AA-LCR v1.1 است تا پوششی جامعتر فراهم کند.
تمرکز بر قابلیتها و صنایع
این ارزیابیها بهگونهای طراحی شدهاند که عملکرد مدل را در قابلیتهای خاص و صنایع مختلف تفکیک کنند. بر اساس این گزارش، تفاوت میان «کارهای دانشی عاملمحور» و «وظایف دنیای واقعی» بهصورت دقیق اندازهگیری شده است و هر دو با فرمول (Elo-500)/2000 محاسبه میشوند.
حوزههای حیاتی دیگر شامل استدلال روی اسناد حرفهای (All-pass) و استدلال در متون پزشکی با پنجره زمینه (Context Window) بلند است. تحلیلگران Artificial Analysis اشاره میکنند که اگرچه هوش کلی معمولاً در کاربردهای مختلف منتقل میشود، اما بسته به هدف نهایی اپلیکیشن، برخی از این ارزیابیهای تخصصی ارتباط و اولویت بیشتری دارند.
معیارهای تأخیر و پاسخدهی
گزارش مذکور، پاسخدهی مدل را از طریق چندین نشانگر تأخیر (Latency) تحلیل میکند. «زمان پاسخ کلی» (End-to-End Response Time) بهطور مشخص ثانیههای مورد نیاز برای تولید ۵۰۰ توکن را محاسبه میکند که یک معیار ترکیبی شامل موارد زیر است:
- زمان ورودی (Input Time): فاصله زمانی تا دریافت نخستین توکن پاسخ.
- زمان تفکر (Thinking Time): در مدلهای استدلالی (Reasoning Models)، زمانی است که مدل صرف تولید توکنهای داخلی برای استدلال پیش از ارائه پاسخ نهایی میکند. این مقدار بر اساس میانگین توکنهای استدلال در ۶۰ پرامپت متنوع محاسبه شده است.
- زمان پاسخ (Answer Time): مدتزمان تولید ۵۰۰ توکن خروجی که بر اساس سرعت تولید توکنها محاسبه میشود.
سرعت خروجی بر حسب توکن در ثانیه اندازهگیری میشود که مستقیماً بر «زمان هر وظیفه در شاخص هوش» اثر میگذارد. این میانگین وزنی زمان رمزگشایی (Decode Time)، هزینههای سربار و TTFT را حذف میکند تا نگاهی خالص به کارایی تولید داشته باشیم. تأخیر همچنین توسط «زمان تا اولین توکن» (TTFT) اندازهگیری میشود که زمان تفکر مدلهای استدلالی را نیز در بر میگیرد.
اقتصاد توکن و هزینهها
پلتفرم Artificial Analysis معیار جدیدی به نام «هزینه به ازای هر وظیفه در شاخص هوش» را معرفی کرده است. این عدد از طریق وزندهی به قیمتهای ورودی، برخورد با حافظه (Cache Hit)، ثبت حافظه (Cache Write)، توکنهای استدلال و توکنهای پاسخ در برابر تعداد کل وظایف محاسبه میشود.
عوامل اقتصادی کلیدی تحلیلشده عبارتاند از:
- قیمتگذاری Cache Hit: هزینه پرامپتهایی که قبلاً پردازش شدهاند و بر حسب دلار به ازای هر میلیون توکن نمایش داده میشود. این مورد معمولاً تخفیف قابلتوجهی نسبت به ورودی عادی دارد، هرچند هزینه ثبت و ذخیرهسازی حافظه موقت بهطور جداگانه صورت میگیرد.
- پنجره زمینه (Context Window): حداکثر محدودیت ترکیبی توکنهای ورودی و خروجی. این مورد برای جریانهای کاری تولید بازیابیافزا (RAG) که شامل بازیابی اطلاعات در مقیاس بزرگ است، حیاتی است. لازم به ذکر است که توکنهای خروجی معمولاً محدودیت بسیار کمتری دارند.
- میانگین هزینه وزنی: ارزشی به دلار برای هر وظیفه که به توسعهدهندگان اجازه میدهد بار مالی مدلهای مختلف را در یک سطح هوشی یکسان مقایسه کنند. در این راستا، رقابت شدیدی میان مدلها شکل گرفته است؛ برای مثال مدل Grok 4.7 با کاهش قیمت استنتاج تلاش کرد تا جذابتر شود، اما در کدنویسی عاملمحور با چالشهای جدی روبرو شد.
- استفاده از توکن: میانگین وزنی تعداد توکنهای خروجی مصرف شده در هر وظیفه، که از ضرب توکنهای خروجی هر ارزیابی در وزن نسبی هر بنچمارک به دست میآید.
موازنههای فنی
دادهها نشان میدهند که همبستگی شدیدی میان عمق استدلال مدل و تأخیر آن وجود دارد. در وظایف سنگین استدلالی، «زمان تفکر» به گلوگاه اصلی تبدیل میشود و اغلب تأثیر آن از سرعت واقعی تولید توکنها بیشتر است.
علاوه بر این، تفاوت میان وزنهای «محدود به استفاده تجاری» (Commercial Use Restricted) و «غیرتجاری» (Non-commercial) همچنان عاملی تعیینکننده برای پذیرش سازمانی است. مدلها در صورتی «محدود به استفاده تجاری» برچسب میخورند که شرایط خاصی استفاده از آنها را محدود کند، و «غیرتجاری» هستند اگر مجوز آنها بهطور کلی استفاده تجاری را ممنوع کند. امتیازات هوش زمانی بیمعنی میشوند که مجوز مدل، استقرار آن در محیط تولید را ممنوع کند.
این تغییر در نحوه بنچمارک کردن، فرضیات میدان را تغییر میدهد؛ اکنون هوش مصنوعی نه به عنوان یک پایگاه دانش ایستا، بلکه به عنوان یک ابزار کاربردی با «هزینه کالای فروخته شده» (COGS) قابل اندازهگیری به ازای هر واحد هوش دیده میشود.
توسعهدهندگان دیگر نمیتوانند تنها روی دقت تمرکز کنند؛ برای رقابت در محیط تولید، باید نقطه تلاقی امتیاز Elo، توکن در ثانیه و کارایی حافظه موقت (Cache-hit efficiency) را بهینه کنند.
برای مشاهده نحوه مقایسه Mercury 2.5 با سایر مدلهای پیشرو بهصورت بلادرنگ، میتوانید متدولوژی کامل Intelligence Index و جدولهای ردهبندی زنده Artificial Analysis را بررسی کنید.
گام بعدی شما
- بررسی متدولوژی کامل Intelligence Index برای درک نحوه وزندهی به وظایف عاملمحور.
- تحلیل هزینه استنتاج مدلهای فعلی خود در برابر معیار «هوش به ازای هر دلار».
- ارزیابی تأثیر زمان تفکر (Thinking Time) بر تجربه کاربری در اپلیکیشنهای بلادرنگ.
اما تأثیر این مدل بر اکوسیستم مدلهای بازمتن حتی پیچیدهتر است — به تحلیل ما دربارهی استراتژیهای کاهش هزینه استنتاج مراجعه کنید.




گفتگو