هزینهٔ واقعی هوش وقتی با زمان و مبلغ تکمیل تسکهای پیچیدهٔ عاملمحور سنجیده شود، چقدر است؟ مدل MiMo-V2.6-Pro با تصاحب جایگاه نخست در دستهبندی وزنهای باز (Open Weights) در شاخص هوش Artificial Analysis، مرزهای کارایی را برای مدلهای غیرانحصاری جابهجا کرد. این بنچمارک برخلاف آزمونهای سنتی، از ارزیابی دانش خام فاصله گرفته و روی منابع واقعی مورد نیاز برای دستیابی به عملکرد سطح بالا تمرکز میکند.
این ارزیابی در حالی صورت میگیرد که کل صنعت در حال گذار از آزمونهای چندگزینهای ساده به سمت ارزیابیهای عاملمحور (Agentic) است. همانطور که در پوشش پیشین ما از بنچمارکهای Grok 4.7 دیدیم، تمرکز اکنون بر نحوه مدیریت جریانهای کاری حرفهای در دنیای واقعی است؛ مواردی مثل تعامل با ترمینال یا استدلالهای پزشکی در بسترهای متنی طولانی. برای یک توسعهدهنده متوسط، این به معنای آن است که شکاف میان APIهای گرانقیمت مدلهای بسته و مدلهای وزنباز که بهصورت محلی میزبانی میشوند، از نظر هزینههای عملیاتی و قابل محاسبه در فاکتورهای مالی، در حال بسته شدن است.
چارچوب ارزیابی هوش
بر اساس گزارش منتشر شده در ۲۲ سپتامبر ۲۰۲۶، نسخه ۴.۳.۲ شاخص هوش Artificial Analysis از ۱۰ ارزیابی مجزا برای تعیین جایگاه مدلها استفاده میکند. این ارزیابیها عبارتاند از:
- AA-Briefcase v1.1: سنجش کارهای دانشی عاملمحور از طریق یک معیار ترکیبی شامل نرخ پذیرش دستورالعمل (Rubric Pass Rate)، امتیاز Elo کیفیت تحلیلی و امتیاز Elo ارائه. در این مدل، عملکرد دستورالعملها از طریق مسابقات شبیهسازی شدهٔ رودررو (Head-to-Head) به امتیاز Elo تبدیل میشود.
- AA-Omniscience: یک شاخص قابلیت اطمینان که پاسخهای درست را پاداش داده و توهم (Hallucination) را در مقیاسی از ۱۰۰- تا ۱۰۰ جریمه میکند. امتیاز صفر به معنای برابری تعداد پاسخهای درست و غلط است، در حالی که امتیازات منفی نشاندهنده غلبه پاسخهای نادرست بر درست است. شایان ذکر است که برای امتناع از پاسخ دادن، جریمهای در نظر گرفته نشده است.
- Terminal-Bench 4.0: ارزیابی کدنویسی عاملمحور و تعامل مستقیم با محیط ترمینال.
- SciCode و Humanity's Last Exam: آزمونهای طراحی شده برای سنجش هوش عمومی و علمی در سطوح پیشرفته.
- GDPval-AA v2.1 و GDP.pdf: تمرکز بر استدلال در اسناد حرفهای و تحلیل فایلهای PDF.
- AutomationBench-AA: تست تسکهای کاری دنیای واقعی بهصورت عاملمحور برای سنجش میزان اتوماسیون.
- CritPt: یک ارزیابی تخصصی هوش که بهطور مستقل توسط تیم Artificial Analysis اندازهگیری میشود.
- AA-LCR v1.1: تمرکز ویژه بر استدلالهای پزشکی در پنجرهٔ زمینه (Context Window) طولانی.
تحلیل قابلیتهای تفکیکشده
برای ارائه دیدی دقیق و دانهبندی شده از عملکرد، این شاخص هوش عمومی را از قابلیتهای صنعتی خاص جدا میکند. این تفکیک به کاربران اجازه میدهد تشخیص دهند که آیا یک مدل برای یک حوزه یا صنعت خاص (Vertical) مناسب است یا خیر:
- کارهای دانشی عاملمحور: این بخش از طریق مقیاس (Elo-500)/2000 اندازهگیری میشود.
- تسکهای کاری دنیای واقعی: برای ردیابی کارایی عاملمحور، این بخش نیز با همان مقیاس (Elo-500)/2000 سنجیده میشود.
- استدلال حرفهای: این قابلیت از طریق تستهای استدلال اسنادی و متون پزشکی ارزیابی میگردد.
تحلیل هزینه و عملکرد
در این تحلیل، عملکرد MiMo-V2.6-Pro از چندین زاویه حیاتی بررسی شده است. معیار «هزینه هر تسک شاخص هوش» یک میانگین وزنی است که توکنهای ورودی، Cache Hitها، Cache Writeها و توکنهای استدلالی را در نظر میگیرد. این رویکرد، دیدی صادقانهتر از هزینههای عملیاتی نسبت به قیمتگذاری سادهٔ هر توکن ارائه میدهد.
محاسبه هزینه به این صورت است که قیمتهای مربوط به ورودی، Cache Hit، Cache Write، توکنهای استدلالی و توکنهای پاسخ دریافت شده، بر تعداد تسکها تقسیم شده و سپس بر اساس وزن هر بخش در شاخص هوش، وزندهی میشوند. همچنین، «هزینه اجرای شاخص هوش Artificial Analysis» نشاندهنده کل مبلغ دلاری مورد نیاز برای اجرای تمامی ارزیابیهای موجود در این شاخص (بدون تکرار) است.
سرعت مدل با تعداد توکنهای خروجی در ثانیه سنجیده میشود که مستقیماً بر «زمان پاسخدهی سرتاسری» اثر میگذارد. در مدلهای استدلالی (Reasoning Models)، این زمان شامل «زمان تفکر» است؛ یعنی دورهای که مدل پیش از ارائه پاسخ نهایی، توکنهای داخلی تولید میکند. این شاخص برای استانداردسازی مقایسه میان معماریهای مختلف، بهطور خاص زمان تولید ۵۰۰ توکن را ردیابی میکند.
تأخیر و زمانبندی پاسخ
تأخیر بهصورت «زمان تا نخستین توکن پاسخ» (Time To First Answer Token) بر حسب ثانیه اندازهگیری میشود. این عدد شامل زمان تفکر مدلهای استدلالی پیش از دریافت اولین توکن است. برای مدلهایی که قابلیت استریم (Streaming) ندارند، این مقدار برابر با کل زمان دریافت پاسخ نهایی است.
زمان پاسخدهی سرتاسری برای ۵۰۰ توکن از سه جزء تشکیل شده است:
۱. زمان ورودی: زمان لازم تا دریافت اولین توکن پاسخ.
۲. زمان تفکر: زمانی که مدلهای استدلالی برای تولید توکنهای استدلالی صرف میکنند (بر اساس میانگین ۶۰ پرامپت متنوع).
۳. زمان پاسخ: زمان لازم برای تولید ۵۰۰ توکن خروجی بر اساس سرعت خروجی مدل.
معماری فنی و بهینگی
مدل MiMo-V2.6-Pro بهعنوان یک مدل وزنباز، از نظر شاخص باز بودن (در مقیاس ۰ تا ۱۰۰) و کارایی پارامترها ارزیابی شده است. گزارش مذکور تفاوت میان پارامترهای کل و پارامترهای فعال را برجسته میکند؛ تفکیکی که در مدلهای ترکیب خبرهها (Mixture of Experts) حیاتی است، زیرا در هر توکن تنها بخشی از شبکه اجرا میشود. در مقابل، در مدلهای متراکم (Dense)، پارامترهای فعال با پارامترهای کل برابر هستند.
اندازه پنجرهٔ زمینه نیز بهعنوان محرک اصلی جریانهای کاری تولید بازیابیافزا (RAG) معرفی شده است. پنجرههای بزرگتر اجازه میدهند مدل روی مجموعهدادههای عظیم بدون از دست دادن انسجام استدلال کند، قابلیتی که در بنچمارک پزشکی AA-LCR v1.1 تست شده است. این شاخص اشاره میکند که اگرچه توکنهای ورودی و خروجی یک محدودیت ترکیبی مشترک دارند، اما توکنهای خروجی معمولاً محدودیت بهمراتب کمتری دارند.
قیمتگذاری و مصرف توکن
این شاخص «تعداد توکنهای خروجی بهازای هر تسک شاخص هوش» را ردیابی میکند که یک میانگین وزنی از توکنهای مصرف شده در هر تسک است. این مقدار از طریق ضرب توکنهای خروجی هر ارزیابی در وزن نسبی آن بنچمارک و سپس تقسیم بر تعداد کل تسکها محاسبه میشود.
قیمتگذاری حافظه (Cache) نیز یک عامل کلیدی است. قیمت Cache Hit نشاندهنده هزینه برای پرامپتهایی است که قبلاً پردازش شدهاند و معمولاً تخفیف قابلتوجهی نسبت به قیمتهای ورودی عادی ارائه میدهد. هزینههای Cache Write و ذخیرهسازی بهصورت جداگانه محاسبه شده و بسته به ارائهدهنده متفاوت است.
تحلیل تحریریه
برای جامعه فنی، ظهور MiMo-V2.6-Pro نشان میدهد که معیار «هوش بهازای هر دلار» در حال تبدیل شدن به میدان نبرد اصلی است. ما شاهد گذاری هستیم که در آن هدف دیگر صرفاً شکست دادن یک بنچمارک نیست، بلکه دستیابی به آن در حالی است که «زمان هر تسک شاخص هوش» به حداقل برسد.
این تغییر به نفع مدلهایی است که میتوانند قابلیت اطمینان بالایی (طبق شاخص AA-Omniscience) را بدون نیاز به محاسبات عظیم در زمان تست (Test-time Compute) حفظ کنند. اگر مدلهای وزنباز بتوانند بهطور مداوم با عملکرد مدلهای انحصاری در کدنویسی عاملمحور و استدلال حرفهای برابری کنند، انگیزه برای محبوس شدن در اکوسیستم یک ارائهدهنده واحد بهشدت کاهش مییابد.
جمعبندی نهایی
دادهها نشان میدهند که کارایی مدلهای وزنباز اکنون برای کارهای عاملمحور در سطح سازمانی (Enterprise-grade) کافی است. توانایی ایجاد توازن میان امتیاز بالای شاخص هوش با تأخیر و هزینه پایین، MiMo-V2.6-Pro را به جایگزینی عملی برای استقرار مدلهای هوش مصنوعی در مقیاس تولید تبدیل میکند.
برای مشاهده نحوه مقایسه این مدل با جدیدترین نسخههای انحصاری، باید بهروزرسانیهای آتی رتبهبندیهای Elo در AA-Briefcase را رصد کنید تا مشخص شود آیا این برتری در تسکهای عاملمحور متنوعتر نیز حفظ میشود یا خیر.
گام بعدی شما
- اگر در حال استقرار مدلهای محلی هستید، توازن MiMo بین هزینه و هوش را با مدلهای بسته مقایسه کنید.
- برای تسکهای پزشکی یا اسنادی، بنچمارک AA-LCR را برای سنجش دقت در پنجرههای متنی طولانی بررسی کنید.
- رتبهبندیهای Elo در AA-Briefcase را دنبال کنید تا ببینید آیا این برتری در تسکهای متنوعتر حفظ میشود یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو