پرش به محتوای اصلی
پرش به محتوای مقاله

«توازن هوش و سرعت»؛ معیار برتری MiMo-V2.6-Pro در تحلیل جدید

·۳۱ شهریور ۱۴۰۵۶ دقیقه مطالعه
تحلیل MiMo-V2.6-Pro: هوش، عملکرد و قیمت | Artificial Analysis
تحلیل MiMo-V2.6-Pro: هوش، عملکرد و قیمت | Artificial Analysis
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر معیار ارزیابی از دانش خام به «هزینه و زمان به‌ازای هر تسک هوشمند». MiMo-V2.6-Pro نخستین مدل وزن‌باز است که در این توازنِ سخت‌گیرانه، جایگاه نخست را به دست آورده است.

هزینهٔ واقعی هوش وقتی با زمان و مبلغ تکمیل تسک‌های پیچیدهٔ عامل‌محور سنجیده شود، چقدر است؟ مدل MiMo-V2.6-Pro با تصاحب جایگاه نخست در دسته‌بندی وزن‌های باز (Open Weights) در شاخص هوش Artificial Analysis، مرزهای کارایی را برای مدل‌های غیرانحصاری جابه‌جا کرد. این بنچمارک برخلاف آزمون‌های سنتی، از ارزیابی دانش خام فاصله گرفته و روی منابع واقعی مورد نیاز برای دستیابی به عملکرد سطح بالا تمرکز می‌کند.

این ارزیابی در حالی صورت می‌گیرد که کل صنعت در حال گذار از آزمون‌های چندگزینه‌ای ساده به سمت ارزیابی‌های عامل‌محور (Agentic) است. همان‌طور که در پوشش پیشین ما از بنچمارک‌های Grok 4.7 دیدیم، تمرکز اکنون بر نحوه مدیریت جریان‌های کاری حرفه‌ای در دنیای واقعی است؛ مواردی مثل تعامل با ترمینال یا استدلال‌های پزشکی در بسترهای متنی طولانی. برای یک توسعه‌دهنده متوسط، این به معنای آن است که شکاف میان APIهای گران‌قیمت مدل‌های بسته و مدل‌های وزن‌باز که به‌صورت محلی میزبانی می‌شوند، از نظر هزینه‌های عملیاتی و قابل محاسبه در فاکتورهای مالی، در حال بسته شدن است.

چارچوب ارزیابی هوش

بر اساس گزارش منتشر شده در ۲۲ سپتامبر ۲۰۲۶، نسخه ۴.۳.۲ شاخص هوش Artificial Analysis از ۱۰ ارزیابی مجزا برای تعیین جایگاه مدل‌ها استفاده می‌کند. این ارزیابی‌ها عبارت‌اند از:

  • AA-Briefcase v1.1: سنجش کارهای دانشی عامل‌محور از طریق یک معیار ترکیبی شامل نرخ پذیرش دستورالعمل (Rubric Pass Rate)، امتیاز Elo کیفیت تحلیلی و امتیاز Elo ارائه. در این مدل، عملکرد دستورالعمل‌ها از طریق مسابقات شبیه‌سازی شدهٔ رودررو (Head-to-Head) به امتیاز Elo تبدیل می‌شود.
  • AA-Omniscience: یک شاخص قابلیت اطمینان که پاسخ‌های درست را پاداش داده و توهم (Hallucination) را در مقیاسی از ۱۰۰- تا ۱۰۰ جریمه می‌کند. امتیاز صفر به معنای برابری تعداد پاسخ‌های درست و غلط است، در حالی که امتیازات منفی نشان‌دهنده غلبه پاسخ‌های نادرست بر درست است. شایان ذکر است که برای امتناع از پاسخ دادن، جریمه‌ای در نظر گرفته نشده است.
  • Terminal-Bench 4.0: ارزیابی کدنویسی عامل‌محور و تعامل مستقیم با محیط ترمینال.
  • SciCode و Humanity's Last Exam: آزمون‌های طراحی شده برای سنجش هوش عمومی و علمی در سطوح پیشرفته.
  • GDPval-AA v2.1 و GDP.pdf: تمرکز بر استدلال در اسناد حرفه‌ای و تحلیل فایل‌های PDF.
  • AutomationBench-AA: تست تسک‌های کاری دنیای واقعی به‌صورت عامل‌محور برای سنجش میزان اتوماسیون.
  • CritPt: یک ارزیابی تخصصی هوش که به‌طور مستقل توسط تیم Artificial Analysis اندازه‌گیری می‌شود.
  • AA-LCR v1.1: تمرکز ویژه بر استدلال‌های پزشکی در پنجرهٔ زمینه (Context Window) طولانی.

تحلیل قابلیت‌های تفکیک‌شده

برای ارائه دیدی دقیق و دانه‌بندی شده از عملکرد، این شاخص هوش عمومی را از قابلیت‌های صنعتی خاص جدا می‌کند. این تفکیک به کاربران اجازه می‌دهد تشخیص دهند که آیا یک مدل برای یک حوزه یا صنعت خاص (Vertical) مناسب است یا خیر:

  • کارهای دانشی عامل‌محور: این بخش از طریق مقیاس (Elo-500)/2000 اندازه‌گیری می‌شود.
  • تسک‌های کاری دنیای واقعی: برای ردیابی کارایی عامل‌محور، این بخش نیز با همان مقیاس (Elo-500)/2000 سنجیده می‌شود.
  • استدلال حرفه‌ای: این قابلیت از طریق تست‌های استدلال اسنادی و متون پزشکی ارزیابی می‌گردد.

تحلیل هزینه و عملکرد

در این تحلیل، عملکرد MiMo-V2.6-Pro از چندین زاویه حیاتی بررسی شده است. معیار «هزینه هر تسک شاخص هوش» یک میانگین وزنی است که توکن‌های ورودی، Cache Hitها، Cache Writeها و توکن‌های استدلالی را در نظر می‌گیرد. این رویکرد، دیدی صادقانه‌تر از هزینه‌های عملیاتی نسبت به قیمت‌گذاری سادهٔ هر توکن ارائه می‌دهد.

محاسبه هزینه به این صورت است که قیمت‌های مربوط به ورودی، Cache Hit، Cache Write، توکن‌های استدلالی و توکن‌های پاسخ دریافت شده، بر تعداد تسک‌ها تقسیم شده و سپس بر اساس وزن هر بخش در شاخص هوش، وزن‌دهی می‌شوند. همچنین، «هزینه اجرای شاخص هوش Artificial Analysis» نشان‌دهنده کل مبلغ دلاری مورد نیاز برای اجرای تمامی ارزیابی‌های موجود در این شاخص (بدون تکرار) است.

سرعت مدل با تعداد توکن‌های خروجی در ثانیه سنجیده می‌شود که مستقیماً بر «زمان پاسخ‌دهی سرتاسری» اثر می‌گذارد. در مدل‌های استدلالی (Reasoning Models)، این زمان شامل «زمان تفکر» است؛ یعنی دوره‌ای که مدل پیش از ارائه پاسخ نهایی، توکن‌های داخلی تولید می‌کند. این شاخص برای استانداردسازی مقایسه میان معماری‌های مختلف، به‌طور خاص زمان تولید ۵۰۰ توکن را ردیابی می‌کند.

تأخیر و زمان‌بندی پاسخ

تأخیر به‌صورت «زمان تا نخستین توکن پاسخ» (Time To First Answer Token) بر حسب ثانیه اندازه‌گیری می‌شود. این عدد شامل زمان تفکر مدل‌های استدلالی پیش از دریافت اولین توکن است. برای مدل‌هایی که قابلیت استریم (Streaming) ندارند، این مقدار برابر با کل زمان دریافت پاسخ نهایی است.

زمان پاسخ‌دهی سرتاسری برای ۵۰۰ توکن از سه جزء تشکیل شده است:
۱. زمان ورودی: زمان لازم تا دریافت اولین توکن پاسخ.
۲. زمان تفکر: زمانی که مدل‌های استدلالی برای تولید توکن‌های استدلالی صرف می‌کنند (بر اساس میانگین ۶۰ پرامپت متنوع).
۳. زمان پاسخ: زمان لازم برای تولید ۵۰۰ توکن خروجی بر اساس سرعت خروجی مدل.

معماری فنی و بهینگی

مدل MiMo-V2.6-Pro به‌عنوان یک مدل وزن‌باز، از نظر شاخص باز بودن (در مقیاس ۰ تا ۱۰۰) و کارایی پارامترها ارزیابی شده است. گزارش مذکور تفاوت میان پارامترهای کل و پارامترهای فعال را برجسته می‌کند؛ تفکیکی که در مدل‌های ترکیب خبره‌ها (Mixture of Experts) حیاتی است، زیرا در هر توکن تنها بخشی از شبکه اجرا می‌شود. در مقابل، در مدل‌های متراکم (Dense)، پارامترهای فعال با پارامترهای کل برابر هستند.

اندازه پنجرهٔ زمینه نیز به‌عنوان محرک اصلی جریان‌های کاری تولید بازیابی‌افزا (RAG) معرفی شده است. پنجره‌های بزرگ‌تر اجازه می‌دهند مدل روی مجموعه‌داده‌های عظیم بدون از دست دادن انسجام استدلال کند، قابلیتی که در بنچمارک پزشکی AA-LCR v1.1 تست شده است. این شاخص اشاره می‌کند که اگرچه توکن‌های ورودی و خروجی یک محدودیت ترکیبی مشترک دارند، اما توکن‌های خروجی معمولاً محدودیت به‌مراتب کمتری دارند.

قیمت‌گذاری و مصرف توکن

این شاخص «تعداد توکن‌های خروجی به‌ازای هر تسک شاخص هوش» را ردیابی می‌کند که یک میانگین وزنی از توکن‌های مصرف شده در هر تسک است. این مقدار از طریق ضرب توکن‌های خروجی هر ارزیابی در وزن نسبی آن بنچمارک و سپس تقسیم بر تعداد کل تسک‌ها محاسبه می‌شود.

قیمت‌گذاری حافظه (Cache) نیز یک عامل کلیدی است. قیمت Cache Hit نشان‌دهنده هزینه برای پرامپت‌هایی است که قبلاً پردازش شده‌اند و معمولاً تخفیف قابل‌توجهی نسبت به قیمت‌های ورودی عادی ارائه می‌دهد. هزینه‌های Cache Write و ذخیره‌سازی به‌صورت جداگانه محاسبه شده و بسته به ارائه‌دهنده متفاوت است.

تحلیل تحریریه

برای جامعه فنی، ظهور MiMo-V2.6-Pro نشان می‌دهد که معیار «هوش به‌ازای هر دلار» در حال تبدیل شدن به میدان نبرد اصلی است. ما شاهد گذاری هستیم که در آن هدف دیگر صرفاً شکست دادن یک بنچمارک نیست، بلکه دستیابی به آن در حالی است که «زمان هر تسک شاخص هوش» به حداقل برسد.

این تغییر به نفع مدل‌هایی است که می‌توانند قابلیت اطمینان بالایی (طبق شاخص AA-Omniscience) را بدون نیاز به محاسبات عظیم در زمان تست (Test-time Compute) حفظ کنند. اگر مدل‌های وزن‌باز بتوانند به‌طور مداوم با عملکرد مدل‌های انحصاری در کدنویسی عامل‌محور و استدلال حرفه‌ای برابری کنند، انگیزه برای محبوس شدن در اکوسیستم یک ارائه‌دهنده واحد به‌شدت کاهش می‌یابد.

جمع‌بندی نهایی

داده‌ها نشان می‌دهند که کارایی مدل‌های وزن‌باز اکنون برای کارهای عامل‌محور در سطح سازمانی (Enterprise-grade) کافی است. توانایی ایجاد توازن میان امتیاز بالای شاخص هوش با تأخیر و هزینه پایین، MiMo-V2.6-Pro را به جایگزینی عملی برای استقرار مدل‌های هوش مصنوعی در مقیاس تولید تبدیل می‌کند.

برای مشاهده نحوه مقایسه این مدل با جدیدترین نسخه‌های انحصاری، باید به‌روزرسانی‌های آتی رتبه‌بندی‌های Elo در AA-Briefcase را رصد کنید تا مشخص شود آیا این برتری در تسک‌های عامل‌محور متنوع‌تر نیز حفظ می‌شود یا خیر.

گام بعدی شما

  • اگر در حال استقرار مدل‌های محلی هستید، توازن MiMo بین هزینه و هوش را با مدل‌های بسته مقایسه کنید.
  • برای تسک‌های پزشکی یا اسنادی، بنچمارک AA-LCR را برای سنجش دقت در پنجره‌های متنی طولانی بررسی کنید.
  • رتبه‌بندی‌های Elo در AA-Briefcase را دنبال کنید تا ببینید آیا این برتری در تسک‌های متنوع‌تر حفظ می‌شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های Artificial Analysis نشان می‌دهد که مدل‌های باز اکنون برای استقرار در مقیاس سازمانی و تسک‌های عامل‌محور آماده‌اند. این تغییر، موازنه قدرت را از ارائه‌دهندگان APIهای انحصاری به سمت زیرساخت‌های میزبانی شخصی می‌برد.

تأثیر برای ایران

به‌دلیل امکان میزبانی شخصی مدل‌های وزن‌باز، توسعه‌دهندگان ایرانی می‌توانند بدون وابستگی به APIهای تحریمی و هزینه‌های دلاری، قابلیت‌های سطح بالای عامل‌محور را در زیرساخت‌های داخلی پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

سنگ‌انداز اصلی در پذیرش مدل‌های وزن‌باز دیگر نبودِ هوش، بلکه «هزینه هر واحد استدلال» است. MiMo-V2.6-Pro ثابت کرد که می‌توان بدون نیاز به محاسبات عظیم در زمان استنتاج (Test-time compute)، به قابلیت اطمینان بالایی رسید. این موضوع انگیزه وابستگی به اکوسیستم‌های بسته را به‌شدت کاهش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.