اگر امروز برای استفاده از مدلهای تجاری هزینه میکنید، باید بدانید که قدرت مدلهای رایگان و وزنباز به نقطهای رسیده است که تفاوت آنها با سیستمهای «جعبه سیاه» تقریباً به صفر رسیده است. پیش از این، مدلهای GLM-5.3 (max) و Kimi K3 (max) با کسب امتیازهای ۴۵ و ۴۴ پیشتاز بودند، اما شیائومی سقف توانمندیهای هوش مصنوعی وزنباز را بالاتر برد. در این راستا، مدل GLM-5.3-Flash پیشتر توانسته بود با هزینهای بسیار اندک با مدلهای پیشرو رقابت کند. در ۲۲ سپتامبر ۲۰۲۶، مدل MiMo-V2.6-Pro با کسب امتیاز ۴۶ در شاخص هوش Artificial Analysis، سقف توانمندیهای مدلهای وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پخت یا همان وزنهایشان علناً منتشر شده تا هر کسی بتواند آنها را اجرا کند — را جابهجا کرد.
به نقل از شیائومی، امتیاز دقیق این مدل ۴۶.۳۲ است و شرکت این نسخه را «قویترین مدل متنباز تا به امروز» مینامد. برای درک جایگاه این عدد، کافی است بدانیم مدل Grok 4.7 (xhigh) از SpaceXAI نیز دقیقاً همین امتیاز ۴۶ را دارد. هرچند مدلهای بستهای مثل GPT-6 Astra هنوز در مهندسی نرمافزار برتری جزئی دارند، اما نسبت هزینه به هوش بهسوی جایگزینهای باز تغییر جهت داده است. برای رهبران کسبوکار و توسعهدهندگان، این تغییر به معنای کاهش فاصله میان سیستمهای انحصاری و مدلهای در دسترس است.
همانطور که در تحلیلهای قبلی ما دربارهی رقابت مدلهای بازمتن و بسته اشاره کردیم، دسترسی به وزنهای مدل، ریسک وابستگی به یک فروشنده (Vendor Lock-in) را برای شرکتها حذف میکند.
شیائومی این سری را در سه نسخه عرضه کرده است تا نیازهای مختلف عملیاتی را پوشش دهد:
- MiMo-V2.6-Pro: مدل پرچمدار که برای دستیابی به حداکثر توانمندی طراحی شده است.
- MiMo-V2.6-Flash: نسخهای بهینه و سادهشده برای ایجاد تعادل میان هوش، کارایی و هزینه.
- MiMo-V2.6-Pro-UltraSpeed: نسخهای تخصصی که خروجی را تا ۲۰ برابر سریعتر برای تولیدات با سرعت بالا ارائه میدهد.
طبق گزارش Artificial Analysis، شاخص هوش v4.3.2 ترکیبی از ۱۰ ارزیابی مختلف است. این ارزیابیها شامل AA-Briefcase v1.1، GDPval-AA v2.1، AutomationBench-AA، Terminal-Bench 4.0، SciCode و Humanity’s Last Exam میشود. ارزیابی مدل Pro در این شاخص هزینهای معادل ۲۰۶.۶۶ دلار داشته است که هزینه هر تکوظیفه (per-task) حدود ۰.۱۳ دلار برآورد میشود.
بر اساس مستندات فنی (Model Card)، چکپوینت Pro-RL از معماری ترکیب خبرهها (Sparse Mixture-of-Experts یا MoE) استفاده میکند — شبیه به تیمی از متخصصان که در هر لحظه فقط فرد مناسب برای پاسخ به سؤال فراخوانده میشود. این مدل در مجموع ۱.۰۲ تریلیون پارامتر دارد، اما برای هر توکن (Token) — تکههای کوچکی از متن که مدل تکهتکه میخورد — تنها ۴۲ میلیارد پارامتر فعال میشوند. این مدل از طول کانتکست ۱ میلیون توکن پشتیبانی میکند و بهطور بومی قادر به پردازش ورودیهای متنی، تصویری، ویدئویی و صوتی است. این قابلیت پردازش متون طولانی یادآور مدل Kimi K3 است که با پنجره متنی ۱ میلیون توکنی استانداردهای جدیدی را در پلتفرمهای ابری تعریف کرد.
جزئیات فنی معماری این مدل نشاندهنده پیچیدگی بالای آن است:
- ستون فقرات: یک ساختار ۷۰ لایهای شامل ۶۰ لایه توجه پنجرهای لغزان (sliding-window attention) که با ۱۰ لایه توجه جهانی (global-attention) در هم تنیده شدهاند.
- خبرهها: ۳۸۴ خبره مسیری (routed experts) که در هر توکن، ۸ مورد از آنها فعال هستند.
- مدیریت وجهها: یک ViT با ۶۸۱ میلیون پارامتر برای بینایی، یک AudioTokenizer با ۳۰۸ میلیون پارامتر و یک رمزگذار وصله صوتی (audio patch encoder) با ۱۲۷ میلیون پارامتر.
- رمزگشایی: یک رمزگشای گمانهزنانه (speculative decoder) پنجلایه برای پیشبینی چند-توکنی که در هر گام پیشرو، ۷ توکن بعدی را پیشبینی میکند.
وزنهای این مدل تحت لایسنس MIT منتشر شدهاند که اجازه استفاده تجاری کامل را میدهد. وزنهای نسخههای Pro-RL و Flash-RL در Hugging Face و ModelScope در دسترس هستند. شیائومی همچنین کد مربوط به RL، محیطهای آموزشی و گزارش فنی کامل را بهصورت متنباز منتشر کرده است.
در اقدامی کمسابقه برای شفافیت، شیائومی فرآیند یادگیری تقویتی (RL) — یعنی مرحلهای که مدل با دریافت پاداش، رفتارهای درست را یاد میگیرد — را بهصورت زنده پخش کرد. طبق اعلام شرکت، آموزش مدل Pro در کمتر از ۶ روز با طی کردن ۳۰ گام RL روی ۷۵۰,۰۰۰ مسیر (trajectory) و با هزینه ۲.۶۲ میلیون دلار انجام شد. مدل Flash نیز مسیر مشابهی را با هزینه ۰.۸۵ میلیون دلار طی کرد. این فرآیند باعث شد امتیاز مدل در محک مهندسی نرمافزار DeepSWE v1.1 برای نسخه Pro از ۵۸.۴ به ۷۲.۵۷ و برای نسخه Flash از ۴۸.۸ به ۶۵.۶۸ برسد.
شیائومی برای مقیاسبندی محاسبات RL از سه محور اصلی استفاده کرد:
۱. معماری: یک ساختار کاملاً ناهمگام با ۱۵۶۸ نمونه در هر بهروزرسانی، که در هر گام بین ۳.۵ تا ۳.۷ میلیارد توکن را آموزش میدهد.
۲. مجموعه وظایف: ترکیبی از وظایف چندگانه شامل کدنویسی، عاملهای عمومی، وظایف بصری و سایبری.
۳. سیگنالهای پاداش: افزایش محاسبات ارزیاب (grader compute) با استفاده از مقایسه نسبی درون گروهها برای دستیابی به دقت بالاتر.
این سیستم از بهینهسازی سیاست تقریبی گروهی (GRPO) بهصورت کاملاً ناهمگام با ۱۶ اجرای هر گام (rollouts per step) استفاده میکند. همچنین برای دستورالعملهای آفلاین از «سنتز پاداش گروهی» و برای رتبهبندی آنلاین از «توزیع مجدد مزیت گروهی» بهره میبرد. پس از اجرای RL، یک مرحله تقطیر سیاست (distillation) چند-پیشوند و چند-معلم (MOPD2) انجام میشود که توسط دفاعهای ضد-هک پاداش (reward-hacking)، شامل تشخیص ناهنجاری و تاییدکنندههای متقاطع، پشتیبانی میشود.
دادههای داخلی شیائومی نشان میدهد مدل Pro با امتیاز ۷۱.۹ در DeepSWE v1.1، کمی از Claude Opus 5 (۷۴.۰) و DeepSeek V4.1 Flash (۷۴.۲) عقبتر است، اما در محکهای دیگر میدرخشد. برای مثال، نسخه Flash در محک CyberGym امتیاز ۹۵.۱ را کسب کرد که بهطور قابلتوجهی از امتیاز ۸۴.۵ مدل GLM 5.3 بیشتر است. سایر نتایج مدل Pro شامل امتیاز ۱۶۷۳ در GDPVal 2.1 (پشت سر Claude Fable 5.1 با ۱۷۳۵)، امتیاز ۷۶.۹ در Toolathlon-verified، امتیاز ۵۳.۱ در Automation Bench v1.0.6 و امتیاز ۳۴.۹ در Terminal Bench 4.0 است.
از منظر بازار، این عرضه چالشی مستقیم برای قدرت قیمتگذاری آزمایشگاههای مدلهای بسته است. شیائومی قیمت APIهای سری V2.5 را حفظ کرده است. هزینه هر میلیون توکن برای مدل Pro در حالت برخورد حافظه (cache-hit) ۰.۰۰۳۶ دلار، در حالت عدم برخورد ۰.۴۳۵ دلار و برای خروجی ۰.۸۷ دلار است. مدل Flash با قیمتهای ۰.۰۰۲۸، ۰.۱۴ و ۰.۲۸ دلار عرضه شده و UltraSpeed هزینههای ۰.۰۳۶، ۴.۳۵ و ۸.۷۰ دلار را دارد. طبق اندازهگیریهای Artificial Analysis، این مدل از طریق API توان عملیاتی ۱۲۹.۷ توکن در ثانیه و زمان ۲.۱۷ ثانیه برای اولین توکن (TTFT) را ارائه میدهد.
کاربردهای این مدل فراتر از بنچمارکهاست و در تحقیقات سطح بالا و هنرهای خلاقانه کاربرد دارد. شیائومی نمایش داد که این مدل میتواند چارچوبهای فلزی-آلی برای جذب مواد شیمیایی PFAS طراحی کند یا یک اثبات رسمی ۶۰۰۰ خطی به زبان Lean 4 از قضیه «دوره سه به معنای هرجومرج» (Li and Yorke) تولید کند که توسط هسته Lean تایید شده است. همچنین مدل یک اثر ارکسترال به نام «جاده شب» را تصنیف کرده و بهطور مستقل آن را به فرمت MIDI تبدیل کرد. دموهای دیگر شامل مدلسازی سهبعدی در Blender، توسعه بازیهای چند-عاملی و کنترل حلقه-بسته بازوی رباتیک Franka Panda بود.
این حرکت سیگنالی است که «جنگ هوش» دیگر تنها بر سر تعداد پارامترها نیست، بلکه بر سر کارایی RL و دسترسی به وزنهای حاصل از آن است. این رویکرد بهینهسازی، مشابه استراتژی مدل ZGCM-1 بود که توانست با پارامترهای بسیار کمتر بر غولهای حجیم پیروز شود. برای سازمانها، توانایی میزبانی محلی مدلی با امتیاز هوش ۴۶ تحت لایسنس MIT، ریسکهای وابستگی به تامینکننده را از بین میبرد.
کاربران در حال حاضر میتوانند از طریق AI Studio، MiMo Code، MiMo Desktop و OpenRouter به این مدلها دسترسی داشته باشند. برنامه دسترسی زودهنگام UltraSpeed نیز طی هفته جاری به پایان میرسد.
گام بعدی شما
- اگر توسعهدهنده هستید، مدلهای MiMo را از طریق OpenRouter یا Hugging Face تست کنید تا هزینه استنتاج خود را کاهش دهید.
- برای پروژههایی که نیاز به سرعت بسیار بالا دارند، نسخه UltraSpeed را در اولویت قرار دهید.
- مستندات RL شیائومی را مطالعه کنید تا با نحوه مقیاسبندی پاداشها در مدلهای تریلیونی آشنا شوید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو