اگر امروز برای اجرای عاملهای هوش مصنوعی هزینه میپردازید، مدل جدید شیائومی میتواند صورتحساب شما را به شکل چشمگیری کاهش دهد. انتخاب بین مدل MiMo-V2.5 و نسخه Pro آن، صرفاً یک ارتقای کیفی ساده نیست، بلکه یک تصمیم استراتژیک در مورد مسیریابی هزینهها و انواع ورودیهاست. مدل استاندارد، درک چندوجهی بومی را با کسری از قیمت ارائه میدهد، در حالی که نسخه Pro تمام قابلیتهای رسانهای را فدای یک موتور متنی با تریلیونها پارامتر کرده است.
بسیاری از زیرساختهای فعلی با «مالیات چندوجهی» دستوپنجه نرم میکنند؛ یعنی جهش شدید هزینههای محاسباتی هنگام پردازش همزمان تصویر یا ویدیو در کنار متن. شیائومی (Xiaomi) با مدل MiMo-V2.5 سعی کرده این مشکل را حل کند. رویکرد شیائومی جداسازی موتور ادراک از موتور استدلال سنگین است تا توسعهدهندگان بتوانند هزینههای خود را بر اساس پیچیدگی واقعی هر وظیفه مقیاسبندی کنند. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، جداسازی لایههای ادراکی از لایههای تفکر، کلید مقیاسپذیری در تولید است.
MiMo-V2.5 بر پایه معماری ترکیب خبرهها (Mixture of Experts یا MoE) — شبیه به تیمی از متخصصان که برای هر سؤال فقط ۲ یا ۳ نفر از آنها بیدار میشوند تا جواب دهند — ساخته شده است. طبق مستندات فنی، این مدل در مجموع ۳۱۰ میلیارد پارامتر دارد، اما برای هر توکن تنها ۱۵ میلیارد پارامتر فعال میشوند. در واقع، مسیریاب مدل از بین ۲۵۶ خبره موجود، تنها ۸ مورد را برای هر توکن انتخاب میکند.

این طراحی باعث میشود مدل بدون پرداخت هزینه کامل محاسبات برای هر درخواست، به مخزن عظیمی از دانش دسترسی داشته باشد. البته باید توجه داشت که کاهش پارامترهای فعال، نیاز به حافظه را کم نمیکند؛ برای میزبانی شخصی (Self-hosting)، شما همچنان باید تمام ۳۱۰ میلیارد وزن مدل را در حافظه ذخیره کنید. در این محیطها، مسیریابی خبرهها و پهنای باند interconnect به محدودیتهای اصلی تبدیل میشوند. این چالشهای سختافزاری در مقایسهی رایانش محلی در برابر ابر برای مدلهای بینایی-زبانی شیائومی به تفصیل بررسی شده است.
برای مدیریت پنجره متنی (Context Window) — که مثل میز کاری است که جا برای چند ورق دارد، نه برای کل کتابخانه — یک میلیون توکنی، شیائومی از مکانیزم توجه ترکیبی استفاده کرده است. بر اساس گزارش dev.to، ستون فقرات این مدل از ۴۸ لایه تشکیل شده است: یک لایه متراکم (Dense) و ۴۷ لایه MoE.
توجه در این مدل بین لایههای «پنجره لغزان» و «سراسری» با نسبت ۵ به ۱ تقسیم شده است. بهطور دقیقتر، ۳۹ لایه از پنجره ۱۲۸ توکنی (SWA) استفاده میکنند، در حالی که ۹ لایه بهصورت سراسری (Global) باقی ماندهاند. این ترفند باعث شده حجم KV-Cache تا ۶ برابر کاهش یابد و پنجره یک میلیون توکنی از یک ویژگی لوکس به یک قابلیت مقرونبهصرفه تبدیل شود.
در بخش درک چندوجهی، این مدل از رمزگذارهای اختصاصی استفاده میکند که به ستون فقرات زبانی منتقل میشوند:
- تصویر و ویدیو: یک ViT (Vision Transformer) با ۷۲۹ میلیون پارامتر و ۲۸ لایه.
- صوت: یک ترنسفورمر ۲۶۱ میلیون پارامتری با ۲۴ لایه.
- رمزگشایی گمانهزنانه (Speculative Decoding): سه ماژول پیشبینی چند-توکنی (MTP) با مجموع حدود ۳۲۹ میلیون پارامتر برای بهبود کارایی یادگیری تقویتی (RL).
به نقل از گزارشهای فنی، آموزش این معماری روی تقریباً ۴۸ تریلیون توکن صورت گرفته و پنجره متنی آن در مرحله پسآموزش بهطور تدریجی به یک میلیون توکن گسترش یافته است. در محکهای مربوط به کدنویسی و وظایف عاملمحور (Agentic)، مدل عملکرد قدرتمندی در سطح مخزن (Repository-level) داشته و در Terminal-Bench 2.0 امتیاز ۶۵.۸ و در SWE-Bench Pro امتیاز ۵۶.۱ را کسب کرده است. این اعداد نشان میدهند مدل فراتر از یک تکمیلکننده متن ساده، توانایی مدیریت واقعی مخازن کد را دارد.
با این حال، مدل در جمعآوری شواهد ضعیف است و در ResearchClawBench تنها امتیاز ۱۶.۹۱ را گرفته است. کاربرانی که به استنادهای شدید یا جمعآوری شواهد نیاز دارند، باید این مسیر را بهطور جداگانه تست کنند. در مقابل، نقاط قوت آن در درک اسناد و تصاویر با کیفیت بالا متمرکز است. امتیازات کلیدی عبارتند از:
- OmniDocBench: ۸۷.۲
- Video-MME: ۸۷.۷
- HR-Bench 4K: ۸۸.۵
- DailyOmni: ۸۳.۵
- CharXiv RQ: ۸۱.۰
- MMMU-Pro: ۷۷.۹
- VideoHolmes: ۶۴.۰
نکته مهم این است که شکافی میان «درک رسانه» و «عمل بر اساس آن» وجود دارد؛ در حالی که مدل در OmniDocBench امتیاز ۸۷.۲ میگیرد، در Claw-Eval Multimodal تنها به ۲۳.۸ میرسد. این یعنی استفاده از ابزارها بر اساس ورودیهای رسانهای نیاز به تستهای سرتاسری (End-to-End) روی استک خاص شما دارد.
در مقابل، نسخه MiMo-V2.5-Pro یک غول متنی کاملاً متفاوت است. این مدل تا ۱.۰۲ تریلیون پارامتر کلی و ۴۲ میلیارد پارامتر فعال مقیاس مییابد. این نسخه از ۷۰ لایه و ۳۸۴ خبره مسیریاب استفاده میکند. اگرچه در کدنویسی کمی بهتر است (امتیاز ۶۸.۴ در Terminal-Bench 2.0 و ۵۷.۲ در SWE-Bench Pro)، اما تمام قابلیتهای ورودی چندوجهی بومی را از دست داده است. در واقع، نسخه Pro برای رسیدن به این پیشرفتهای اندک، حدود ۲.۸ برابر پارامتر فعال بیشتری مصرف میکند. اگر رسانه یک ورودی درجه اول برای گردش کار شماست، نسخه Pro کاندیدای مناسبی نیست.
تفاوت قیمت این دو نسخه بازتابدهنده همین شکاف است. نسخه Pro حدود ۳.۱ برابر گرانتر از نسخه استاندارد است. برای ورودیهای بدون کش، مدل استاندارد ۰.۱۴ دلار و نسخه Pro حدود ۰.۴۳۵ دلار به ازای هر میلیون توکن هزینه دارد. هزینه خروجی نیز برای استاندارد ۰.۲۸ دلار و برای Pro حدود ۰.۸۷ دلار است. برای موارد Cache Hit، هزینه به ۰.۰۰۲۸ دلار برای استاندارد و ۰.۰۰۳۶ دلار برای Pro کاهش مییابد.
وزنهای این مدل تحت لایسنس MIT منتشر شدهاند که اجازه استفاده تجاری، تغییر و توزیع مجدد را میدهد؛ این انتشار پس از یک بتای عمومی در ۲۳ آوریل ۲۰۲۶ صورت گرفت. این مدل از API سازگار با OpenAI، از جمله قابلیتهای استفاده از ابزار (Tool Use)، جستوجوی وب، استریمینگ، خروجی ساختاریافته و کشینگ زمینه پشتیبانی میکند. محدودیتهای نرخ (Rate Limits) منتشر شده ۱۰۰ RPM و ۱۰M TPM است، هرچند این مقادیر بسته به سطح حساب کاربری متفاوت است.
توسعهدهندگان باید سریعاً برای مهاجرت اقدام کنند. شیائومی اعلام کرده است که نامهای رسمی API برای هر دو نسخه v2.5 در ۲۱ اکتبر ۲۰۲۶ ساعت ۱۰:۰۰ به وقت پکن منقضی (Deprecated) میشوند و هیچ جایگزینی خودکاری برای آنها برنامهریزی نشده است.
این تغییرات نشان میدهد که برای اکثر اتوماسیونها، مدل استاندارد انتخاب پیشفرض و درست است. تنها زمانی به Pro مهاجرت کنید که شکستهای استدلالی، هزینه بالای آن را توجیه کند یا با مهندسی مخازن کد بسیار پیچیده و صرفاً متنی سروکار داشته باشید. در گیتویهای شخص ثالث مانند CometAPI، هزینهها حدود ۲۰٪ کمتر است (۰.۱۱۲/۰.۲۲۴ دلار برای استاندارد و ۰.۳۴۸/۰.۶۹۶ دلار برای Pro)، اما نسبت قیمتی ۳.۱ برابری همچنان پابرجاست. این استراتژی انتشار مدلهای وزنباز، برتری جدید شیائومی در شاخص هوش را در برابر سیستمهای بسته تقویت کرده است.
در هنگام پیادهسازی به یاد داشته باشید که با وجود سقف یک میلیون توکنی برای زمینه، حداکثر خروجی API تنها ۱۲۸ هزار توکن است. همیشه نقطه انتهایی (Endpoint) زنده و اسکیمای درخواستها را بررسی کنید، زیرا شناسههای مدل در گیتویهای شخص ثالث ممکن است مستقل از پلتفرم اصلی تغییر کنند.
منتظر مدلهای جایگزین پس از تاریخ انقضای اکتبر باشید تا ببینیم آیا شیائومی قابلیتهای چندوجهی و قدرت Pro را در یک معماری واحد و ادغامشده ترکیب میکند یا خیر.
گام بعدی شما
- اگر از مدلهای چندوجهی گرانقیمت استفاده میکنید، مدل استاندارد MiMo-V2.5 را برای کاهش هزینههای استنتاج تست کنید.
- برای وظایف کدنویسی پیچیده، تفاوت عملکرد نسخه Pro و استاندارد را روی مخازن کد خودتان بسنجید تا ببینید آیا پرداخت ۳ برابر هزینه ارزشش را دارد یا خیر.
- تاریخ ۲۱ اکتبر ۲۰۲۶ را برای بهروزرسانی APIهای خود در تقویم علامت بزنید تا با قطع سرویس مواجه نشوید.




گفتگو