پرش به محتوای اصلی
پرش به محتوای مقاله

مدل MiMo-V2.5 شیائومی هزینه استنتاج عامل‌های چندوجهی را کاهش داد

·۱۷ مهر ۱۴۰۵۶ دقیقه مطالعه
MiMo-V2.5 در عمل: ۱۵ میلیارد پارامتر فعال، ورودی چندوجهی بومی و ارزش واقعی نسخه Pro
MiMo-V2.5 در عمل: ۱۵ میلیارد پارامتر فعال، ورودی چندوجهی بومی و ارزش واقعی نسخه Pro
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جداسازی صریح مدل به دو شاخه «درک رسانه‌ای ارزان» و «استدلال متنی گران»؛ به جای ارائه یک مدل واحد، شیائومی هزینه محاسبات را به نوع ورودی گره زده است.

اگر امروز برای اجرای عامل‌های هوش مصنوعی هزینه می‌پردازید، مدل جدید شیائومی می‌تواند صورت‌حساب شما را به شکل چشم‌گیری کاهش دهد. انتخاب بین مدل MiMo-V2.5 و نسخه Pro آن، صرفاً یک ارتقای کیفی ساده نیست، بلکه یک تصمیم استراتژیک در مورد مسیریابی هزینه‌ها و انواع ورودی‌هاست. مدل استاندارد، درک چندوجهی بومی را با کسری از قیمت ارائه می‌دهد، در حالی که نسخه Pro تمام قابلیت‌های رسانه‌ای را فدای یک موتور متنی با تریلیون‌ها پارامتر کرده است.

بسیاری از زیرساخت‌های فعلی با «مالیات چندوجهی» دست‌وپنجه نرم می‌کنند؛ یعنی جهش شدید هزینه‌های محاسباتی هنگام پردازش هم‌زمان تصویر یا ویدیو در کنار متن. شیائومی (Xiaomi) با مدل MiMo-V2.5 سعی کرده این مشکل را حل کند. رویکرد شیائومی جداسازی موتور ادراک از موتور استدلال سنگین است تا توسعه‌دهندگان بتوانند هزینه‌های خود را بر اساس پیچیدگی واقعی هر وظیفه مقیاس‌بندی کنند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، جداسازی لایه‌های ادراکی از لایه‌های تفکر، کلید مقیاس‌پذیری در تولید است.

MiMo-V2.5 بر پایه معماری ترکیب خبره‌ها (Mixture of Experts یا MoE) — شبیه به تیمی از متخصصان که برای هر سؤال فقط ۲ یا ۳ نفر از آن‌ها بیدار می‌شوند تا جواب دهند — ساخته شده است. طبق مستندات فنی، این مدل در مجموع ۳۱۰ میلیارد پارامتر دارد، اما برای هر توکن تنها ۱۵ میلیارد پارامتر فعال می‌شوند. در واقع، مسیریاب مدل از بین ۲۵۶ خبره موجود، تنها ۸ مورد را برای هر توکن انتخاب می‌کند.

MiMo-V2.5 در عمل: ۱۵ میلیارد پارامتر فعال، ورودی چندوجهی بومی و ارزش واقعی نسخه Pro

این طراحی باعث می‌شود مدل بدون پرداخت هزینه کامل محاسبات برای هر درخواست، به مخزن عظیمی از دانش دسترسی داشته باشد. البته باید توجه داشت که کاهش پارامترهای فعال، نیاز به حافظه را کم نمی‌کند؛ برای میزبانی شخصی (Self-hosting)، شما همچنان باید تمام ۳۱۰ میلیارد وزن مدل را در حافظه ذخیره کنید. در این محیط‌ها، مسیریابی خبره‌ها و پهنای باند interconnect به محدودیت‌های اصلی تبدیل می‌شوند. این چالش‌های سخت‌افزاری در مقایسه‌ی رایانش محلی در برابر ابر برای مدل‌های بینایی-زبانی شیائومی به تفصیل بررسی شده است.

برای مدیریت پنجره متنی (Context Window) — که مثل میز کاری است که جا برای چند ورق دارد، نه برای کل کتابخانه — یک میلیون توکنی، شیائومی از مکانیزم توجه ترکیبی استفاده کرده است. بر اساس گزارش dev.to، ستون فقرات این مدل از ۴۸ لایه تشکیل شده است: یک لایه متراکم (Dense) و ۴۷ لایه MoE.

توجه در این مدل بین لایه‌های «پنجره لغزان» و «سراسری» با نسبت ۵ به ۱ تقسیم شده است. به‌طور دقیق‌تر، ۳۹ لایه از پنجره ۱۲۸ توکنی (SWA) استفاده می‌کنند، در حالی که ۹ لایه به‌صورت سراسری (Global) باقی مانده‌اند. این ترفند باعث شده حجم KV-Cache تا ۶ برابر کاهش یابد و پنجره یک میلیون توکنی از یک ویژگی لوکس به یک قابلیت مقرون‌به‌صرفه تبدیل شود.

در بخش درک چندوجهی، این مدل از رمزگذارهای اختصاصی استفاده می‌کند که به ستون فقرات زبانی منتقل می‌شوند:

  • تصویر و ویدیو: یک ViT (Vision Transformer) با ۷۲۹ میلیون پارامتر و ۲۸ لایه.
  • صوت: یک ترنسفورمر ۲۶۱ میلیون پارامتری با ۲۴ لایه.
  • رمزگشایی گمانه‌زنانه (Speculative Decoding): سه ماژول پیش‌بینی چند-توکنی (MTP) با مجموع حدود ۳۲۹ میلیون پارامتر برای بهبود کارایی یادگیری تقویتی (RL).

به نقل از گزارش‌های فنی، آموزش این معماری روی تقریباً ۴۸ تریلیون توکن صورت گرفته و پنجره متنی آن در مرحله پس‌آموزش به‌طور تدریجی به یک میلیون توکن گسترش یافته است. در محک‌های مربوط به کدنویسی و وظایف عامل‌محور (Agentic)، مدل عملکرد قدرتمندی در سطح مخزن (Repository-level) داشته و در Terminal-Bench 2.0 امتیاز ۶۵.۸ و در SWE-Bench Pro امتیاز ۵۶.۱ را کسب کرده است. این اعداد نشان می‌دهند مدل فراتر از یک تکمیل‌کننده متن ساده، توانایی مدیریت واقعی مخازن کد را دارد.

با این حال، مدل در جمع‌آوری شواهد ضعیف است و در ResearchClawBench تنها امتیاز ۱۶.۹۱ را گرفته است. کاربرانی که به استنادهای شدید یا جمع‌آوری شواهد نیاز دارند، باید این مسیر را به‌طور جداگانه تست کنند. در مقابل، نقاط قوت آن در درک اسناد و تصاویر با کیفیت بالا متمرکز است. امتیازات کلیدی عبارتند از:

  • OmniDocBench: ۸۷.۲
  • Video-MME: ۸۷.۷
  • HR-Bench 4K: ۸۸.۵
  • DailyOmni: ۸۳.۵
  • CharXiv RQ: ۸۱.۰
  • MMMU-Pro: ۷۷.۹
  • VideoHolmes: ۶۴.۰

نکته مهم این است که شکافی میان «درک رسانه» و «عمل بر اساس آن» وجود دارد؛ در حالی که مدل در OmniDocBench امتیاز ۸۷.۲ می‌گیرد، در Claw-Eval Multimodal تنها به ۲۳.۸ می‌رسد. این یعنی استفاده از ابزارها بر اساس ورودی‌های رسانه‌ای نیاز به تست‌های سرتاسری (End-to-End) روی استک خاص شما دارد.

در مقابل، نسخه MiMo-V2.5-Pro یک غول متنی کاملاً متفاوت است. این مدل تا ۱.۰۲ تریلیون پارامتر کلی و ۴۲ میلیارد پارامتر فعال مقیاس می‌یابد. این نسخه از ۷۰ لایه و ۳۸۴ خبره مسیریاب استفاده می‌کند. اگرچه در کدنویسی کمی بهتر است (امتیاز ۶۸.۴ در Terminal-Bench 2.0 و ۵۷.۲ در SWE-Bench Pro)، اما تمام قابلیت‌های ورودی چندوجهی بومی را از دست داده است. در واقع، نسخه Pro برای رسیدن به این پیشرفت‌های اندک، حدود ۲.۸ برابر پارامتر فعال بیشتری مصرف می‌کند. اگر رسانه یک ورودی درجه اول برای گردش کار شماست، نسخه Pro کاندیدای مناسبی نیست.

تفاوت قیمت این دو نسخه بازتاب‌دهنده همین شکاف است. نسخه Pro حدود ۳.۱ برابر گران‌تر از نسخه استاندارد است. برای ورودی‌های بدون کش، مدل استاندارد ۰.۱۴ دلار و نسخه Pro حدود ۰.۴۳۵ دلار به ازای هر میلیون توکن هزینه دارد. هزینه خروجی نیز برای استاندارد ۰.۲۸ دلار و برای Pro حدود ۰.۸۷ دلار است. برای موارد Cache Hit، هزینه به ۰.۰۰۲۸ دلار برای استاندارد و ۰.۰۰۳۶ دلار برای Pro کاهش می‌یابد.

وزن‌های این مدل تحت لایسنس MIT منتشر شده‌اند که اجازه استفاده تجاری، تغییر و توزیع مجدد را می‌دهد؛ این انتشار پس از یک بتای عمومی در ۲۳ آوریل ۲۰۲۶ صورت گرفت. این مدل از API سازگار با OpenAI، از جمله قابلیت‌های استفاده از ابزار (Tool Use)، جست‌وجوی وب، استریمینگ، خروجی ساختاریافته و کشینگ زمینه پشتیبانی می‌کند. محدودیت‌های نرخ (Rate Limits) منتشر شده ۱۰۰ RPM و ۱۰M TPM است، هرچند این مقادیر بسته به سطح حساب کاربری متفاوت است.

توسعه‌دهندگان باید سریعاً برای مهاجرت اقدام کنند. شیائومی اعلام کرده است که نام‌های رسمی API برای هر دو نسخه v2.5 در ۲۱ اکتبر ۲۰۲۶ ساعت ۱۰:۰۰ به وقت پکن منقضی (Deprecated) می‌شوند و هیچ جایگزینی خودکاری برای آن‌ها برنامه‌ریزی نشده است.

این تغییرات نشان می‌دهد که برای اکثر اتوماسیون‌ها، مدل استاندارد انتخاب پیش‌فرض و درست است. تنها زمانی به Pro مهاجرت کنید که شکست‌های استدلالی، هزینه بالای آن را توجیه کند یا با مهندسی مخازن کد بسیار پیچیده و صرفاً متنی سروکار داشته باشید. در گیت‌وی‌های شخص ثالث مانند CometAPI، هزینه‌ها حدود ۲۰٪ کمتر است (۰.۱۱۲/۰.۲۲۴ دلار برای استاندارد و ۰.۳۴۸/۰.۶۹۶ دلار برای Pro)، اما نسبت قیمتی ۳.۱ برابری همچنان پابرجاست. این استراتژی انتشار مدل‌های وزن‌باز، برتری جدید شیائومی در شاخص هوش را در برابر سیستم‌های بسته تقویت کرده است.

در هنگام پیاده‌سازی به یاد داشته باشید که با وجود سقف یک میلیون توکنی برای زمینه، حداکثر خروجی API تنها ۱۲۸ هزار توکن است. همیشه نقطه انتهایی (Endpoint) زنده و اسکیمای درخواست‌ها را بررسی کنید، زیرا شناسه‌های مدل در گیت‌وی‌های شخص ثالث ممکن است مستقل از پلتفرم اصلی تغییر کنند.

منتظر مدل‌های جایگزین پس از تاریخ انقضای اکتبر باشید تا ببینیم آیا شیائومی قابلیت‌های چندوجهی و قدرت Pro را در یک معماری واحد و ادغام‌شده ترکیب می‌کند یا خیر.

گام بعدی شما

  • اگر از مدل‌های چندوجهی گران‌قیمت استفاده می‌کنید، مدل استاندارد MiMo-V2.5 را برای کاهش هزینه‌های استنتاج تست کنید.
  • برای وظایف کدنویسی پیچیده، تفاوت عملکرد نسخه Pro و استاندارد را روی مخازن کد خودتان بسنجید تا ببینید آیا پرداخت ۳ برابر هزینه ارزشش را دارد یا خیر.
  • تاریخ ۲۱ اکتبر ۲۰۲۶ را برای به‌روزرسانی APIهای خود در تقویم علامت بزنید تا با قطع سرویس مواجه نشوید.
چرا این موضوع مهم است؟

این مدل با کاهش چشم‌گیر هزینه استنتاج در وظایف چندوجهی، ورود عامل‌های هوش مصنوعی به مقیاس‌های صنعتی را تسهیل می‌کند. اعتبار این رویکرد در استفاده از معماری MoE است که اجازه می‌دهد مدل‌های تریلیونی با هزینه مدل‌های کوچک اجرا شوند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به سرویس‌های شیائومی برای توسعه‌دهندگان ایرانی دشوار است، اما انتشار وزن‌های مدل تحت لایسنس MIT فرصتی برای میزبانی شخصی (Self-hosting) در سرورهای داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

استراتژی شیائومی در تفکیک مدل Pro و استاندارد، پذیرش این واقعیت است که درک چندوجهی و استدلال عمیق متنی، در حال حاضر نیاز به منابع محاسباتی متفاوتی دارند. این رویکرد به جای ارائه یک مدل «همه-فن-حریف» اما گران، به توسعه‌دهنده اجازه می‌دهد هزینه را بهینه‌تر مدیریت کند. به نظر ما، این مدل یک گام عملی در جهت تجاری‌سازی مدل‌های MoE است که در آن کارایی (Efficiency) بر برتری مطلق (Absolute Superiority) اولویت دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.