پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های وزن‌باز در برابر سیستم‌های بسته؛ برتری جدید شیائومی در شاخص هوش

·۳۱ شهریور ۱۴۰۵۵ دقیقه مطالعه
پرچم‌دار جدید شیائومی با امتیاز ۴۶ در صدر جدول مدل‌های متن‌باز قرار گرفت
پرچم‌دار جدید شیائومی با امتیاز ۴۶ در صدر جدول مدل‌های متن‌باز قرار گرفت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شفاف‌سازی کامل فرآیند یادگیری تقویتی (RL) از طریق پخش زنده و انتشار کدها؛ در حالی که اکثر شرکت‌ها RL را به عنوان یک راز تجاری نگه می‌دارند، شیائومی «دستور پخت» رسیدن به امتیاز ۴۶ را افشا کرد.

اگر امروز برای استفاده از مدل‌های تجاری هزینه می‌کنید، باید بدانید که قدرت مدل‌های رایگان و وزن‌باز به نقطه‌ای رسیده است که تفاوت آن‌ها با سیستم‌های «جعبه سیاه» تقریباً به صفر رسیده است. پیش از این، مدل‌های GLM-5.3 (max) و Kimi K3 (max) با کسب امتیازهای ۴۵ و ۴۴ پیشتاز بودند، اما شیائومی سقف توانمندی‌های هوش مصنوعی وزن‌باز را بالاتر برد. در این راستا، مدل GLM-5.3-Flash پیش‌تر توانسته بود با هزینه‌ای بسیار اندک با مدل‌های پیشرو رقابت کند. در ۲۲ سپتامبر ۲۰۲۶، مدل MiMo-V2.6-Pro با کسب امتیاز ۴۶ در شاخص هوش Artificial Analysis، سقف توانمندی‌های مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پخت یا همان وزن‌هایشان علناً منتشر شده تا هر کسی بتواند آن‌ها را اجرا کند — را جابه‌جا کرد.

به نقل از شیائومی، امتیاز دقیق این مدل ۴۶.۳۲ است و شرکت این نسخه را «قوی‌ترین مدل متن‌باز تا به امروز» می‌نامد. برای درک جایگاه این عدد، کافی است بدانیم مدل Grok 4.7 (xhigh) از SpaceXAI نیز دقیقاً همین امتیاز ۴۶ را دارد. هرچند مدل‌های بسته‌ای مثل GPT-6 Astra هنوز در مهندسی نرم‌افزار برتری جزئی دارند، اما نسبت هزینه به هوش به‌سوی جایگزین‌های باز تغییر جهت داده است. برای رهبران کسب‌وکار و توسعه‌دهندگان، این تغییر به معنای کاهش فاصله میان سیستم‌های انحصاری و مدل‌های در دسترس است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی رقابت مدل‌های بازمتن و بسته اشاره کردیم، دسترسی به وزن‌های مدل، ریسک وابستگی به یک فروشنده (Vendor Lock-in) را برای شرکت‌ها حذف می‌کند.

شیائومی این سری را در سه نسخه عرضه کرده است تا نیازهای مختلف عملیاتی را پوشش دهد:

  • MiMo-V2.6-Pro: مدل پرچم‌دار که برای دستیابی به حداکثر توانمندی طراحی شده است.
  • MiMo-V2.6-Flash: نسخه‌ای بهینه و ساده‌شده برای ایجاد تعادل میان هوش، کارایی و هزینه.
  • MiMo-V2.6-Pro-UltraSpeed: نسخه‌ای تخصصی که خروجی را تا ۲۰ برابر سریع‌تر برای تولیدات با سرعت بالا ارائه می‌دهد.

طبق گزارش Artificial Analysis، شاخص هوش v4.3.2 ترکیبی از ۱۰ ارزیابی مختلف است. این ارزیابی‌ها شامل AA-Briefcase v1.1، GDPval-AA v2.1، AutomationBench-AA، Terminal-Bench 4.0، SciCode و Humanity’s Last Exam می‌شود. ارزیابی مدل Pro در این شاخص هزینه‌ای معادل ۲۰۶.۶۶ دلار داشته است که هزینه هر تک‌وظیفه (per-task) حدود ۰.۱۳ دلار برآورد می‌شود.

بر اساس مستندات فنی (Model Card)، چک‌پوینت Pro-RL از معماری ترکیب خبره‌ها (Sparse Mixture-of-Experts یا MoE) استفاده می‌کند — شبیه به تیمی از متخصصان که در هر لحظه فقط فرد مناسب برای پاسخ به سؤال فراخوانده می‌شود. این مدل در مجموع ۱.۰۲ تریلیون پارامتر دارد، اما برای هر توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — تنها ۴۲ میلیارد پارامتر فعال می‌شوند. این مدل از طول کانتکست ۱ میلیون توکن پشتیبانی می‌کند و به‌طور بومی قادر به پردازش ورودی‌های متنی، تصویری، ویدئویی و صوتی است. این قابلیت پردازش متون طولانی یادآور مدل Kimi K3 است که با پنجره متنی ۱ میلیون توکنی استانداردهای جدیدی را در پلتفرم‌های ابری تعریف کرد.

جزئیات فنی معماری این مدل نشان‌دهنده پیچیدگی بالای آن است:

  • ستون فقرات: یک ساختار ۷۰ لایه‌ای شامل ۶۰ لایه توجه پنجره‌ای لغزان (sliding-window attention) که با ۱۰ لایه توجه جهانی (global-attention) در هم تنیده شده‌اند.
  • خبره‌ها: ۳۸۴ خبره مسیری (routed experts) که در هر توکن، ۸ مورد از آن‌ها فعال هستند.
  • مدیریت وجه‌ها: یک ViT با ۶۸۱ میلیون پارامتر برای بینایی، یک AudioTokenizer با ۳۰۸ میلیون پارامتر و یک رمزگذار وصله صوتی (audio patch encoder) با ۱۲۷ میلیون پارامتر.
  • رمزگشایی: یک رمزگشای گمانه‌زنانه (speculative decoder) پنج‌لایه برای پیش‌بینی چند-توکنی که در هر گام پیشرو، ۷ توکن بعدی را پیش‌بینی می‌کند.

وزن‌های این مدل تحت لایسنس MIT منتشر شده‌اند که اجازه استفاده تجاری کامل را می‌دهد. وزن‌های نسخه‌های Pro-RL و Flash-RL در Hugging Face و ModelScope در دسترس هستند. شیائومی همچنین کد مربوط به RL، محیط‌های آموزشی و گزارش فنی کامل را به‌صورت متن‌باز منتشر کرده است.

در اقدامی کم‌سابقه برای شفافیت، شیائومی فرآیند یادگیری تقویتی (RL) — یعنی مرحله‌ای که مدل با دریافت پاداش، رفتارهای درست را یاد می‌گیرد — را به‌صورت زنده پخش کرد. طبق اعلام شرکت، آموزش مدل Pro در کمتر از ۶ روز با طی کردن ۳۰ گام RL روی ۷۵۰,۰۰۰ مسیر (trajectory) و با هزینه ۲.۶۲ میلیون دلار انجام شد. مدل Flash نیز مسیر مشابهی را با هزینه ۰.۸۵ میلیون دلار طی کرد. این فرآیند باعث شد امتیاز مدل در محک مهندسی نرم‌افزار DeepSWE v1.1 برای نسخه Pro از ۵۸.۴ به ۷۲.۵۷ و برای نسخه Flash از ۴۸.۸ به ۶۵.۶۸ برسد.

شیائومی برای مقیاس‌بندی محاسبات RL از سه محور اصلی استفاده کرد:

۱. معماری: یک ساختار کاملاً ناهمگام با ۱۵۶۸ نمونه در هر به‌روزرسانی، که در هر گام بین ۳.۵ تا ۳.۷ میلیارد توکن را آموزش می‌دهد.
۲. مجموعه وظایف: ترکیبی از وظایف چندگانه شامل کدنویسی، عامل‌های عمومی، وظایف بصری و سایبری.
۳. سیگنال‌های پاداش: افزایش محاسبات ارزیاب (grader compute) با استفاده از مقایسه نسبی درون گروه‌ها برای دستیابی به دقت بالاتر.

این سیستم از بهینه‌سازی سیاست تقریبی گروهی (GRPO) به‌صورت کاملاً ناهمگام با ۱۶ اجرای هر گام (rollouts per step) استفاده می‌کند. همچنین برای دستورالعمل‌های آفلاین از «سنتز پاداش گروهی» و برای رتبه‌بندی آنلاین از «توزیع مجدد مزیت گروهی» بهره می‌برد. پس از اجرای RL، یک مرحله تقطیر سیاست (distillation) چند-پیشوند و چند-معلم (MOPD2) انجام می‌شود که توسط دفاع‌های ضد-هک پاداش (reward-hacking)، شامل تشخیص ناهنجاری و تاییدکننده‌های متقاطع، پشتیبانی می‌شود.

داده‌های داخلی شیائومی نشان می‌دهد مدل Pro با امتیاز ۷۱.۹ در DeepSWE v1.1، کمی از Claude Opus 5 (۷۴.۰) و DeepSeek V4.1 Flash (۷۴.۲) عقب‌تر است، اما در محک‌های دیگر می‌درخشد. برای مثال، نسخه Flash در محک CyberGym امتیاز ۹۵.۱ را کسب کرد که به‌طور قابل‌توجهی از امتیاز ۸۴.۵ مدل GLM 5.3 بیشتر است. سایر نتایج مدل Pro شامل امتیاز ۱۶۷۳ در GDPVal 2.1 (پشت سر Claude Fable 5.1 با ۱۷۳۵)، امتیاز ۷۶.۹ در Toolathlon-verified، امتیاز ۵۳.۱ در Automation Bench v1.0.6 و امتیاز ۳۴.۹ در Terminal Bench 4.0 است.

از منظر بازار، این عرضه چالشی مستقیم برای قدرت قیمت‌گذاری آزمایشگاه‌های مدل‌های بسته است. شیائومی قیمت APIهای سری V2.5 را حفظ کرده است. هزینه هر میلیون توکن برای مدل Pro در حالت برخورد حافظه (cache-hit) ۰.۰۰۳۶ دلار، در حالت عدم برخورد ۰.۴۳۵ دلار و برای خروجی ۰.۸۷ دلار است. مدل Flash با قیمت‌های ۰.۰۰۲۸، ۰.۱۴ و ۰.۲۸ دلار عرضه شده و UltraSpeed هزینه‌های ۰.۰۳۶، ۴.۳۵ و ۸.۷۰ دلار را دارد. طبق اندازه‌گیری‌های Artificial Analysis، این مدل از طریق API توان عملیاتی ۱۲۹.۷ توکن در ثانیه و زمان ۲.۱۷ ثانیه برای اولین توکن (TTFT) را ارائه می‌دهد.

کاربردهای این مدل فراتر از بنچمارک‌هاست و در تحقیقات سطح بالا و هنرهای خلاقانه کاربرد دارد. شیائومی نمایش داد که این مدل می‌تواند چارچوب‌های فلزی-آلی برای جذب مواد شیمیایی PFAS طراحی کند یا یک اثبات رسمی ۶۰۰۰ خطی به زبان Lean 4 از قضیه «دوره سه به معنای هرج‌ومرج» (Li and Yorke) تولید کند که توسط هسته Lean تایید شده است. همچنین مدل یک اثر ارکسترال به نام «جاده شب» را تصنیف کرده و به‌طور مستقل آن را به فرمت MIDI تبدیل کرد. دموهای دیگر شامل مدل‌سازی سه‌بعدی در Blender، توسعه بازی‌های چند-عاملی و کنترل حلقه-بسته بازوی رباتیک Franka Panda بود.

این حرکت سیگنالی است که «جنگ هوش» دیگر تنها بر سر تعداد پارامترها نیست، بلکه بر سر کارایی RL و دسترسی به وزن‌های حاصل از آن است. این رویکرد بهینه‌سازی، مشابه استراتژی مدل ZGCM-1 بود که توانست با پارامترهای بسیار کمتر بر غول‌های حجیم پیروز شود. برای سازمان‌ها، توانایی میزبانی محلی مدلی با امتیاز هوش ۴۶ تحت لایسنس MIT، ریسک‌های وابستگی به تامین‌کننده را از بین می‌برد.

کاربران در حال حاضر می‌توانند از طریق AI Studio، MiMo Code، MiMo Desktop و OpenRouter به این مدل‌ها دسترسی داشته باشند. برنامه دسترسی زودهنگام UltraSpeed نیز طی هفته جاری به پایان می‌رسد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل‌های MiMo را از طریق OpenRouter یا Hugging Face تست کنید تا هزینه استنتاج خود را کاهش دهید.
  • برای پروژه‌هایی که نیاز به سرعت بسیار بالا دارند، نسخه UltraSpeed را در اولویت قرار دهید.
  • مستندات RL شیائومی را مطالعه کنید تا با نحوه مقیاس‌بندی پاداش‌ها در مدل‌های تریلیونی آشنا شوید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این عرضه با تکیه بر اعتبار بنچمارک‌های Artificial Analysis، ریسک وابستگی سازمان‌ها به مدل‌های بسته را به‌شدت کاهش می‌دهد. دسترسی به مدلی با امتیاز ۴۶ تحت لایسنس MIT، توازن قدرت را از شرکت‌های انحصاری به سمت توسعه‌دهندگان مستقل می‌برد.

تأثیر برای ایران

به‌دلیل وزن‌های باز و لایسنس MIT، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌صورت محلی (On-premises) میزبانی کنند و از محدودیت‌های API و تحریم‌های دسترسی به مدل‌های بسته عبور کنند.

·نگاه ما
تحریریه دات‌هوش

تسلط شیائومی بر یادگیری تقویتی (RL) نشان می‌دهد که جنگ هوش مصنوعی از مرحله «جمع‌آوری داده‌های بیشتر» به مرحله «بهینه‌سازی مسیر استدلال» رسیده است. انتشار کد RL و محیط‌های آموزشی در کنار وزن‌ها، یک حرکت استراتژیک برای تبدیل شدن به استاندارد جدید مدل‌های باز است. این یعنی دیگر فقط اندازه مدل مهم نیست، بلکه کیفیتِ نحوه یادگیری مدل است که برنده را تعیین می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.