پرش به محتوای اصلی
پرش به محتوای مقاله

کوانتش رسمی Mistral در برابر نسخه‌های شخص ثالث برای مدل ۱۱۹//B

·۲ مهر ۱۴۰۵۱ دقیقه مطالعه
وزن‌های باز ۱۱۹ میلیارد پارامتری اکنون در ۶۶ گیگابایت جا می‌شوند
وزن‌های باز ۱۱۹ میلیارد پارامتری اکنون در ۶۶ گیگابایت جا می‌شوند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه رسمی نقطه بازرسی NVFP4 توسط سازنده مدل؛ این اولین بار است که یک مدل ۱۱۹ میلیاردی با این سطح از بهینه‌سازی حافظه (۶۶ گیگابایت) به‌صورت رسمی و استاندارد عرضه می‌شود تا جایگزین نسخه‌های غیررسمی شخص ثالث شود.

برای اجرای مدل ۱۱۹ میلیاردی Mistral Small 4، دیگر نیازی به سخت‌افزارهای فوق‌سنگین نیست و ۶۶ گیگابایت حافظه VRAM کفایت می‌کند. این بهینه‌سازی به لطف انتشار یک نقطه بازرسی (Checkpoint) رسمی با فرمت NVFP4 محقق شده است.

کوانتش (Quantization) — فرآیند کاهش دقت وزن‌های مدل برای اشغال فضای کمتر در حافظه — اکنون به یک ضرورت تبدیل شده است، زیرا مدل‌ها به سمت صدها میلیارد پارامتر حرکت می‌کنند. طبق اعلام Mistral AI، مدل پایه در ۱۶ مارس ۲۰۲۶ عرضه شد، اما انتشار نسخه NVFP4 اکنون راهی استاندارد برای استقرار این مدل در مقیاس صنعتی فراهم می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره امنیت و پایداری مدل‌های بازمتن اشاره کردیم، منشأ وزن‌های مدل در عملکرد نهایی تأثیر مستقیم دارد. بر اساس تحلیل فنی منتشر شده در dev.to، این نقطه بازرسی رسمی با نام mistralai/Mistral-Small-4-119B-2603-NVFP4 از طریق ابزار llm-compressor و با همکاری vLLM و Red Hat توسعه یافته است.

جزئیات فنی این نسخه عبارت است از:

  • تعداد پارامترها: ۱۱۹ میلیارد
  • اشغال حافظه: تقریباً ۶۶ گیگابایت
  • ابزار توسعه: llm-compressor
  • زمان اوج فعالیت: سپتامبر ۲۰۲۶

این انتشار یک هشدار جدی درباره زنجیره تأمین هوش مصنوعی است. به گزارش منابع فنی، بسیاری از نسخه‌های NVFP4 برای مدل‌های دیگر (مانند Qwen3.8-27B) توسط شخص ثالث‌هایی مثل RadixArk یا QUASAR-QAT ارائه می‌شوند، نه سازندگان اصلی. از آنجا که دستورالعمل‌های مختلف کوانتش، خروجی‌های متفاوتی تولید می‌کنند، استفاده از وزن‌های غیررسمی می‌تواند منجر به افت پیش‌بینی‌ناپذیر در عملکرد مدل شود.

برای جامعه فنی، این اتفاق تمرکز را از «اندازه مدل» به «قابلیت اطمینان خط لوله کوانتش» تغییر می‌دهد. عرضه وزن‌های فشرده توسط خود Mistral نشان می‌دهد که نسخه‌های «آگاه از کوانتش» (Quantization-aware) در حال تبدیل شدن به استاندارد مدل‌های بازمتن برای محیط‌های عملیاتی هستند. این رویکرد بهینه‌سازی برای جایگزینی مدل‌های سنگین با نسخه‌های سریع‌تر شباهت دارد، مشابه آنچه در جایگزینی مدل V4-Pro با نسخه Flash در خانواده دیپ‌سیک برای دستیابی به کارایی بالاتر مشاهده شد.

گام بعدی شما

  • پیش از استقرار مدل‌ها در محیط تولید، منشأ نقطه بازرسی‌ها را در Hugging Face Hub بررسی کنید.
  • منتظر انتشار نسخه‌های رسمی NVFP4 از سایر آزمایشگاه‌های بزرگ باشید تا استاندارد شدن این فرمت برای مدل‌های بالای ۱۰۰ میلیارد پارامتر تأیید شود.
  • اثر این کاهش حافظه بر نرخ استنتاج (Inference) را در سخت‌افزارهای لبه بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار فنی Mistral و همکاری Red Hat، دسترسی به مدل‌های ۱۰۰ میلیاردی را برای سازمان‌هایی که محدودیت سخت‌افزاری دارند تسهیل می‌کند. در واقع، استانداردهای استقرار مدل‌های بزرگ از نسخه‌های آماتور به سمت نسخه‌های رسمی و تأییدشده حرکت می‌کند.

تأثیر برای ایران

این بهینه‌سازی امکان اجرای مدل‌های بسیار قدرتمند را روی سخت‌افزارهای در دسترس‌تر فراهم می‌کند که برای توسعه‌دهندگان ایرانی با محدودیت بودجه خرید GPUهای صنعتی، فرصتی برای میزبانی شخصی (Self-hosting) مدل‌های ۱۰۰ میلیاردی است.

·نگاه ما
تحریریه دات‌هوش

انتقال مسئولیت کوانتش از جامعه متن‌باز به خود سازندگان مدل، نشان‌دهنده بلوغ اکوسیستم استقرار است. این رویکرد ریسک «تخریب مدل» در اثر فشرده‌سازی‌های غیربهینه را حذف می‌کند و مرز میان مدل‌های تحقیقاتی و مدل‌های آماده برای تولید (Production-ready) را شفاف‌تر می‌سازد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.