برای اجرای مدل ۱۱۹ میلیاردی Mistral Small 4، دیگر نیازی به سختافزارهای فوقسنگین نیست و ۶۶ گیگابایت حافظه VRAM کفایت میکند. این بهینهسازی به لطف انتشار یک نقطه بازرسی (Checkpoint) رسمی با فرمت NVFP4 محقق شده است.
کوانتش (Quantization) — فرآیند کاهش دقت وزنهای مدل برای اشغال فضای کمتر در حافظه — اکنون به یک ضرورت تبدیل شده است، زیرا مدلها به سمت صدها میلیارد پارامتر حرکت میکنند. طبق اعلام Mistral AI، مدل پایه در ۱۶ مارس ۲۰۲۶ عرضه شد، اما انتشار نسخه NVFP4 اکنون راهی استاندارد برای استقرار این مدل در مقیاس صنعتی فراهم میکند.
همانطور که در تحلیلهای پیشین ما درباره امنیت و پایداری مدلهای بازمتن اشاره کردیم، منشأ وزنهای مدل در عملکرد نهایی تأثیر مستقیم دارد. بر اساس تحلیل فنی منتشر شده در dev.to، این نقطه بازرسی رسمی با نام mistralai/Mistral-Small-4-119B-2603-NVFP4 از طریق ابزار llm-compressor و با همکاری vLLM و Red Hat توسعه یافته است.
جزئیات فنی این نسخه عبارت است از:
- تعداد پارامترها: ۱۱۹ میلیارد
- اشغال حافظه: تقریباً ۶۶ گیگابایت
- ابزار توسعه: llm-compressor
- زمان اوج فعالیت: سپتامبر ۲۰۲۶
این انتشار یک هشدار جدی درباره زنجیره تأمین هوش مصنوعی است. به گزارش منابع فنی، بسیاری از نسخههای NVFP4 برای مدلهای دیگر (مانند Qwen3.8-27B) توسط شخص ثالثهایی مثل RadixArk یا QUASAR-QAT ارائه میشوند، نه سازندگان اصلی. از آنجا که دستورالعملهای مختلف کوانتش، خروجیهای متفاوتی تولید میکنند، استفاده از وزنهای غیررسمی میتواند منجر به افت پیشبینیناپذیر در عملکرد مدل شود.
برای جامعه فنی، این اتفاق تمرکز را از «اندازه مدل» به «قابلیت اطمینان خط لوله کوانتش» تغییر میدهد. عرضه وزنهای فشرده توسط خود Mistral نشان میدهد که نسخههای «آگاه از کوانتش» (Quantization-aware) در حال تبدیل شدن به استاندارد مدلهای بازمتن برای محیطهای عملیاتی هستند. این رویکرد بهینهسازی برای جایگزینی مدلهای سنگین با نسخههای سریعتر شباهت دارد، مشابه آنچه در جایگزینی مدل V4-Pro با نسخه Flash در خانواده دیپسیک برای دستیابی به کارایی بالاتر مشاهده شد.
گام بعدی شما
- پیش از استقرار مدلها در محیط تولید، منشأ نقطه بازرسیها را در Hugging Face Hub بررسی کنید.
- منتظر انتشار نسخههای رسمی NVFP4 از سایر آزمایشگاههای بزرگ باشید تا استاندارد شدن این فرمت برای مدلهای بالای ۱۰۰ میلیارد پارامتر تأیید شود.
- اثر این کاهش حافظه بر نرخ استنتاج (Inference) را در سختافزارهای لبه بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو