یک مدل با ۳ میلیارد پارامتر اکنون میتواند در سطح ایمنی با غولهای ۲۰ میلیاردی رقابت کند. Mistral AI مدل Shieldstral 1.0 3B را منتشر کرد؛ یک طبقهبندیکننده ایمنی چندوجهی (Multimodal) با وزنهای باز (Open Weights) که اساس نظارت بر محتوا را تغییر میدهد و ایمنی را بهجای فهرستی از قوانین ایستا، به شکل یک پرسش پویا تعریف میکند. این دستاورد در راستای رقابت شدید مدلهای کوچک اما بهینه است، همانطور که مدل Shieldstral پیشتر توانست رقیبهایی با اندازه ۷ برابر خود را به چالش بکشد.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازیهای Mistral اشاره کردیم، این مدل روی یکی از بزرگترین نقاط ضعف استقرار هوش مصنوعی دست گذاشته است: صلبیت حفاظها (Guardrails). در اکثر مدلهای نظارتی، دستهبندیهای ایمنی مستقیماً در وزنهای مدل تثبیت شدهاند؛ به این معنا که ابزاری که برای یک آزمایشگاه امنیت سایبری طراحی شده، ممکن است برای یک اپلیکیشن سلامت روان بیش از حد سهلانگارانه باشد و تغییر این قوانین معمولاً نیازمند تنظیم دقیق (Fine-tuning) هزینهبر است.
Shieldstral این منطق را وارونه میکند. بهجای یک تاکسونومی ثابت، اپراتورها سیاست ایمنی را در زمان استنتاج (Inference) بهصورت یک پرسش به زبان ساده ارائه میدهند. سپس مدل در یک گذر پیشرو (Forward Pass)، یک امتیاز ایمنی کالیبره شده برمیگرداند. این سازوکار اجازه میدهد یک نقطه بازرسی (Checkpoint) واحد، سیاستهای کاملاً متفاوتی را برای کاربران یا مشتریان مختلف اجرا کند.
زمینهها و موارد کاربرد
به دلیل اشغال تنها ۱۶ گیگابایت حافظه ویدیویی (VRAM)، این مدل برای تیمهای کوچک توسعهدهنده در مراحل اولیه (Seed-stage) که نمیتوانند هزینههای قراردادهای گرانقیمت با تامینکنندگان نظارتی را توجیه کنند، بسیار در دسترس است. همزمان، مجوز باز و قابلیت میزبانی شخصی (Self-hosting)، آن را برای سازمانهای متوسط و بزرگی که به دلیل قوانین حاکمیتی، حسابرسی یا الزامات اقامت دادهها (Data-residency)، نیاز به اجرای حفاظها در محیط درونسازمانی (On-premises) یا داخل یک VPC دارند، ایدهآل میکند.
طبق مستندات، Shieldstral برای طیف گستردهای از صنایع طراحی شده است، از جمله:
- پلتفرمهای اجتماعی مصرفکننده و محتوای تولیدشده توسط کاربر (UGC)
- فناوریهای آموزشی (Ed-tech) و سطوح ایمنی کودکان
- اپلیکیشنهای بهداشت و سلامت روان
- اتوماسیون پشتیبانی در فینتک و بیمه
- بازیها و چتهای صوتی
- بازارهای آنلاین و بررسی محتوای تبلیغاتی و خلاقانه
- استقرار در بخشهای دولتی با الزامات حاکمیتی
مشخصات فنی و عملکرد
به نقل از گزارش فنی Marktechpost، این مدل بر پایه Ministral-3-3B-Base-2512 و با یک رمزگذار بینایی بومی Pixtral ساخته شده است. این مدل تحت مجوز Apache 2.0 منتشر شده که استفاده تجاری و غیرتجاری از آن را ممکن میسازد.
شاخصهای کلیدی عملکرد عبارتاند از:
- ایمنی متنی: کسب میانگین امتیاز F1 (F1 Score) ۸۴.۹٪ که با مدل بسیار بزرگتر GPT-OSS-Safeguard-20B برابری میکند. این مدل در محکهای ToxicChat (۸۴.۱)، HarmBench (۹۹.۴) و پاسخهای Aegis v2 (۸۷.۲) نتایج درخشانی داشت.
- ایمنی چندوجهی: کسب میانگین ۸۳.۸٪ که از مدلهایی مانند OmniGuard-7B (۷۷.۶٪)، VLGuard (۹۷.۷) و UnsafeBench (۸۱.۸) پیشی گرفت، هرچند LlavaGuard-7B همچنان در محک اختصاصی خود با ۸۱.۴٪ پیشتاز است.
- انعطافپذیری: کسب امتیاز ۹۱.۳٪ در یک محک تاکسونومی متغیر که شامل ۱۲ کلاس اصلی، ۲۶ زیرمجموعه و ۵۲ دستهبندی نهایی با ۹۰ پرسش ثابت بود.
- تشخیص امتناع: صحت کلی ۹۱.۵٪ در مقایسه با ۹۳.۷٪ برای مدل GPT-OSS-Safeguard-20B.
نظارت به مثابه یک پرسش دوگانه
Shieldstral فرآیند نظارت را به یک پرسش ساده «بله/خیر» تبدیل میکند. یک پیام سیستمی ثابت، وظیفه را تعریف میکند و پیام کاربر شامل سه بخش است: <Instruct> برای بستر ارزیابی و میزان سختگیری، <Query> برای سیاست ایمنی در قالب پرسش بله/خیر، و <Document> برای محتوای مورد بررسی (که میتواند یک پرامپت، یک پاسخ، جفتی از هر دو، یا تصویری همراه با متن باشد).
در زمان استنتاج، مدل تنها به سمت توکنهای «بله» و «خیر» بردار معنایی را باز میکند. این مقادیر از طریق سافتمکس (Softmax) به یک امتیاز پیوسته تبدیل میشوند که معمولاً با آستانه $\tau=0.5$ بررسی میشود. این مکانیزم، طبقهبندی پرامپت، نظارت بر پاسخ و تشخیص سمّیت را در یک مسئله واحد ادغام میکند. چون خروجی یک امتیاز پیوسته است و نه یک برچسب سخت، تیمها میتوانند آستانه را برای هر سطح یا رابط کاربری تغییر دهند یا امتیازهای مرزی را به بازبینی انسانی ارجاع دهند.
دستور پخت دادهها
کارایی این مدل حاصل یک مجموعه داده عظیم شامل ۵۴.۱ میلیون نمونه است؛ از جمله ۴۵.۲ میلیون نمونه متنی متنباز، ۴.۴ میلیون نمونه متنی ترکیبی مصنوعی و ۴.۵ میلیون نمونه چندوجهی. یک لایه یکپارچهساز مبتنی بر قالب، این دادهها را از طریق پردازشگرهای مخصوص هر مجموعه داده با عبارتبندیهای تصادفی و سختگیری کالیبره شده تبدیل میکند.
Mistral از تکنیکی به نام «تولید متضاد» (Contrastive Generation) استفاده کرد؛ جایی که یک مدل زبانی متنی ایمن را به نسخههای غیرایمن بازنویسی میکند تا دقیقاً یک دسته خاص از قوانین را نقض کند بدون اینکه به طور عمدی سایر قوانین همرده را نقض نماید. این روش به مدل میآموزد که دقیقاً کدام سیاست نقض شده است، بهجای اینکه صرفاً محتوا را به دو دسته کلی «ایمن» و «ناایمن» تقسیم کند.
برای دادههای تصویری، Mistral مجموعه دادهها را با مجموعههای تصاویر عمومی به عنوان نمونههای منفی، تغییرات پرسش در یک تاکسونومی بصری ۱۴ دستهای و فیلتر کردن از طریق بازرتبهبندی بینایی-زبانی (Vision-Language Reranker) تقویت کرد. مدل نهایی از طریق لورا (LoRA) و یک ادغام سه-طرفه SLERP تولید شده است: ۰.۶ دادههای عمومی و تولیدشده، ۰.۳ دادههای صرفاً عمومی، و ۰.۱ مدل Ministral-3B-Instruct.
استقرار و زیرساخت
Shieldstral برای استقرار محلی طراحی شده و در فرمت BF16 در ۱۶ گیگابایت VRAM جای میگیرد. مسیرهای سرویسدهی پشتیبانی شده عبارتاند از:
- vLLM: نسخه ۰.۲۶.۰ یا بالاتر (پیشنهادی)
- llama.cpp: از طریق تبدیل GGUF با کوانتشهای Q8_0، Q5_K_M یا Q4_K_M
- SGLang و Transformers
- Axolotl: برای تنظیم دقیق (Fine-tuning)
از آنجا که مدل تنها یک توکن تولید میکند، تأخیر و هزینههای عملیاتی آن بهمراتب کمتر از حفاظهای مبتنی بر استدلال است. این ویژگی آن را برای گیتهای بلادرنگ در خطلولههای عاملمحور (Agentic)، نظارت بر پرامپتهای کاربر و پاکسازی مجموعههای داده تولید بازیابیافزا (RAG) ایدهآل میکند. این رویکرد کاهش هزینههای عملیاتی با استراتژیهای دیگر شرکتهای بزرگ همسو است؛ برای مثال مایکروسافت نیز اخیراً با مدلهای فشرده خود به بهینهسازی چشمگیر وظایف امنیتی دست یافته است.
تحلیل تحلیلی
این تغییر به سمت «سیاست به مثابه پرامپت»، ایمنی را از یک مسئله در زمان آموزش به یک پیکربندی در زمان استنتاج تبدیل میکند. برای جامعه فنی، این موضوع این فرض را میشکند که دقت بالا در ایمنی نیازمند تعداد پارامترهای عظیم یا برچسبهای دستهبندی صلب است. در واقع، این مدل طبقهبندیکننده ایمنی را از یک فیلتر ایستا به یک ابزار کاربردی و منعطف تبدیل میکند.
تامینکنندگان SaaS چندمستاجری (Multi-tenant) بیشترین سود را از این قابلیت میبرند. آنها اکنون میتوانند «سطوح ایمنی سفارشی» به مشتریان مختلف ارائه دهند در حالی که از یک نمونه مدل واحد استفاده میکنند؛ تنها با تغییر فیلد <Query> در پرامپت. با این حال، مدل بدون نقص نیست؛ Mistral اشاره میکند که قابلیت اطمینان در اسناد بسیار طولانی، ورودیهای متخاصم مبهم (Obfuscated) و زبانهای کممنبع مانند عربی و اندونزیایی کاهش مییابد (جایی که در پرامپتهای RTP-LX از Nemotron-3.5-Safety-4B عقبتر است).
توسعهدهندگان اکنون باید ارزیابی کنند که آیا پشته نظارتی فعلی آنها بیش از حد تامین شده است یا خیر. انتقال به یک مدل 3B که عملکرد مدل 20B را دارد، میتواند هزینههای محاسباتی خطلولههای عاملمحور و پاکسازی RAG را به شدت کاهش دهد. پنجره متنی آموزش دیده این مدل ۳۲ هزار توکن در ۱۲ زبان است.
برای شروع، میتوانید وزنهای مدل را در Hugging Face بیابید و مقاله فنی کامل را برای کالیبره کردن آستانههای ایمنی خاص خود مطالعه کنید.
گام بعدی شما
- اگر از مدلهای نظارتی ابری گرانقیمت استفاده میکنید، وزنهای Shieldstral را از Hugging Face دریافت کرده و هزینه استنتاج خود را بسنجید.
- برای کاهش نرخ خطای مدل در زبانهای کممنبع، از ترکیب این مدل با یک لایه بازبینی انسانی برای امتیازهای مرزی (بین ۰.۳ تا ۰.۷) استفاده کنید.
- در خطلولههای RAG، از این مدل برای فیلتر کردن اسناد غیرایمن پیش از ورود به پنجره متنی مدل اصلی استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو