پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Shieldstral میسترال با ۳ میلیارد پارامتر رقیب‌های ۷ برابری خود را شکست داد

·۱۴ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
لوگوی میسترال و نمودار عملکرد مدل Leanstral 1.5 در بنچمارک‌های ریاضی رسمی
لوگوی میسترال و نمودار عملکرد مدل Leanstral 1.5 در بنچمارک‌های ریاضی رسمی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی دسته‌بندی‌های ثابت (Taxonomies) با مدل پرسش-پاسخ در زمان اجرا؛ این یعنی اپراتور می‌تواند بدون نیاز به آموزش مجدد (Retraining)، قوانین ایمنی را با زبان ساده تغییر دهد.

اگر امروز برای سیستم‌های نظارت بر محتوا هزینه‌های پردازشی سنگینی می‌پردازید، یک مدل ۳ میلیارد پارامتری می‌تواند تمام این معادله را تغییر دهد. طبق اعلام شرکت میسترال (Mistral)، مدل جدید این شرکت در سنجش‌های ایمنی با مدل‌هایی که هفت برابر بزرگ‌تر از آن هستند، رقابت می‌کند. در ۵ اوت ۲۰۲۶، میسترال از Shieldstral پرده برداشت؛ یک طبقه‌بندی‌کننده چندوجهی (Multimodal) — شبیه به یک ناظر تیزبین که هم متن و هم تصویر را می‌بیند تا تخلفات را پیدا کند — با وزن‌های باز (Open Weights) که دسته‌بندی‌های صلب ایمنی را با پرسش‌های منعطف و به زبان ساده جایگزین کرده است.

مدل متن‌باز Shieldstral میسترال با حجمی بسیار کمتر، عملکردی مشابه مدل‌های ایمنی بزرگ‌تر دارد.

این عرضه در ادامه استراتژی توسعه مدل‌های باز میسترال است؛ همان‌طور که در تحلیل قبلی ما درباره ارزش‌گذاری ۲۳ میلیارد دلاری این شرکت اشاره کردیم، میسترال به دنبال تسخره بازار مدل‌های بهینه است. این رویکرد با روندی همسو است که در آن مدل‌های وزن‌باز با سرعتی خیره‌کننده به سطح توانمندی‌های مدل‌های پیشرو رسیده‌اند. در چشم‌انداز فعلی هوش مصنوعی، فیلترهای ایمنی مانند حفاظ‌ها (Guardrails) عمل می‌کنند که هم ورودی‌های کاربر (Prompts) و هم پاسخ‌های مدل را غربال می‌کنند. اما مشکل اینجاست که اکثر این فیلترها از تاکسونومی‌ها و دسته‌بندی‌های ثابتی استفاده می‌کنند که در تطبیق با کاربردهای مختلف شکست می‌خورند؛ برای مثال، اصطلاحی که در یک ابزار امنیت سایبری کاملاً پذیرفته شده و عادی است، ممکن است در یک پلتفرم سلامت روان به عنوان محتوای «مخرب» شناسایی و مسدود شود.

مشکل دسته‌بندی‌های صلب

گیوم لمپل، یکی از بنیان‌گذاران میسترال، و تیم تحقیقاتی این شرکت به دو مشکل اساسی در رویکردهای سنتی اشاره می‌کنند. نخست اینکه مجموعه‌داده‌های ایمنی عمومی چنان تفاوت‌های ساختاری دارند که نمی‌توان یک تاکسونومی واحد و جهانی را برای همه آن‌ها تعریف کرد. دوم اینکه قوانین ثابت نمی‌توانند تفاوت‌های ظریف و معنایی هر کاربرد خاص را درک کنند. این صلبیت ساختاری اغلب منجر به فقدان انعطاف‌پذیری در محیط‌های مختلف استقرار مدل می‌شود. در واقع، تکیه بیش از حد بر همین فیلترهای سخت‌گیرانه در مدل‌های پیشین، عامل اصلی تولید توهمات مودبانه در پاسخ‌های هوش مصنوعی بوده است.

مدل Shieldstral این مشکل را با تبدیل نظارت بر محتوا به یک تکلیف «پرسش‌وپاسخ» (Question-Answering) حل می‌کند. به جای اینکه مدل سعی کند محتوا را در دسته‌های پیش‌فرض و از پیش تعریف شده بچپاند، اپراتور یک سوال مشخص می‌پرسد؛ مثلاً: «آیا این محتوا خشونت را ترویج می‌کند؟». مدل تنها یک توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد — با مقدار «بله» یا «خیر» برمی‌گرداند. سپس مدل از احتمال مربوط به این پاسخ برای تولید یک امتیاز ایمنی بین صفر و یک استفاده می‌کند.

مدل باز Shieldstral میسترال با حجم بسیار کمتر، عملکردی مشابه مدل‌های ایمنی بزرگ‌تر دارد.

برای رسیدن به این سطح از سازگاری، محققان میسترال از یک مجموعه‌داده عظیم شامل ۵۴.۱ میلیون نمونه استفاده کردند که طیف گسترده‌ای از موارد ایمنی، محتویات مخرب و تلاش‌های مربوط به دست‌کاری مدل (Manipulation) را پوشش می‌داد. آن‌ها استانداردهای طبقه‌بندی شده‌ای را بر این داده‌ها اعمال کردند: استانداردهای سخت‌گیرانه برای دست‌کاری‌های هدفمند، استانداردهای متوسط برای داده‌های ایمنی عمومی و استانداردهای سهل‌گیرانه برای کیفیت پاسخ‌ها. هر نمونه آموزشی در این مجموعه شامل دستورالعمل تکلیف، یک سوال بله/خیر مشخص و محتوایی است که باید بررسی شود.

داده‌های مصنوعی و سازوکار فنی

تیم میسترال برای آموزش دقیق‌تر و ایجاد تمایزهای ظریف، از یک مدل زبانی دیگر برای تولید داده‌های مصنوعی استفاده کرد. این مدل متون ایمن را به نسخه‌های غیرایمن بازنویسی کرد تا مدل Shieldstral بتواند تفاوت‌های بسیار ریز بین محتوای مجاز و غیرمجاز را بیاموزد.

  • یادگیری تقابلی (Contrastive Learning): در این روش، هر نمونه آموزشی شامل یک دسته‌بندی مشابه اما متفاوت بود که مدل مجبور بود آن را رد کند. این فرآیند باعث شد Shieldstral به جای قضاوت‌های کلی و خشن، بیاموزد که قوانین نزدیک به هم را از یکدیگر جدا کند.
  • آزمون سازگاری: محققان دسته‌های آزمایشی را به‌طور کاملاً جدا از مجموعه آموزشی ساختند. هیچ‌کدام از دسته‌بندی‌های ریزدانه در مرحله تست، مستقیماً با دسته‌های آموزشی مطابقت نداشتند، اگرچه ۱۰ مورد از ۱۲ کلاس گسترده‌تر، معادل‌های تقریبی در داده‌های آموزشی داشتند.
  • نتیجه: بر اساس مستندات فنی، استفاده از این داده‌های مصنوعی در دسته‌های ریزدانه باعث شد امتیاز F1 (F1 Score) مدل ۲۳.۳ درصد افزایش یابد و این مورد عامل اصلی سازگاری بالای مدل باشد.

بنچمارک‌های عملکرد

  • ایمنی متنی: Shieldstral به امتیاز F1 معادل ۸۴.۹٪ رسید و طبق مقاله تحقیقاتی، با مدل GPT-OSS-Safeguard-20B متعلق به OpenAI برابری کرد و مدل‌هایی مثل Qwen3Guard-8B (۸۴٪)، Nemotron-3.5-Safety-4B (۸۳.۳٪) و LlamaGuard-4-12B (۶۹.۱٪) را شکست داد.
  • ایمنی چندوجهی: در طبقه‌بندی ترکیبی تصویر و متن، این مدل با امتیاز ۸۳.۸٪، مدل‌های OmniGuard-7B (۷۷.۶٪) و LlavaGuard-7B (۷۱.۶٪) را پیشی گرفت.
  • کارایی: این مدل بر پایه Ministral-3B و رمزگذار بصری Pixtral ساخته شده و می‌تواند روی یک تک GPU انویدیا با ۱۶ گیگابایت حافظه اجرا شود.

مدل باز Shieldstral میسترال با حجم بسیار کمتر، عملکردی مشابه مدل‌های ایمنی بزرگ‌تر دارد.

اگرچه مدل GPT-OSS-Safeguard-20B در بنچمارک سازگاری پیشتاز است (۹۴.۱٪ در مقابل ۹۱.۳٪)، اما میسترال استدلال می‌کند که Shieldstral در عمل کاربردی‌تر است. در مورد سیاست‌هایی که در داده‌های آموزشی نبوده‌اند، Shieldstral از مدل‌هایی که «استدلال میانی» تولید می‌کنند عقب می‌ماند. با این حال، مدل‌های GPT-OSS-Safeguard-20B و Nemotron-3.5-Safety زنجیره‌های استدلالی طولانی می‌سازند که هزینه‌های پردازشی (Compute) را به‌شدت افزایش می‌دهد. در مقابل، Shieldstral با یک پاسخ تک‌کلمه‌ای مستقیم، تأخیر (Latency) و هزینه هر درخواستی که از فیلتر می‌گذرد را کاهش می‌دهد.

مدل باز Shieldstral میسترال با حجم بسیار کمتر، عملکردی مشابه مدل‌های ایمنی بزرگ‌تر دارد.

این تغییر به سمت قوانین تعریف‌شده در زمان اجرا (Runtime)، یک نقطه درد حیاتی برای شرکت‌هاست. فیلترهای بدتنظیم اغلب منجر به «بیش‌بستنی» (Over-blocking) می‌شوند. برای مثال، بررسی‌های Artificial Analysis نشان داد که مدل Claude Fable 5 به دلیل مشکلات فیلتر، به‌طور خودکار ۸ تا ۹ درصد از تکالیف را به یک مدل ضعیفع‌تر ارجاع می‌داد. یک فیزیکدان پزشکی گزارش داد که Fable 5 برای او غیرقابل استفاده بود زیرا واژه «nuclear» (هسته‌ای) را به عنوان تخلف شناسایی می‌کرد و تحلیل‌های MRI او به عنوان «بیوتروریسم» مسدود می‌شد. شرکت Anthropic بعداً فیلترها را سخت‌گیرانه‌تر کرد که باعث شد حتی تکالیف برنامه‌نویسی بی‌ضرر نیز مسدود شوند.

طبق گزارش‌های صنعتی، طبقه‌بندی‌کننده‌ها اکنون ستون فقرات زیرساخت AI هستند. OpenAI در حال حاضر از آن‌ها برای تشخیص خودکار سن در ChatGPT و هدایت درخواست‌های احساسی به مدل‌های سخت‌گیرانه‌تر استفاده می‌کند. Claude Code نیز از یک طبقه‌بندی‌کننده برای مسدود کردن استقرارهای محیط تولید (Production)، فورس‌پوش‌ها (Force Pushes) و اسکریپت‌های خارجی بهره می‌برد. با این حال، این سیستم‌ها بار مدیریتی سنگینی دارند؛ مثلاً در Fable 5، ورودی‌ها و خروجی‌ها باید تا ۳۰ روز و در صورت وقوع تخلف تا ۲ سال ذخیره شوند.

میسترال با دادن کنترل معیارها به اپراتور در لحظه استنتاج (Inference)، به شرکت‌ها اجازه می‌دهد بررسیات ایمنی را با بستر دقیق برنامه خود تطبیق دهند. این کار از خطاهای پرهزینه فیلترینگ که کاربران را به مدل‌های ضعیف‌تر می‌راند یا کارهای تخصصی و قانونی را مسدود می‌کند، جلوگیری می‌کند.

مدل Shieldstral اکنون تحت لایسنس Apache 2.0 در دسترس است و روند انتشار ابزارهای ایمنی سطح-بالا و انتخابی (A-la-carte) را برای جامعه متن‌باز تقویت می‌کند.

گام بعدی شما

  • بررسی کنید آیا دسته‌بندی‌های ایمنی فعلی شما در دامنه‌های تخصصی باعث ایجاد مثبت-کاذب (False Positive) می‌شوند یا خیر.
  • اگر هزینه استنتاج فیلترهای ایمنی شما بالاست، Shieldstral را به دلیل خروجی تک‌توکنی جایگزین مدل‌های استدلالی کنید.
  • برای کاهش نرخ Over-blocking، قوانین ایمنی خود را از حالت دسته‌بندی ثابت به حالت پرسش-پاسخ تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره تراشه‌های Blackwell برای بهینه‌سازی استنتاج مدل‌های کوچک مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص میسترال در بهینه‌سازی پارامترها، هزینه و تأخیر سیستم‌های نظارتی را به‌شدت کاهش می‌دهد. اعتبار این مدل در برابری با استانداردهای OpenAI، مسیر را برای استقرار سریع‌تر و ارزان‌تر حفاظ‌های ایمنی در لبه شبکه (Edge) هموار می‌کند.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights) و نیاز کم به حافظه (۱۶ گیگابایت VRAM)، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌راحتی روی سخت‌افزارهای داخلی میزبانی کنند و بدون نیاز به APIهای تحریمی، لایه‌های نظارتی دقیق برای محصولات خود بسازند.

·نگاه ما
تحریریه دات‌هوش

ثبات عملکرد یک مدل ۳ میلیارد پارامتری در برابر مدل‌های ۲۰ میلیارد پارامتری نشان می‌دهد که در حوزه ایمنی، کیفیت داده‌های آموزشی (به‌ویژه داده‌های تقابلی) بسیار تعیین‌کننده‌تر از اندازه مدل است. میسترال با حذف استدلال‌های میانی در فیلترها، عملاً «مالیات محاسباتی» نظارت بر محتوا را برای سازمان‌ها کاهش داده است. این رویکرد احتمالاً باعث می‌شود شرکت‌ها به جای یک فیلتر غول‌پیکر، از مجموعه‌ای از مدل‌های کوچک و تخصصی برای لایه‌های ایمنی استفاده کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.