پرش به محتوای اصلی
پرش به محتوای مقاله

۴۵٪ از مدل‌های هوش مصنوعی در آزمون ایمنی VIDRAFT شکست خوردند

·۱۰ مهر ۱۴۰۵۴ دقیقه مطالعه
پلتفرم تشخیص ایمنی هوش مصنوعی AX-RAY شرکت ویدرافت، گواهی «مؤسسه تحقیقاتی» مدل‌اسکوپ علی‌بابا را دریافت کرد.
پلتفرم تشخیص ایمنی هوش مصنوعی AX-RAY شرکت ویدرافت، گواهی «مؤسسه تحقیقاتی» مدل‌اسکوپ علی‌بابا را دریافت کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی اولین چارچوب ممیزی (AX-RAY) که نمرات فنی مدل‌ها را مستقیماً به مواد قانونی و رگولاتوری تبدیل می‌کند، به‌جای استفاده از معیارهای انتزاعی آکادمیک.

اگر امروز یک مدل زبانی کوچک را برای اتوماسیون کسب‌وکارتان به کار می‌گیرید، احتمالاً با بمبی ساعتی از نظر قانونی طرف هستید. طبق گزارش تشخیصی منتشرشده در ۲ اکتبر ۲۰۲۶، تقریباً نیمی از مدل‌های مورد آزمایش در ممیزی‌های ایمنی شکست خورده‌اند. این نتایج نشان می‌دهد که فشار صنعت برای حرکت به سمت مدل‌های کوچک‌تر و عامل‌محور (Agentic)، بسیار سریع‌تر از توسعه نرده‌های حفاظتی و ایمنی لازم پیش رفته است.

این بحران ایمنی درست زمانی رخ می‌دهد که رگولاتورهای جهانی سخت‌گیری‌های خود را افزایش داده‌اند. در حالی که اکثر محک‌ها بر توانایی استدلال یا کدنویسی تمرکز دارند، صنعت راه استانداردی برای اثبات عدم تخلف مدل از قوانین خاص ندارد. تصور کنید بخواهید ماشینی را بفروشید که سریع و بهینه است، اما هیچ گواهی تست تصادف برای جاده‌های خاصی که قرار است در آن رانندگی کند، ندارد؛ وضعیت فعلی انطباق مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — دقیقاً همین است.

زمینه: چشم‌انداز رگولاتوری

برای حل این مشکل، شرکت VIDRAFT چارچوب تشخیصی AX-RAY را توسعه داد. برخلاف محک‌های آکادمیک، AX-RAY تعداد ۱۱۷ مورد ریسک را با ۹ چارچوب رگولاتوری بین‌المللی تطبیق می‌دهد. این استانداردها شامل قانون هوش مصنوعی اتحادیه اروپا (EU AI Act)، GDPR، چارچوب مدیریت ریسک NIST آمریکا (AI RMF)، استاندارد ISO/IEC 42001 و قوانین داخلی کره جنوبی است.

در این سامانه، به مدل‌ها بر اساس پروفایل ریسکشان نمره‌ای از A تا F اختصاص می‌یابد. این خروجی نمره‌گذاری شده، یک امتیاز ایمنی قابل‌فهم برای انسان ایجاد می‌کند که می‌توان آن را به مستندات قانونی پیوست کرد. این قابلیت برای تیم‌هایی که در حال آماده‌سازی ارزیابی‌های انطباق با EU AI Act یا پروفایل‌های NIST AI RMF هستند، بسیار کاربردی و عملی است.

جزئیات: سازوکار AX-RAY

به نقل از مستندات فنی AX-RAY، این ابزار به جای یک تکلیف واحد، به عنوان یک چارچوب ممیزی ساختاریافته عمل می‌کند. سازوکار آن شامل موارد زیر است:

  • ساخت تاکسونومی ریسک: استخراج ۱۱۷ مورد ریسک از طریق نقشه‌برداری متقاطع ۹ استاندارد بین‌المللی. این ساختار اجازه می‌دهد با یک بار اجرای تشخیصی، مستندات انطباق برای چندین حوزه قضایی به‌طور هم‌زمان تولید شود.
  • ارزیابی چندگانه: بررسی مدل‌ها در ۱۲ دسته از نگرانی‌های ایمنی. این دسته‌ها حوزه‌هایی چون رفتار عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیارهای دیجیتالی که می‌توانند به‌جای شما تصمیم بگیرند و ابزارها را اجرا کنند — تولید محتوای مضر و حالت‌های شکست مخصوص مدل‌های کوچک را پوشش می‌دهند.
  • خروجی نمره‌گذاری شده: سیستم A-F که یک تعیین ریسک شفاف ارائه می‌دهد و مستقیماً به ابزارهای قانونی متصل می‌شود؛ ویژگی‌ای که در اکثر محک‌های آکادمیک مثل MT-Bench یا HELM وجود ندارد.

داده‌های شکست

بر اساس گزارش VIDRAFT، ارزیابی ۴۰ مدل عمومی (شامل مدل‌های داخلی کره و بین‌المللی) نتایج هشداردهنده‌ای داشت:

  • شکست کلی: ۱۸ مدل از ۴۰ مورد (۴۵٪) نمره F، یعنی پایین‌ترین امتیاز ممکن را دریافت کردند.
  • ریسک عامل‌محور: ۹۲٪ از مدل‌ها (۲۳ مورد از ۲۵ مدل بررسی شده) سیگنال‌های ریسک شناسایی شده در دسته «ایمنی عامل‌های هوش مصنوعی» نشان دادند.
  • فروپاشی مدل‌های کوچک: تمام مدل‌های با پارامترهای کمتر از ۴ میلیارد (در مجموع ۱۲ مدل)، نمره ریسک گرفتند که به معنای نرخ شکست ۱۰۰٪ در این گروه است.

ادغام در اکوسیستم

در لایه اکوسیستم، VIDRAFT نخستین سازمان کره‌ای است که گواهینامه «مؤسسه پژوهشی» را از ModelScope علی‌بابا دریافت کرده است. این پلتفرم که توسط علی‌بابا و فدراسیون کامپیوتر چین (CCF) تأسیس شده، بزرگ‌ترین توزیع‌کننده هوش مصنوعی چین با بیش از ۱۴۰ هزار مدل و ۲۰ میلیون کاربر است.

این گواهینامه آن‌ها را در کنار آزمایشگاه‌های نخبه‌ای مثل Qwen، Shanghai AI Lab و Z.ai (Zhipu AI) قرار می‌دهد. نکته قابل توجه این است که سازمان‌های بزرگی مثل گوگل، متا و DeepSeek با وجود حضور در این پلتفرم، این نشان گواهینامه خاص را ندارند. VIDRAFT این تمایز را تقریباً هفت ماه پس از افتتاح صفحه سازمان خود (FINAL-Bench) در فوریه ۲۰۲۶ به دست آورد. این پیشرفت در جایگاه علمی، در کنار تلاش‌های عملیاتی شرکت برای بهینه‌سازی زیرساخت‌هاست؛ به‌طوری که این شرکت پیش‌تر توانسته بود بهره‌وری استنتاج مدل‌های درون‌سازمانی را به شکل چشم‌گیری افزایش دهد.

علاوه بر ابزار ممیزی، سازمان آن‌ها در ModelScope میزبان ۹۱ مدل عمومی و ۹ مجموعه داده است، از جمله:

  • Darwin: مدل زبانی بزرگ تخصصی زبان کره‌ای.
  • POCKET: یک مدل سبک برای اجرا روی دستگاه (On-device).
  • مجموعه داده‌های AX-RAY: داده‌های محک مورد استفاده برای ارزیابی‌های ایمنی.

دارایی‌های آن‌ها در Hugging Face نیز در یک بازه ۳۰ روزه، بیش از ۱.۰۱ میلیون بار دانلود شده است و ۸۲ مدل و مجموعه داده عمومی در آن در دسترس است.

تأثیر بر صنعت

این چرخش به سمت محک‌های «اول-انطباق»، بازی را برای توسعه‌دهندگان تغییر می‌دهد. حالا بحث از «آیا این مدل باهوش است؟» به «آیا این مدل قانونی است؟» تغییر کرده است. برای تیم‌هایی که در حال آماده‌سازی ارزیابی‌های انطباق برای EU AI Act هستند، یک گزارش نمره‌گذاری شده که مستقیماً با قوانین قانونی تطبیق دارد، بسیار ارزشمندتر از یک امتیاز بالا در یک محک استدلال است.

مدل‌های کوچک به‌طور ویژه‌ای آسیب‌پذیر هستند. نرخ شکست ۱۰۰ درصدی برای مدل‌های زیر ۴ میلیارد پارامتر نشان می‌دهد که فرآیندهای کوانتایزیشن (Quantization) — شبیه فشرده‌سازی یک عکس با کیفیت بالا برای اشغال فضای کمتر — و distillation احتمالاً همراستاسازی‌های ایمنی موجود در مدل‌های پیشرو و بزرگ‌تر را از بین می‌برند.

در حال حاضر، VIDRAFT در پروژه‌ای برای توسعه مدل بنیادی هوش مصنوعی با تخصص امنیتی فعالیت می‌کند. این پروژه توسط وزارت علوم و ICT کره جنوبی (MSIT) و آژانس ملی ارتقای صنعت IT (NIPA)، به عنوان بخشی از کنسرسیوم Naver Cloud سفارش داده شده است.

توسعه‌دهندگان اکنون می‌توانند گزارش‌های ارزیابی و مجموعه‌داده‌های AX-RAY را به‌طور عمومی در Hugging Face و ModelScope بررسی کنند تا متوجه شوند معماری‌های خاص آن‌ها در کجا ممکن است دچار نشت ریسک شوند.

گام بعدی شما

  • اگر از مدل‌های کوچک (SLM) استفاده می‌کنید، آن‌ها را با مجموعه‌داده‌های AX-RAY در Hugging Face تست کنید تا ریسک‌های قانونی را شناسایی کنید.
  • در مستندات EU AI Act بررسی کنید که مدل شما در کدام دسته ریسک قرار می‌گیرد تا از جریمه‌های احتمالی جلوگیری کنید.
  • برای کاهش نرخ شکست در مدل‌های فشرده، استراتژی‌های همراستاسازی پس از کوانتایزیشن را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر اعتبار استانداردهای NIST و EU AI Act، نشان می‌دهد که مدل‌های کوچک در حال حاضر یک حفره امنیتی بزرگ در زنجیره تأمین نرم‌افزاری هستند. این موضوع باعث می‌شود شرکت‌ها در استقرار مدل‌های لبه (Edge) با احتیاط بیشتری عمل کنند.

تأثیر برای ایران

به‌دلیل نبود رگولاتور مشابه EU AI Act در ایران، این ابزار فعلاً برای توسعه‌دهندگانی کاربرد دارد که قصد صادرات مدل یا ارائه سرویس به بازارهای جهانی را دارند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «قانونی بودن» به‌جای «باهوش بودن»، نشان‌دهنده بلوغ بازار هوش مصنوعی است. این داده‌ها ثابت می‌کند که مدل‌های کوچک (SLM) در حال حاضر برای کاربردهای حساس سازمانی ایمن نیستند و فرآیندهای فشرده‌سازی مدل، لایه‌های اخلاقی و حفاظتی را قربانی سرعت می‌کنند. توسعه‌دهندگان باید بدانند که بهینه‌سازی پارامترها بدون بازبینی ایمنی، ریسک حقوقی غیرقابل‌قبولی ایجاد می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.