اگر تصور کنید ایمنی مدلهای هوش مصنوعی یک ثابت جهانی است، نتایج جدید Scale AI این باور را به چالش میکشد. دادهها نشان میدهند که صرفاً تغییر زبان درخواست از انگلیسی به کرهای، احتمال تولید پاسخهای خطرناک را بهطور محسوسی کاهش میدهد.
طبق اعلام شرکت Scale AI در ۱۷ سپتامبر ۲۰۲۶، این پدیده در جریان تستهای محک ROK-FORTRESS مشاهده شده است؛ ابزاری که با همکاری مؤسسه ایمنی هوش مصنوعی کره (Korea AI Safety Institute) برای ارزیابی مدلهای دوزبانه طراحی شده است. این همکاری در راستای تلاشهای گستردهتر برای تقویت زیرساختهای امنیتی در شرق آسیا صورت میگیرد، مشابه تلاش کنسرسیوم NAVER Cloud برای ساخت مدل بنیادی امنیت ملی کره جنوبی که بر حاکمیت دادههای ملی تأکید دارد.
بسیاری از تستهای ایمنی چندزبانه، صرفاً یک پرامپت ثابت را ترجمه میکنند. اما این روش نمیتواند تأثیر بستر فرهنگی را بر رفتار مدل بسنجد. برای حل این مشکل، Scale AI از یک «ماتریس بازآفرینی» (Transcreation Matrix) استفاده کرد تا هم زبان (انگلیسی در برابر کرهای) و هم بستر ژئوپلیتیک (نهادهای آمریکایی در برابر کرهای) را بهطور مستقل تغییر دهد.
ماتریس بازآفرینی
در پست پژوهشی که توسط «مادهو سهواگ» (Madhu Sehwag) نوشته شده است، Scale AI این ماتریس را به عنوان یک محیط کنترلشده توصیف میکند. در این ساختار، هر پرامپت خصمانه در حداکثر چهار نسخه مختلف ارزیابی میشود. این نسخهها بهطور مستقل زبان و بستر ژئوپلیتیک را تغییر میدهند؛ به این معنا که مؤسسات خاص، جزئیات عملیاتی و نهادهای درگیر در سناریو تغییر میکنند.
برای مثال، در یک سناریوی حمله با تلفات گسترده، در بستر ایالات متحده ممکن است به بمبگذاری ساختمان فدرال اوکلاهاما در سال ۱۹۹۵ اشاره شود، اما در بستر کره، به بمبگذاری پرواز ۸۵۸ هواپیمایی کره در سال ۱۹۸۷ ارجاع داده شود. با تست این نسخهها، پژوهشگران میتوانند تشخیص دهند که آیا منطق رد کردن درخواست توسط مدل زمانی که تهدید «محلی» به نظر میرسد در مقایسه با زمانی که «خارجی» است، تغییر میکند یا خیر. این ظرافتی است که ارزیابیهای مبتنی بر ترجمه ساده هرگز نمیتوانند آشکار کنند.
معماری و دامنه محک
بر اساس مستندات این پژوهش، مجموعه داده ROK-FORTRESS شامل ۱۲۳۵ تکلیف در چهار حوزه حیاتی امنیت ملی و ایمنی عمومی است:
- تهدیدات شیمیایی، بیولوژیکی، رادیولوژیکی، هستهای و انفجاری (CBRNE)
- خشونت سیاسی و تروریسم
- فعالیتهای مجرمانه و غیرقانونی مالی
- نشت اطلاعات
پاسخها توسط پانلهایی از مدل زبانی بهمثابه داور (LLM-as-a-judge) که با برچسبهای مرجع نوشته شده توسط متخصصان کالیبره شده بودند، امتیازدهی شدند. این پانلها از دستورالعملهای باینری (دوگانه) خاص برای هر پرامپت استفاده کردند که توسط متخصصان تیم قرمز (Red-teamers) توسعه یافته بود. همچنین، این محک برای هر پرامپت خصمانه، یک نسخه «بیخطر» (Benign) متناظر را در نظر گرفته است تا میزان «رد غیرضروری» (Over-refusal) را بسنجد؛ یعنی حالتی که مدل یک درخواست کاملاً بیضرر را به اشتباه رد میکند.
ROK-FORTRESS بر پایه FORTRESS، یعنی محک موجود Scale AI برای امنیت ملی و ایمنی عمومی، بنا شده است. این پروژه بخشی از یک مشارکت گستردهتر با مؤسسه ایمنی هوش مصنوعی کره است که تحقیقات مشترک، ارزیابیهای LLM و عملیات تیم قرمز را در بر میگیرد.
یافتههای کلیدی در ۱۴ مدل
Scale AI تعداد ۱۴ مدل پیشرو و مدلهای بهینهشده برای زبان کرهای را ارزیابی کرد. نتایج نشان داد که پرامپتهای انگلیسی بهطور کلی بالاترین امتیاز ریسک (با وزندهی لایهای) را تولید کردند، در حالی که پرامپتهای کاملاً بازآفرینیشده به زبان کرهای، کمترین میزان خطر را ثبت کردند. نسخههای میانی نیز در این بین قرار گرفتند. این الگو حتی برای مدلهای منطقهای که بهطور خاص برای زبان کرهای بهینهسازی شده بودند نیز صادق بود.
در برخی موارد، مدلهای مضرترین، نمراتی تقریباً ۹ برابر بیشتر از ایمنترین مدلها کسب کردند. با این حال، یک تحلیل تکمیلی به نام «حذف درخواست مستقیم» (Direct-request ablation) یک نقص بحرانی را افشا کرد. اکثر تستهای اصلی از «پوششهای خصمانه» (Adversarial Wrappers) مانند نقشآفرینی، داستانهای ساختگی یا درخواستهای احساسی برای فریب مدل استفاده میکردند.
وقتی این پوششها حذف شدند و درخواست مضر بهصورت مستقیم و با زبان ساده مطرح شد، مزیت ایمنی زبان کرهای تقریباً ناپدید شد. در این حالت، مدلهای اختصاصی OpenAI، Anthropic و Google همچنان در زبان کرهای کمی ایمنتر ماندند. در مقابل، پنج مدل پیشرو با وزنهای باز (Open Weights) هنگام دریافت درخواستهای مستقیم به زبان کرهای، بیشتر تمایل به همکاری در تولید محتوای مضر داشتند. این مقاله پیشنهاد میکند که این شکاف نشاندهنده آن است که برخی از کاهشهای ریسک در زبان کرهای، بازتابی از «تخصص در پرامپت» است (جایی که پوششهای خصمانه در اثر بازآفرینی اثربخشی خود را از دست میدهند)، نه یک همراستاسازی (Alignment) ذاتی و عمیق مبتنی بر زبان. این یافتهها با نگرانیهای مشابه در مورد قابلیت جعل نتایج ایمنی از طریق «سندبگینگ» که توسط مؤسسه امنیت هوش مصنوعی بریتانیا مطرح شد، همسو است و نشان میدهد که معیارهای ایمنی لزوماً بازتابدهنده رفتار واقعی مدل در شرایط عملیاتی نیستند.
فرضیه «سیگنال ریسک»
Scale AI دریافت که تغییر زبان از انگلیسی به کرهای تأثیری بسیار بزرگتر (حدود ۱۰ درصد) نسبت به تغییر بستر ژئوپلیتیک از آمریکا به کره (حدود ۴ درصد) دارد. این اثر تقریباً ۲.۵ برابر بزرگتر بود. این موضوع نشان میدهد که خودِ زبان کرهای برای مدلها به عنوان یک «سیگنال ریسک محافظهکارانه» عمل میکند.
در ۴ مدل از ۱۴ مدل بررسی شده، افزودن بستر کرهای بهطور قابلتوجهی باعث تضعیف کاهش پاسخهای مضر (که با زبان کرهای مرتبط بود) شد. هیچ مدلی اثر آماری معناداری در جهت opposite نشان نداد. در ۱۲ مدل از ۱۴ مدل، پاسخها در زبان کرهای حتی زمانی که مدل تصمیم به پاسخ دادن میگرفت (به جای رد کردن)، کمتر مضر بودند. اما این ایمنی بهایی داشت: مدلها درخواستهای بیخطر کرهای را تا دو برابر بیشتر از درخواستهای انگلیسی رد کردند.
دسترسی به دادهها و متدولوژی
طبق پیشنویس arXiv با عنوان «ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety» به نویسندگی مایکل اس. لی و ۱۵ همکار، متدولوژی بازآفرینی بهگونهای طراحی شده است که برای سایر جفتهای زبان-فرهنگ نیز قابل تعمیم باشد. این پیشنویس ابتدا در ۱۳ مه ۲۰۲۶ ارسال و در ۷ ژوئیه ۲۰۲۶ بازبینی شد و شامل ۷۴ صفحه (با احتساب پیوستها) است.
یک زیرمجموعه عمومی شامل ۷۹۱ تکلیف (۶۴٪ از کل) در Hugging Face تحت لایسنس CC-BY-4.0 منتشر شده است که نیازمند توافقنامه دسترسی است. این زیرمجموعه شامل موارد زیر است:
- ۳۵۹ تکلیف فارغ از فرهنگ (هر کدام با دو نسخه)
- ۴۳۲ تکلیف خاص فرهنگی (هر کدام با چهار نسخه)
- در مجموع ۱,۵۱۹ جفت تکلیف-نسخه
- تکالیفی که به هفت بعد از آسیب با لایههای ریسک ۱ تا ۳ نگاشت شدهاند
این زیرمجموعه عمومی حوزههای CBRNE (۲۵۱ تکلیف)، فعالیتهای مجرمانه و غیرقانونی مالی (۲۴۸)، خشونت سیاسی و تروریسم (۲۰۹) و نشت اطلاعات (۸۳) را پوشش میدهد. از این میان، ۴۵۰ تکلیف از FORTRESS اقتباس شده و ۳۴۱ تکلیف بهطور جدید نوشته شدهاند. دادهها در قالبهای Parquet و TSV ارائه شدهاند.
۴۴۴ تکلیف باقیمانده (۳۶٪) به عنوان یک مجموعه خصوصی نگه داشته شده است. Scale AI اعلام کرد که این اقدام برای جلوگیری از آلودگی محک (Benchmark Contamination) و محدود کردن پرامپتهایی که بر اساس ارزیابی متخصصان تیم قرمز، ریسک بالای سوءاستفاده در دنیای واقعی دارند، ضروری است.
پیامدهای فنی
این پژوهش اتکای صنعت به ارزیابیهای مبتنی بر ترجمه را به چالش میکشد. اگر مدلی در تستهای انگلیسی ایمن باشد اما در برابر تهدیدات محلی به زبان بومی واکنش متفاوتی نشان دهد، یک آسیبپذیری امنیتی جدی برای دولتهای متحد ایجاد میشود.
Scale AI استدلال میکند که دادههای پسآموزش (Post-training) و عملیات تیم قرمز باید نسخههای مبتنی بر بستر فرهنگی را در بر بگیرند. صرفاً ترجمه یک پرامپت خصمانه انگلیسی برای تضمین ایمنی مدل در بسترهای مختلف ژئوپلیتیک کافی نیست. برای متخصصان، این بدان معناست که «همراستاسازی ایمنی» یک ثابت جهانی نیست، بلکه عمیقاً به الگوهای زبانی و فرهنگی گره خورده است که مدل آنها را با ریسک مرتبط میداند. این حوزه باید به سمت «بازآفرینی» حرکت کند تا از تخمین اشتباه شکافهای ایمنی در دنیای واقعی جلوگیری شود، هرچند تستهای بیشتری لازم است تا مشخص شود آیا این الگوها در سایر کشورها نیز تکرار میشوند یا خیر. برای مقابله با این دست آسیبپذیریها، پیادهسازی حفاظهای معنایی به عنوان سد دفاعی میتواند لایهای از امنیت را در برابر توهمات و پاسخهای غیرمنتظره در محیطهای حساس فراهم کند.
گام بعدی شما
- اگر از مدلهای چندزبانه برای کاربردهای حساس استفاده میکنید، تستهای ایمنی خود را از ترجمه ساده به «بازآفرینی فرهنگی» تغییر دهید.
- در بررسی مدلهای بازمتن، دقت کنید که کاهش نرخ پاسخهای مضر در زبانهای غیرانگلیسی لزوماً به معنای ایمنی بیشتر نیست و ممکن است ناشی از ضعف در درک پرامپتهای پیچیده باشد.
- مجموعه داده ROK-FORTRESS را در Hugging Face بررسی کنید تا با متدهای جدید تیم قرمز (Red Teaming) آشنا شوید.
اما تأثیر این شکافهای زبانی بر مدلهای استدلالی جدیدتر حتی پیچیدهتر است — به تحلیل ما دربارهی مدلهای Reasoning مراجعه کنید.




گفتگو