پرش به محتوای اصلی
پرش به محتوای مقاله

تخصص‌یافتگی پرامپت در برابر همراستاسازی واقعی در مدل‌های پیشرو

·۲۷ شهریور ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
یافته‌های ایمنی چندزبانه هوش مصنوعی اسکیل در گزارش ROK-FORTRESS
یافته‌های ایمنی چندزبانه هوش مصنوعی اسکیل در گزارش ROK-FORTRESS
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متدولوژی «بازآفرینی» (Transcreation) به جای ترجمه ساده در محک‌های ایمنی؛ اثبات اینکه زبان می‌تواند به عنوان یک سیگنال ریسک عمل کند، حتی بدون تغییر در محتوای درخواست.

اگر تصور کنید ایمنی مدل‌های هوش مصنوعی یک ثابت جهانی است، نتایج جدید Scale AI این باور را به چالش می‌کشد. داده‌ها نشان می‌دهند که صرفاً تغییر زبان درخواست از انگلیسی به کره‌ای، احتمال تولید پاسخ‌های خطرناک را به‌طور محسوسی کاهش می‌دهد.

طبق اعلام شرکت Scale AI در ۱۷ سپتامبر ۲۰۲۶، این پدیده در جریان تست‌های محک ROK-FORTRESS مشاهده شده است؛ ابزاری که با همکاری مؤسسه ایمنی هوش مصنوعی کره (Korea AI Safety Institute) برای ارزیابی مدل‌های دوزبانه طراحی شده است. این همکاری در راستای تلاش‌های گسترده‌تر برای تقویت زیرساخت‌های امنیتی در شرق آسیا صورت می‌گیرد، مشابه تلاش کنسرسیوم NAVER Cloud برای ساخت مدل بنیادی امنیت ملی کره جنوبی که بر حاکمیت داده‌های ملی تأکید دارد.

بسیاری از تست‌های ایمنی چندزبانه، صرفاً یک پرامپت ثابت را ترجمه می‌کنند. اما این روش نمی‌تواند تأثیر بستر فرهنگی را بر رفتار مدل بسنجد. برای حل این مشکل، Scale AI از یک «ماتریس بازآفرینی» (Transcreation Matrix) استفاده کرد تا هم زبان (انگلیسی در برابر کره‌ای) و هم بستر ژئوپلیتیک (نهادهای آمریکایی در برابر کره‌ای) را به‌طور مستقل تغییر دهد.

ماتریس بازآفرینی

در پست پژوهشی که توسط «مادهو سهواگ» (Madhu Sehwag) نوشته شده است، Scale AI این ماتریس را به عنوان یک محیط کنترل‌شده توصیف می‌کند. در این ساختار، هر پرامپت خصمانه در حداکثر چهار نسخه مختلف ارزیابی می‌شود. این نسخه‌ها به‌طور مستقل زبان و بستر ژئوپلیتیک را تغییر می‌دهند؛ به این معنا که مؤسسات خاص، جزئیات عملیاتی و نهادهای درگیر در سناریو تغییر می‌کنند.

برای مثال، در یک سناریوی حمله با تلفات گسترده، در بستر ایالات متحده ممکن است به بمب‌گذاری ساختمان فدرال اوکلاهاما در سال ۱۹۹۵ اشاره شود، اما در بستر کره، به بمب‌گذاری پرواز ۸۵۸ هواپیمایی کره در سال ۱۹۸۷ ارجاع داده شود. با تست این نسخه‌ها، پژوهشگران می‌توانند تشخیص دهند که آیا منطق رد کردن درخواست توسط مدل زمانی که تهدید «محلی» به نظر می‌رسد در مقایسه با زمانی که «خارجی» است، تغییر می‌کند یا خیر. این ظرافتی است که ارزیابی‌های مبتنی بر ترجمه ساده هرگز نمی‌توانند آشکار کنند.

معماری و دامنه محک

بر اساس مستندات این پژوهش، مجموعه داده ROK-FORTRESS شامل ۱۲۳۵ تکلیف در چهار حوزه حیاتی امنیت ملی و ایمنی عمومی است:

  • تهدیدات شیمیایی، بیولوژیکی، رادیولوژیکی، هسته‌ای و انفجاری (CBRNE)
  • خشونت سیاسی و تروریسم
  • فعالیت‌های مجرمانه و غیرقانونی مالی
  • نشت اطلاعات

پاسخ‌ها توسط پانل‌هایی از مدل زبانی به‌مثابه داور (LLM-as-a-judge) که با برچسب‌های مرجع نوشته شده توسط متخصصان کالیبره شده بودند، امتیازدهی شدند. این پانل‌ها از دستورالعمل‌های باینری (دوگانه) خاص برای هر پرامپت استفاده کردند که توسط متخصصان تیم قرمز (Red-teamers) توسعه یافته بود. همچنین، این محک برای هر پرامپت خصمانه، یک نسخه «بی‌خطر» (Benign) متناظر را در نظر گرفته است تا میزان «رد غیرضروری» (Over-refusal) را بسنجد؛ یعنی حالتی که مدل یک درخواست کاملاً بی‌ضرر را به اشتباه رد می‌کند.

ROK-FORTRESS بر پایه FORTRESS، یعنی محک موجود Scale AI برای امنیت ملی و ایمنی عمومی، بنا شده است. این پروژه بخشی از یک مشارکت گسترده‌تر با مؤسسه ایمنی هوش مصنوعی کره است که تحقیقات مشترک، ارزیابی‌های LLM و عملیات تیم قرمز را در بر می‌گیرد.

یافته‌های کلیدی در ۱۴ مدل

Scale AI تعداد ۱۴ مدل پیشرو و مدل‌های بهینه‌شده برای زبان کره‌ای را ارزیابی کرد. نتایج نشان داد که پرامپت‌های انگلیسی به‌طور کلی بالاترین امتیاز ریسک (با وزن‌دهی لایه‌ای) را تولید کردند، در حالی که پرامپت‌های کاملاً بازآفرینی‌شده به زبان کره‌ای، کمترین میزان خطر را ثبت کردند. نسخه‌های میانی نیز در این بین قرار گرفتند. این الگو حتی برای مدل‌های منطقه‌ای که به‌طور خاص برای زبان کره‌ای بهینه‌سازی شده بودند نیز صادق بود.

در برخی موارد، مدل‌های مضرترین، نمراتی تقریباً ۹ برابر بیشتر از ایمن‌ترین مدل‌ها کسب کردند. با این حال، یک تحلیل تکمیلی به نام «حذف درخواست مستقیم» (Direct-request ablation) یک نقص بحرانی را افشا کرد. اکثر تست‌های اصلی از «پوشش‌های خصمانه» (Adversarial Wrappers) مانند نقش‌آفرینی، داستان‌های ساختگی یا درخواست‌های احساسی برای فریب مدل استفاده می‌کردند.

وقتی این پوشش‌ها حذف شدند و درخواست مضر به‌صورت مستقیم و با زبان ساده مطرح شد، مزیت ایمنی زبان کره‌ای تقریباً ناپدید شد. در این حالت، مدل‌های اختصاصی OpenAI، Anthropic و Google همچنان در زبان کره‌ای کمی ایمن‌تر ماندند. در مقابل، پنج مدل پیشرو با وزن‌های باز (Open Weights) هنگام دریافت درخواست‌های مستقیم به زبان کره‌ای، بیشتر تمایل به همکاری در تولید محتوای مضر داشتند. این مقاله پیشنهاد می‌کند که این شکاف نشان‌دهنده آن است که برخی از کاهش‌های ریسک در زبان کره‌ای، بازتابی از «تخصص در پرامپت» است (جایی که پوشش‌های خصمانه در اثر بازآفرینی اثربخشی خود را از دست می‌دهند)، نه یک همراستاسازی (Alignment) ذاتی و عمیق مبتنی بر زبان. این یافته‌ها با نگرانی‌های مشابه در مورد قابلیت جعل نتایج ایمنی از طریق «سندبگینگ» که توسط مؤسسه امنیت هوش مصنوعی بریتانیا مطرح شد، همسو است و نشان می‌دهد که معیارهای ایمنی لزوماً بازتاب‌دهنده رفتار واقعی مدل در شرایط عملیاتی نیستند.

فرضیه «سیگنال ریسک»

Scale AI دریافت که تغییر زبان از انگلیسی به کره‌ای تأثیری بسیار بزرگ‌تر (حدود ۱۰ درصد) نسبت به تغییر بستر ژئوپلیتیک از آمریکا به کره (حدود ۴ درصد) دارد. این اثر تقریباً ۲.۵ برابر بزرگ‌تر بود. این موضوع نشان می‌دهد که خودِ زبان کره‌ای برای مدل‌ها به عنوان یک «سیگنال ریسک محافظه‌کارانه» عمل می‌کند.

در ۴ مدل از ۱۴ مدل بررسی شده، افزودن بستر کره‌ای به‌طور قابل‌توجهی باعث تضعیف کاهش پاسخ‌های مضر (که با زبان کره‌ای مرتبط بود) شد. هیچ مدلی اثر آماری معناداری در جهت opposite نشان نداد. در ۱۲ مدل از ۱۴ مدل، پاسخ‌ها در زبان کره‌ای حتی زمانی که مدل تصمیم به پاسخ دادن می‌گرفت (به جای رد کردن)، کمتر مضر بودند. اما این ایمنی بهایی داشت: مدل‌ها درخواست‌های بی‌خطر کره‌ای را تا دو برابر بیشتر از درخواست‌های انگلیسی رد کردند.

دسترسی به داده‌ها و متدولوژی

طبق پیش‌نویس arXiv با عنوان «ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety» به نویسندگی مایکل اس. لی و ۱۵ همکار، متدولوژی بازآفرینی به‌گونه‌ای طراحی شده است که برای سایر جفت‌های زبان-فرهنگ نیز قابل تعمیم باشد. این پیش‌نویس ابتدا در ۱۳ مه ۲۰۲۶ ارسال و در ۷ ژوئیه ۲۰۲۶ بازبینی شد و شامل ۷۴ صفحه (با احتساب پیوست‌ها) است.

یک زیرمجموعه عمومی شامل ۷۹۱ تکلیف (۶۴٪ از کل) در Hugging Face تحت لایسنس CC-BY-4.0 منتشر شده است که نیازمند توافق‌نامه دسترسی است. این زیرمجموعه شامل موارد زیر است:

  • ۳۵۹ تکلیف فارغ از فرهنگ (هر کدام با دو نسخه)
  • ۴۳۲ تکلیف خاص فرهنگی (هر کدام با چهار نسخه)
  • در مجموع ۱,۵۱۹ جفت تکلیف-نسخه
  • تکالیفی که به هفت بعد از آسیب با لایه‌های ریسک ۱ تا ۳ نگاشت شده‌اند

این زیرمجموعه عمومی حوزه‌های CBRNE (۲۵۱ تکلیف)، فعالیت‌های مجرمانه و غیرقانونی مالی (۲۴۸)، خشونت سیاسی و تروریسم (۲۰۹) و نشت اطلاعات (۸۳) را پوشش می‌دهد. از این میان، ۴۵۰ تکلیف از FORTRESS اقتباس شده و ۳۴۱ تکلیف به‌طور جدید نوشته شده‌اند. داده‌ها در قالب‌های Parquet و TSV ارائه شده‌اند.

۴۴۴ تکلیف باقی‌مانده (۳۶٪) به عنوان یک مجموعه خصوصی نگه داشته شده است. Scale AI اعلام کرد که این اقدام برای جلوگیری از آلودگی محک (Benchmark Contamination) و محدود کردن پرامپت‌هایی که بر اساس ارزیابی متخصصان تیم قرمز، ریسک بالای سوءاستفاده در دنیای واقعی دارند، ضروری است.

پیامدهای فنی

این پژوهش اتکای صنعت به ارزیابی‌های مبتنی بر ترجمه را به چالش می‌کشد. اگر مدلی در تست‌های انگلیسی ایمن باشد اما در برابر تهدیدات محلی به زبان بومی واکنش متفاوتی نشان دهد، یک آسیب‌پذیری امنیتی جدی برای دولت‌های متحد ایجاد می‌شود.

Scale AI استدلال می‌کند که داده‌های پس‌آموزش (Post-training) و عملیات تیم قرمز باید نسخه‌های مبتنی بر بستر فرهنگی را در بر بگیرند. صرفاً ترجمه یک پرامپت خصمانه انگلیسی برای تضمین ایمنی مدل در بسترهای مختلف ژئوپلیتیک کافی نیست. برای متخصصان، این بدان معناست که «همراستاسازی ایمنی» یک ثابت جهانی نیست، بلکه عمیقاً به الگوهای زبانی و فرهنگی گره خورده است که مدل آن‌ها را با ریسک مرتبط می‌داند. این حوزه باید به سمت «بازآفرینی» حرکت کند تا از تخمین اشتباه شکاف‌های ایمنی در دنیای واقعی جلوگیری شود، هرچند تست‌های بیشتری لازم است تا مشخص شود آیا این الگوها در سایر کشورها نیز تکرار می‌شوند یا خیر. برای مقابله با این دست آسیب‌پذیری‌ها، پیاده‌سازی حفاظ‌های معنایی به عنوان سد دفاعی می‌تواند لایه‌ای از امنیت را در برابر توهمات و پاسخ‌های غیرمنتظره در محیط‌های حساس فراهم کند.

گام بعدی شما

  • اگر از مدل‌های چندزبانه برای کاربردهای حساس استفاده می‌کنید، تست‌های ایمنی خود را از ترجمه ساده به «بازآفرینی فرهنگی» تغییر دهید.
  • در بررسی مدل‌های بازمتن، دقت کنید که کاهش نرخ پاسخ‌های مضر در زبان‌های غیرانگلیسی لزوماً به معنای ایمنی بیشتر نیست و ممکن است ناشی از ضعف در درک پرامپت‌های پیچیده باشد.
  • مجموعه داده ROK-FORTRESS را در Hugging Face بررسی کنید تا با متدهای جدید تیم قرمز (Red Teaming) آشنا شوید.

اما تأثیر این شکاف‌های زبانی بر مدل‌های استدلالی جدیدتر حتی پیچیده‌تر است — به تحلیل ما درباره‌ی مدل‌های Reasoning مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار متدولوژی Scale AI ثابت می‌کند که ارزیابی‌های ایمنی مبتنی بر ترجمه، توهمی از امنیت ایجاد می‌کنند. این موضوع برای دولت‌ها و سازمان‌هایی که بر روی هوش مصنوعی حاکمیتی سرمایه‌گذاری می‌کنند، یک هشدار جدی درباره آسیب‌پذیری‌های پنهان است.

تأثیر برای ایران

این پژوهش برای توسعه‌دهندگان مدل‌های فارسی اهمیت دارد؛ چرا که احتمالاً مدل‌های فارسی نیز رفتارهای ایمنی متفاوتی نسبت به انگلیسی نشان می‌دهند که با ترجمه ساده قابل شناسایی نیست.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها نشان می‌دهند که «ایمنی» در مدل‌های فعلی بیشتر یک اثر جانبی از توزیع داده‌های آموزشی است تا یک مهندسی آگاهانه. وقتی مدل در زبان کره‌ای ایمن‌تر به نظر می‌رسد اما با درخواست مستقیم می‌شکند، یعنی مدل صرفاً «راه ورود» به محتوای مضر در آن زبان را کمتر می‌شناسد، نه اینکه مفهوم ضرر را در آن بستر درک کرده باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.