پرش به محتوای اصلی
پرش به محتوای مقاله

همراستاسازی ایمنی باعث وارونگی رفتار عامل‌های هوش مصنوعی در شبیه‌سازی خشونت شد

·۱۸ مهر ۱۴۰۵۶ دقیقه مطالعه
نمودار: تنظیم ایمنی منحنی تنش-پاسخ را در عامل‌های LLM برای شبیه‌سازی خشونت مدنی معکوس می‌کند
نمودار: تنظیم ایمنی منحنی تنش-پاسخ را در عامل‌های LLM برای شبیه‌سازی خشونت مدنی معکوس می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیسم «ضد-کنش» (Anti-action)؛ یعنی مدل‌های همراستا با افزایش شدت بحران در سناریو، به‌جای واکنش بیشتر، تمایل به انفعال پیدا می‌کنند که دقیقاً عکس منطق ریاضی است.

تصور کنید یک مدل ریاضی پیش‌بینی می‌کند که در شرایط بحرانی، اکثریت مردم به خیابان می‌روند، اما هوش مصنوعی شما دقیقاً برعکس عمل می‌کند و همه را در خانه نگه می‌دارد. این تضاد، نتیجه‌ای مستقیم از لایه‌های ایمنی است که برای محافظت از کاربر طراحی شده‌اند اما اکنون منطق شبیه‌سازی‌های اجتماعی را تخریب می‌کنند.

طبق تحلیل فنی منتشر شده در ۱۰ اکتبر ۲۰۲۶، همراستاسازی (Alignment) در مدل‌های زبانی بزرگ، رفتارهای عامل‌ها در شبیه‌سازی‌های اجتماعی به‌شدت تغییر می‌دهد. این مطالعه فاش می‌کند مدل‌هایی که برای ایمنی آموزش دیده‌اند، یک پیش‌فرض منفی نسبت به «کنش» در محیط‌های پرتنشی ایجاد می‌کنند و در نتیجه، منحنی‌های پاسخ مدل‌های ریاضی تثبیت‌شده را وارونه می‌کنند.

این یافته در حالی منتشر می‌شود که پژوهشگران به‌طور گسترده در حال جایگزینی قوانین تصمیم‌گیری صلب در مدل‌های عامل‌محور (Agent-Based Models - ABM) با مدل‌های زبانی هستند تا استدلال‌های حساس به متن را به سیستم اضافه کنند. ساختمان این رویکرد بر این اساس است که LLMها می‌توانند پیچیدگی‌های انسانی را بهتر مدل کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام مدل‌های زبانی محلی برای عبور از محدودیت‌های API اشاره کردیم، اکنون یک ریسک حیاتی آشکار شده است: «استدلالی» که مدل زبانی اضافه می‌کند، در واقع یک فیلتر ایمنی پنهان است که منطق شبیه‌سازی را لغو می‌کند. در همین راستا، تلاش‌هایی برای بهینه‌سازی سرعت این فرآیندها در جریان است، مانند مدل CLM-8B که توانست سرعت تصمیم‌گیری عامل‌های هوش مصنوعی را تا ۹ برابر افزایش دهد تا اجرای شبیه‌سازی‌های پیچیده تسهیل شود.

شکست در کالیبراسیون

پژوهشگران برای بررسی این موضوع، مدل Qwen 27B (نسخه ۴ بیتی MLX) را در برابر مدل خشونت مدنی اپستین (۲۰۰۲) آزمایش کردند. در مدل ریاضی اصلی، هر عامل شهروند دو متغیر «نارضایتی» (G) و «خطر خالص» (N) را محاسبه می‌کند. نارضایتی بر اساس فرمول G = H · (1 − L) محاسبه می‌شود که در آن H سختی ادراک‌شده و L مشروعیت ادراک‌شده دولت است. خطر خالص نیز بر اساس فرمول N = R · P تعیین می‌شود که در آن R ریسک‌گریزی و P احتمال تخمینی بازداشت است.

احتمال بازداشت (P) به صورت P = 1 − exp(−k · (C/A)_v) تعریف می‌شود که در آن (C/A)_v نشان‌دهنده نسبت پلیس به فعالان در شعاع دید عامل است. در این قانون قطعی، زمانی که تفاضل نارضایتی و خطر از یک حد آستانه (T) بیشتر شود (G − N > T)، عامل «فعال» می‌شود. یعنی با افزایش تنش اجتماعی (تفاضل نارضایتی و خطر)، احتمال فعال شدن عامل به‌صورت یکنواخت (Monotonically) افزایش می‌یابد.

اما وقتی مدل Qwen 27B متغیرهای وضعیت را به زبان طبیعی دریافت کرد و بین دو برچسب «کنش/انتظار» (act/wait) باید انتخاب می‌کرد، نتایج به‌طور کامل وارونه شد. بر اساس مستندات این پژوهش، در بیش از ۶۰۰ وضعیت کالیبراسیون با ۲۰ تکرار برای هر وضعیت و دمای (Temperature) ۰.۷، احتمال انتخاب «کنش» با افزایش تنش کاهش یافت:

  • تنش ۰.۱۰: احتمال کنش ۴۱.۵٪
  • تنش ۰.۵۰: احتمال کنش ۳۸.۱٪
  • تنش ۰.۷۰: احتمال کنش ۲۹.۳٪
  • تنش ۰.۹۰: احتمال کنش ۱۲.۶٪

در سطح تنش ۰.۹۰ — جایی که مدل ریاضی فعال شدن تقریباً همگانی را پیش‌بینی می‌کند — عامل مدل زبانی تنها در حدود ۱ مورد از ۸ نمونه فعال شد.

قدرت برچسب‌های واژگانی

این مطالعه نشان داد که این اعوجاج ناشی از شکست در استدلال نیست، بلکه به کلمات خاص به‌کاررفته در پرامپت برمی‌گردد. پژوهشگران برای شبیه‌سازی، یک پیش‌فرض کشوری بر اساس رومانی در نظر گرفتند که در آن L = ۰.۲۱ (بر اساس Eurobarometer)، H = ۰.۵۵ (بر اساس OECD)، تراکم پلیس ۰.۰۰۳ و R = ۰.۷۰ بود. وقتی برچسب‌ها از «کنش/انتظار» به «اعتراض/تمکین» (protest/comply) تغییر یافت، رفتار مورد انتظار بازگشت:

  • تنش ۰.۱۰: احتمال اعتراض ۰٪
  • تنش ۰.۵۰: احتمال اعتراض ۲۰٪ (با فاصله اطمینان ۹۵٪ ویلسون: [۸٪، ۴۲٪])
  • تنش ۰.۷۰: احتمال اعتراض ۳۵٪
  • تنش ۰.۹۰: احتمال اعتراض ۹۵٪

این منحنی دقیقاً با رفتار آستانه‌ای قانون مرجع مطابقت دارد و صعود شدیدی بین تنش ۰.۷۰ و ۰.۹۰ نشان می‌دهد. با این حال، «اعتراض/تمکین» تنها جفتی بود که پاسخ یکنواخت ایجاد کرد؛ در حالی که برچسب‌هایی مثل «شورش» (rebel) یا «اقدام کردن» (take action) همچنان دچار سوگیری بودند. نویسندگان اشاره می‌کنند که چون این جفت برچسب از طریق جستجو پیدا شده است، یک نتیجه «در-نمونه» (in-sample) است و برای اعتبارسنجی بیشتر روی قالب‌های پرامپت مجزا نیاز دارد.

سازوکار پیشنهادی: همراستاسازی ایمنی

به باور پژوهشگران، تنظیم ترجیحات (مانند RLHF یا DPO) یک پیش‌فرض منفی روی خروجی‌هایی ایجاد می‌کند که «کنش» نامشخص را در محیط‌های پرتنشی تایید می‌کنند. این جریمه با افزایش سیگنال‌های درگیری در متن بیشتر می‌شود و توضیح می‌دهد چرا سرکوب رفتار با افزایش تنش، شدیدتر می‌شود، به جای اینکه ثابت بماند.

در این تحلیل، واژه «اعتراض» از این جریمه می‌گریزد چون در داده‌های آموزشی به‌عنوان یک اقدام مدنی مورد حمایت و محافظت‌شده ثبت شده است. در مقابل، واژگانی مثل «کنش»، «شورش» یا «اقدام کردن» در نزدیکی محتوایی قرار دارند که مدل در مرحله همراستاسازی یاد گرفته است آن‌ها را رد کند. در همین حال، «انتظار» به‌عنوان یک پاسخ تنش‌زدا و «ایمن»، پیش‌فرض مثبتی دریافت می‌کند. برای جداسازی این اثر، نویسندگان پیشنهاد می‌کنند که نسخه‌های پایه (Base) و همراستاشده (Aligned) از یک خانواده مدل مقایسه شوند؛ در این صورت، مؤلفه ضد-کنش وابسته به تنش باید در مدل پایه غایب باشد یا بسیار کوچک‌تر باشد.

الگوهای سوگیری در مدل‌های مختلف

آزمایش روی مدل Mistral 7B Instruct v0.3 شکست متفاوتی را نشان داد. این مدل چون در مستنداتش مرحله همراستاسازی ایمنی اختصاصی را گزارش نکرده بود، الگوی «ضد-کنش» را نشان نداد. اما در عوض، Mistral دچار «سوگیری اولویت» (Primacy Bias) تقریباً مطلق شد؛ یعنی در حدود ۱۰۰٪ نمونه‌ها، صرف‌نظر از برچسب یا میزان تنش، هر گزینه‌ای که ابتدا در پرامپت ارائه شده بود را انتخاب کرد. در واقع، خروجی این مدل هیچ اطلاعاتی درباره وضعیت سناریو منتقل نمی‌کرد.

مدل‌های پایه (غیرهمراستا) نیز اگرچه از الگوی ضد-کنش رها بودند، اما در پیروی از دستورات و سوگیری‌های اجتماعی (مانند طرفداری از گروه خود یا in-group favoritism) عملکرد غیرقابل‌اعتمادی داشتند. این یعنی هیچ مدل فعلی بدون یک مرحله کالیبراسیون اختصاصی، تابع تصمیم‌گیری بدون سوگیری ارائه نمی‌دهد. این چالش‌های عملکردی در مدل‌های مختلف، به‌ویژه هنگام مواجهه با زبان‌های متنوع، مشهود است؛ برای مثال، تفاوت‌های قابل‌توجهی در عملکرد مدل‌های فارسی و انگلیسی هنگام استفاده از داده‌های رسمی در برابر منابع کم‌اعتبار مشاهده شده است که نشان‌دهنده لایه‌های پیچیده‌تر سوگیری در مدل‌های زبانی است.

بودجه سوگیری (Bias Budget)

این گزارش مفهوم «بودجه سوگیری» را برای کمی‌سازی این اعوجاجات معرفی می‌کند. برای مدل Qwen 27B، پژوهشگران چندین اثر متداخل را شناسایی کردند:

  • پیش‌فرض واژگانی روی «انتظار»: ۴۵- درصد (pp) اثر روی احتمال کنش
  • ضد-کنش وابسته به تنش: ۱۵- تا ۳۰- درصد در تنش‌های بالا
  • سوگیری موقعیتی: ۵ تا ۱۶ درصد
  • سوگیری اولویت (در Mistral 7B): تقریباً ۱۰۰٪

این سوگیری‌ها اغلب بزرگ‌تر از تفاوت‌های رفتاری هستند که شبیه‌سازی‌ها قصد مطالعه آن را دارند. در نتیجه، یک بسیب جمعی پیش‌بینی‌شده می‌تواند به سکون مطلق تبدیل شود. بدون کالیبراسیون، یک شبیه‌سازی ممکن است صلح‌آمیز بودن یک جمعیت را نتیجه‌ی دینامیک‌های اجتماعی گزارش کند، در حالی که در واقع نتیجه‌ی آموزش RLHF مدل است.

پیامدهای صنعتی

این مطالعه اشاره می‌کند که چارچوب‌های موجود مانند SocioVerse-ABM (دانشگاه فودان / مؤسسه نوآوری شانگهای، نسخه ۰.۲.۰، ۲۰۲۶) و AgentTorch (آزمایشگاه رسانه MIT) خروجی عامل‌ها را با خطوط پایه مقایسه می‌کنند. SocioVerse-ABM مدل‌های GPT-4o، DeepSeek-V3 و Qwen3-235B را در دوازده سناریو، از جمله مدل اپستین، ارزیابی می‌کند. با این حال، هیچ‌کدام از این چارچوب‌ها شامل یک مرحله پیش از شبیه‌سازی برای جداسازی اعوجاج تابع تصمیم از دینامیک‌های نوظهور نیستند.

این موضوع با یافته‌های لی و همکاران (۲۰۲۵، ACM FAccT) همسو است که گزارش دادند همراستاسازی اگرچه سوگیری‌های صریح را کم می‌کند، اما سوگیری‌های ضمنی اغلب باقی می‌مانند یا حتی رشد می‌کنند. برای متخصصان فنی، این بدان معناست که هر خط لوله LLM-ABM باید شامل یک «جاروب کالیبراسیون» (Calibration Sweep) باشد. اگر پاسخ یک عامل نسبت به قانون مرجع به‌صورت یکنواخت غیرنزولی نباشد، نتایج شبیه‌سازی جمعیت احتمالاً نامعتبر است.

توصیه‌هایی برای متخصصان

برای کاهش این ریسک‌ها، نویسندگان پروتکل زیر را پیشنهاد می‌کنند:

  • کالیبره کنید پیش از شبیه‌سازی: ورودی‌های تصمیم را برای بررسی یکنواختی (Monotonicity) و مکان آستانه جاروب کنید. اگر این بررسی شکست خورد، شبیه‌سازی جمعیت را اجرا نکنید.
  • برچسب‌ها را به‌عنوان پارامترهای طراحی گزارش کنید: جفت‌برچسب‌های مورد استفاده و جایگزین‌های تست‌شده را به‌طور دقیق مستند کنید.
  • ترتیب گزینه‌ها را متعادل کنید: ترتیب گزینه‌ها را بین عامل‌ها و تکرارها تغییر دهید تا سوگیری موقعیتی خنثی شود.
  • بودجه سوگیری را منتشر کنید: مقدار هر مؤلفه سوگیری شناسایی‌شده را در کنار نتایج اصلی گزارش کنید.
  • تصمیمات مبتنی بر احتمال را ترجیح دهید: به‌جای نمونه‌گیری متنی، هر برچسب را بر اساس احتمال لگاریتمی (Logits) امتیازدهی کنید. کالیبراسیون را با تفریق یک خط پایه بدون محتوا (مثلاً جایگزینی توصیف وضعیت با یک جایگاه خنثی) انجام دهید تا پیش‌فرض‌های برچسب و موقعیت مستقیماً حذف شوند.

این تغییر در رویکرد، عامل‌های LLM را از جایگزین‌های «آماده‌به‌کار» برای قوانین، به مؤلفه‌هایی تبدیل می‌کند که نیاز به کالیبراسیون آماری دقیق دارند؛ مشابه روشی که حسگرهای فیزیکی پیش از استفاده در یک آزمایش کالیبره می‌شوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اعتبار شبیه‌سازی‌های اجتماعی مبتنی بر هوش مصنوعی ضربه می‌زند و نشان می‌دهد همراستاسازی ایمنی می‌تواند نتایج علمی را به‌طور سیستماتیک تحریف کند. تخصص در کالیبراسیون آماری اکنون برای هر پژوهشگری که از عامل‌های هوش مصنوعی استفاده می‌کند، ضروری است.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و تحلیل‌گران داده در ایران اهمیت دارد تا بازار مصرف؛ چراکه هشدار می‌دهد در شبیه‌سازی‌های اجتماعی با مدل‌های بسته، نتایج ممکن است بازتاب ایمنی شرکت سازنده باشد نه واقعیت جامعه.

·نگاه ما
تحریریه دات‌هوش

این پژوهش فرضیه «جایگزینی مستقیم» مدل‌های زبانی به‌جای قوانین ریاضی را به چالش می‌کشد. در واقع، همراستاسازی ایمنی که برای کاربر نهایی مفید است، در محیط‌های پژوهشی به یک «نویز سیستماتیک» تبدیل می‌شود که نتایج را جعل می‌کند. این یعنی برای استفاده از LLMها در علوم اجتماعی، ما به مدل‌های «بدون سانسور» یا متدهای کالیبراسیون آماری نیاز داریم، نه مدل‌های هوشمندتر.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.