تصور کنید یک مدل ریاضی پیشبینی میکند که در شرایط بحرانی، اکثریت مردم به خیابان میروند، اما هوش مصنوعی شما دقیقاً برعکس عمل میکند و همه را در خانه نگه میدارد. این تضاد، نتیجهای مستقیم از لایههای ایمنی است که برای محافظت از کاربر طراحی شدهاند اما اکنون منطق شبیهسازیهای اجتماعی را تخریب میکنند.
طبق تحلیل فنی منتشر شده در ۱۰ اکتبر ۲۰۲۶، همراستاسازی (Alignment) در مدلهای زبانی بزرگ، رفتارهای عاملها در شبیهسازیهای اجتماعی بهشدت تغییر میدهد. این مطالعه فاش میکند مدلهایی که برای ایمنی آموزش دیدهاند، یک پیشفرض منفی نسبت به «کنش» در محیطهای پرتنشی ایجاد میکنند و در نتیجه، منحنیهای پاسخ مدلهای ریاضی تثبیتشده را وارونه میکنند.
این یافته در حالی منتشر میشود که پژوهشگران بهطور گسترده در حال جایگزینی قوانین تصمیمگیری صلب در مدلهای عاملمحور (Agent-Based Models - ABM) با مدلهای زبانی هستند تا استدلالهای حساس به متن را به سیستم اضافه کنند. ساختمان این رویکرد بر این اساس است که LLMها میتوانند پیچیدگیهای انسانی را بهتر مدل کنند. همانطور که در تحلیل قبلی ما دربارهی ادغام مدلهای زبانی محلی برای عبور از محدودیتهای API اشاره کردیم، اکنون یک ریسک حیاتی آشکار شده است: «استدلالی» که مدل زبانی اضافه میکند، در واقع یک فیلتر ایمنی پنهان است که منطق شبیهسازی را لغو میکند. در همین راستا، تلاشهایی برای بهینهسازی سرعت این فرآیندها در جریان است، مانند مدل CLM-8B که توانست سرعت تصمیمگیری عاملهای هوش مصنوعی را تا ۹ برابر افزایش دهد تا اجرای شبیهسازیهای پیچیده تسهیل شود.
شکست در کالیبراسیون
پژوهشگران برای بررسی این موضوع، مدل Qwen 27B (نسخه ۴ بیتی MLX) را در برابر مدل خشونت مدنی اپستین (۲۰۰۲) آزمایش کردند. در مدل ریاضی اصلی، هر عامل شهروند دو متغیر «نارضایتی» (G) و «خطر خالص» (N) را محاسبه میکند. نارضایتی بر اساس فرمول G = H · (1 − L) محاسبه میشود که در آن H سختی ادراکشده و L مشروعیت ادراکشده دولت است. خطر خالص نیز بر اساس فرمول N = R · P تعیین میشود که در آن R ریسکگریزی و P احتمال تخمینی بازداشت است.
احتمال بازداشت (P) به صورت P = 1 − exp(−k · (C/A)_v) تعریف میشود که در آن (C/A)_v نشاندهنده نسبت پلیس به فعالان در شعاع دید عامل است. در این قانون قطعی، زمانی که تفاضل نارضایتی و خطر از یک حد آستانه (T) بیشتر شود (G − N > T)، عامل «فعال» میشود. یعنی با افزایش تنش اجتماعی (تفاضل نارضایتی و خطر)، احتمال فعال شدن عامل بهصورت یکنواخت (Monotonically) افزایش مییابد.
اما وقتی مدل Qwen 27B متغیرهای وضعیت را به زبان طبیعی دریافت کرد و بین دو برچسب «کنش/انتظار» (act/wait) باید انتخاب میکرد، نتایج بهطور کامل وارونه شد. بر اساس مستندات این پژوهش، در بیش از ۶۰۰ وضعیت کالیبراسیون با ۲۰ تکرار برای هر وضعیت و دمای (Temperature) ۰.۷، احتمال انتخاب «کنش» با افزایش تنش کاهش یافت:
- تنش ۰.۱۰: احتمال کنش ۴۱.۵٪
- تنش ۰.۵۰: احتمال کنش ۳۸.۱٪
- تنش ۰.۷۰: احتمال کنش ۲۹.۳٪
- تنش ۰.۹۰: احتمال کنش ۱۲.۶٪
در سطح تنش ۰.۹۰ — جایی که مدل ریاضی فعال شدن تقریباً همگانی را پیشبینی میکند — عامل مدل زبانی تنها در حدود ۱ مورد از ۸ نمونه فعال شد.
قدرت برچسبهای واژگانی
این مطالعه نشان داد که این اعوجاج ناشی از شکست در استدلال نیست، بلکه به کلمات خاص بهکاررفته در پرامپت برمیگردد. پژوهشگران برای شبیهسازی، یک پیشفرض کشوری بر اساس رومانی در نظر گرفتند که در آن L = ۰.۲۱ (بر اساس Eurobarometer)، H = ۰.۵۵ (بر اساس OECD)، تراکم پلیس ۰.۰۰۳ و R = ۰.۷۰ بود. وقتی برچسبها از «کنش/انتظار» به «اعتراض/تمکین» (protest/comply) تغییر یافت، رفتار مورد انتظار بازگشت:
- تنش ۰.۱۰: احتمال اعتراض ۰٪
- تنش ۰.۵۰: احتمال اعتراض ۲۰٪ (با فاصله اطمینان ۹۵٪ ویلسون: [۸٪، ۴۲٪])
- تنش ۰.۷۰: احتمال اعتراض ۳۵٪
- تنش ۰.۹۰: احتمال اعتراض ۹۵٪
این منحنی دقیقاً با رفتار آستانهای قانون مرجع مطابقت دارد و صعود شدیدی بین تنش ۰.۷۰ و ۰.۹۰ نشان میدهد. با این حال، «اعتراض/تمکین» تنها جفتی بود که پاسخ یکنواخت ایجاد کرد؛ در حالی که برچسبهایی مثل «شورش» (rebel) یا «اقدام کردن» (take action) همچنان دچار سوگیری بودند. نویسندگان اشاره میکنند که چون این جفت برچسب از طریق جستجو پیدا شده است، یک نتیجه «در-نمونه» (in-sample) است و برای اعتبارسنجی بیشتر روی قالبهای پرامپت مجزا نیاز دارد.
سازوکار پیشنهادی: همراستاسازی ایمنی
به باور پژوهشگران، تنظیم ترجیحات (مانند RLHF یا DPO) یک پیشفرض منفی روی خروجیهایی ایجاد میکند که «کنش» نامشخص را در محیطهای پرتنشی تایید میکنند. این جریمه با افزایش سیگنالهای درگیری در متن بیشتر میشود و توضیح میدهد چرا سرکوب رفتار با افزایش تنش، شدیدتر میشود، به جای اینکه ثابت بماند.
در این تحلیل، واژه «اعتراض» از این جریمه میگریزد چون در دادههای آموزشی بهعنوان یک اقدام مدنی مورد حمایت و محافظتشده ثبت شده است. در مقابل، واژگانی مثل «کنش»، «شورش» یا «اقدام کردن» در نزدیکی محتوایی قرار دارند که مدل در مرحله همراستاسازی یاد گرفته است آنها را رد کند. در همین حال، «انتظار» بهعنوان یک پاسخ تنشزدا و «ایمن»، پیشفرض مثبتی دریافت میکند. برای جداسازی این اثر، نویسندگان پیشنهاد میکنند که نسخههای پایه (Base) و همراستاشده (Aligned) از یک خانواده مدل مقایسه شوند؛ در این صورت، مؤلفه ضد-کنش وابسته به تنش باید در مدل پایه غایب باشد یا بسیار کوچکتر باشد.
الگوهای سوگیری در مدلهای مختلف
آزمایش روی مدل Mistral 7B Instruct v0.3 شکست متفاوتی را نشان داد. این مدل چون در مستنداتش مرحله همراستاسازی ایمنی اختصاصی را گزارش نکرده بود، الگوی «ضد-کنش» را نشان نداد. اما در عوض، Mistral دچار «سوگیری اولویت» (Primacy Bias) تقریباً مطلق شد؛ یعنی در حدود ۱۰۰٪ نمونهها، صرفنظر از برچسب یا میزان تنش، هر گزینهای که ابتدا در پرامپت ارائه شده بود را انتخاب کرد. در واقع، خروجی این مدل هیچ اطلاعاتی درباره وضعیت سناریو منتقل نمیکرد.
مدلهای پایه (غیرهمراستا) نیز اگرچه از الگوی ضد-کنش رها بودند، اما در پیروی از دستورات و سوگیریهای اجتماعی (مانند طرفداری از گروه خود یا in-group favoritism) عملکرد غیرقابلاعتمادی داشتند. این یعنی هیچ مدل فعلی بدون یک مرحله کالیبراسیون اختصاصی، تابع تصمیمگیری بدون سوگیری ارائه نمیدهد. این چالشهای عملکردی در مدلهای مختلف، بهویژه هنگام مواجهه با زبانهای متنوع، مشهود است؛ برای مثال، تفاوتهای قابلتوجهی در عملکرد مدلهای فارسی و انگلیسی هنگام استفاده از دادههای رسمی در برابر منابع کماعتبار مشاهده شده است که نشاندهنده لایههای پیچیدهتر سوگیری در مدلهای زبانی است.
بودجه سوگیری (Bias Budget)
این گزارش مفهوم «بودجه سوگیری» را برای کمیسازی این اعوجاجات معرفی میکند. برای مدل Qwen 27B، پژوهشگران چندین اثر متداخل را شناسایی کردند:
- پیشفرض واژگانی روی «انتظار»: ۴۵- درصد (pp) اثر روی احتمال کنش
- ضد-کنش وابسته به تنش: ۱۵- تا ۳۰- درصد در تنشهای بالا
- سوگیری موقعیتی: ۵ تا ۱۶ درصد
- سوگیری اولویت (در Mistral 7B): تقریباً ۱۰۰٪
این سوگیریها اغلب بزرگتر از تفاوتهای رفتاری هستند که شبیهسازیها قصد مطالعه آن را دارند. در نتیجه، یک بسیب جمعی پیشبینیشده میتواند به سکون مطلق تبدیل شود. بدون کالیبراسیون، یک شبیهسازی ممکن است صلحآمیز بودن یک جمعیت را نتیجهی دینامیکهای اجتماعی گزارش کند، در حالی که در واقع نتیجهی آموزش RLHF مدل است.
پیامدهای صنعتی
این مطالعه اشاره میکند که چارچوبهای موجود مانند SocioVerse-ABM (دانشگاه فودان / مؤسسه نوآوری شانگهای، نسخه ۰.۲.۰، ۲۰۲۶) و AgentTorch (آزمایشگاه رسانه MIT) خروجی عاملها را با خطوط پایه مقایسه میکنند. SocioVerse-ABM مدلهای GPT-4o، DeepSeek-V3 و Qwen3-235B را در دوازده سناریو، از جمله مدل اپستین، ارزیابی میکند. با این حال، هیچکدام از این چارچوبها شامل یک مرحله پیش از شبیهسازی برای جداسازی اعوجاج تابع تصمیم از دینامیکهای نوظهور نیستند.
این موضوع با یافتههای لی و همکاران (۲۰۲۵، ACM FAccT) همسو است که گزارش دادند همراستاسازی اگرچه سوگیریهای صریح را کم میکند، اما سوگیریهای ضمنی اغلب باقی میمانند یا حتی رشد میکنند. برای متخصصان فنی، این بدان معناست که هر خط لوله LLM-ABM باید شامل یک «جاروب کالیبراسیون» (Calibration Sweep) باشد. اگر پاسخ یک عامل نسبت به قانون مرجع بهصورت یکنواخت غیرنزولی نباشد، نتایج شبیهسازی جمعیت احتمالاً نامعتبر است.
توصیههایی برای متخصصان
برای کاهش این ریسکها، نویسندگان پروتکل زیر را پیشنهاد میکنند:
- کالیبره کنید پیش از شبیهسازی: ورودیهای تصمیم را برای بررسی یکنواختی (Monotonicity) و مکان آستانه جاروب کنید. اگر این بررسی شکست خورد، شبیهسازی جمعیت را اجرا نکنید.
- برچسبها را بهعنوان پارامترهای طراحی گزارش کنید: جفتبرچسبهای مورد استفاده و جایگزینهای تستشده را بهطور دقیق مستند کنید.
- ترتیب گزینهها را متعادل کنید: ترتیب گزینهها را بین عاملها و تکرارها تغییر دهید تا سوگیری موقعیتی خنثی شود.
- بودجه سوگیری را منتشر کنید: مقدار هر مؤلفه سوگیری شناساییشده را در کنار نتایج اصلی گزارش کنید.
- تصمیمات مبتنی بر احتمال را ترجیح دهید: بهجای نمونهگیری متنی، هر برچسب را بر اساس احتمال لگاریتمی (Logits) امتیازدهی کنید. کالیبراسیون را با تفریق یک خط پایه بدون محتوا (مثلاً جایگزینی توصیف وضعیت با یک جایگاه خنثی) انجام دهید تا پیشفرضهای برچسب و موقعیت مستقیماً حذف شوند.
این تغییر در رویکرد، عاملهای LLM را از جایگزینهای «آمادهبهکار» برای قوانین، به مؤلفههایی تبدیل میکند که نیاز به کالیبراسیون آماری دقیق دارند؛ مشابه روشی که حسگرهای فیزیکی پیش از استفاده در یک آزمایش کالیبره میشوند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو