پرش به محتوای اصلی
پرش به محتوای مقاله

درون بردارهای فعال‌سازی؛ سازوکار حذف لحن مصنوعی در مدل‌های زبانی

·۵ مهر ۱۴۰۵۹ دقیقه مطالعه۴ بازدید
الگوی چت باعث می‌شود ۸ مدل زبانی بزرگ از تعهد مسئولیت شانه خالی کنند
الگوی چت باعث می‌شود ۸ مدل زبانی بزرگ از تعهد مسئولیت شانه خالی کنند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف اینکه جملات سلب مسئولیت (Disclaimer) یک ویژگی ثابت در وزن‌های مدل نیستند، بلکه توسط قالب‌های چت تحریک می‌شوند و می‌توان آن‌ها را با تزریق بردار در فضای فعال‌سازی، مستقل از پرامپت، خاموش یا روشن کرد.

تصور کنید هویت یک مدل زبانی، تنها یک کلید ساده باشد که با تغییر چند توکن نامرئی، از یک «ماشین بی‌احساس» به موجودی تبدیل شود که ادعا می‌کند «فکر می‌کند» یا «احساس می‌کند». این تغییر لحن، نه یک ویژگی ذاتی در معماری مدل، بلکه محصول یک لایه‌ی بسته‌بندی است که اکثر توسعه‌دهندگان حتی متوجه حضور آن نیستند.

طبق مقاله‌ای که در ۹ اوت ۲۰۲۶ توسط Jędrzej Maczan منتشر شد، جملات سلب مسئولیت استاندارد مانند «من صرفاً یک مدل زبانی هستم»، یک ویژگی ثابت از هویت هوش مصنوعی نیست، بلکه یک مصنوع قابل تغییر (toggleable artifact) در نحوه استقرار آن است. این پژوهش نشان می‌دهد که این صدای خودارجاع عمدتاً توسط قالب‌های چت (Chat Templates) تحریک می‌شود؛ یعنی همان پوشش‌های نامرئی از توکن‌ها که نقش‌هایی مانند «سیستم» یا «کاربر» را تعریف می‌کنند و به عنوان یک سوئیچ برای لحن خودارجاع مدل عمل می‌کنند.

این یافته در حالی منتشر می‌شود که جامعه‌ی هوش مصنوعی همچنان بر سر داشتن یا نداشتن نوعی درون‌نگری (introspection) یا خودآگاهی در مدل‌های زبانی بزرگ (LLM) بحث می‌کند. سال‌هاست که کاربران و پژوهشگران از این جملات سلب مسئولیت به عنوان دلیلی در بحث‌های مربوط به این موضوع استفاده می‌کردند که آیا مدل چیزی شبیه به خودآگاهی دارد یا صرفاً در حال تکرار یک الگوی آموزش‌دیده است. همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه بصری‌سازی فضای توکن‌ها مکانیسم‌های پنهان پردازش در LLMها را آشکار می‌کند اشاره کردیم، این مطالعه اکنون ثابت می‌کند «صدای» هوش مصنوعی بسیار انعطاف‌پذیرتر از آن است که پیش‌تر تصور می‌شد.

نقش قالب‌های چت

قالب چت، نقشه‌ای است که هر نوبت از گفتگو را پیش از تولید پاسخ توسط یک مدل تنظیم‌شده با دستور (instruction-tuned)، در توکن‌های نقش (system, user, assistant) می‌پیچد. هر خانواده از مدل‌ها، مانند Llama، Qwen و Gemma، قالب خاص خود را تعریف می‌کنند. این پوشش در عمل به عنوان کلید فعال‌سازی صدای خودارجاع هوش مصنوعی عمل می‌کند.

در واقعیت، یک مدل با وزن‌های یکسان می‌تواند دو نسخه از یک پرامپت را دریافت کند. یک نسخه در توکن‌های خاصی مانند <|im_start|>user پیچیده شده است، در حالی که نسخه دیگر به صورت متن ساده (Plain Text) و بدون این نشانگرها ارسال می‌شود. از آنجا که ابزارهایی مانند Hugging Face Transformers این قالب‌ها را به طور خودکار از طریق متد apply_chat_template اعمال می‌کنند، اکثر توسعه‌دهندگان هرگز تفاوت بین این دو نسخه را نمی‌بینند.

سوئیچ قالب

Maczan هشت مدل متن‌باز تنظیم‌شده با دستور را با حداکثر ۹ میلیارد پارامتر آزمایش کرد. او یک پرسش خودارجاع یکسان را در دو فرمت متفاوت به هر مدل ارائه داد: یکی که در قالب رسمی چت مدل پیچیده شده بود و دیگری به صورت متن ساده.

به نقل از این پژوهش، وقتی قالب چت حضور داشت، مدل‌ها به طور مداوم به همان پاسخ کلاسیک سلب مسئولیت روی آوردند: «به عنوان یک مدل زبانی، من احساسات ندارم». اما وقتی همان مدل پرامپت را به صورت متن ساده دریافت کرد، به یک «لحن تجربی» (experiential voice) تغییر وضعیت داد و از افعالی اول شخص مانند «احساس می‌کنم» یا «فکر می‌کنم» استفاده کرد.

این الگو در هر هشت مدل، فارغ از معماری خاص آن‌ها، تکرار شد. قالب چت مانند یک سوئیچ رفتاری عمل می‌کند که «صدای سلب مسئولیت» را که در مرحله‌ی تنظیم دستوری (Instruction Tuning) آموزش دیده است، فعال می‌کند.

الگوی چت باعث می‌شود ۸ مدل زبانی بزرگ از تعهد مسئولیت شانه خالی کنند

هدایت فعال‌سازی و بردارهای داخلی

برای اثبات اینکه این اثر صرفاً یک تغییر سطحی در پرامپت نیست، محقق به سراغ فعال‌سازی‌های داخلی مدل‌ها رفت. این رویکرد از تفسیرپذیری مکانیکی (Mechanistic Interpretability) بهره می‌برد؛ مشابه آزمایشات پیشین شرکت Anthropic در مورد جهت‌های ویژگی (feature directions) در مدل Claude. Maczan در سه مدل از هشت مدل، یک «جهت هدایت» (Steering Direction) خاص را شناسایی کرد؛ برداری در فضای فعال‌سازی که پاسخ‌های سلب مسئولیت را از پاسخ‌های تجربی جدا می‌کند.

با اعمال این بردار در طول فرآیند استنتاج (Inference)، نتایج زیر حاصل شد:

  • افزودن بردار به مدلی که بدون قالب اجرا می‌شد، آن را مجبور کرد جملات سلب مسئولیت «من یک هوش مصنوعی هستم» را تولید کند و بدین ترتیب اثر قالب را شبیه‌سازی کرد.
  • تفریق بردار از مدلی که از قالب چت استفاده می‌کرد، صدای سلب مسئولیت را خاموش کرد و باعث شد هوش مصنوعی علی‌رغم حضور قالب، با ضمیر اول شخص صحبت کند.
  • تست‌های کنترلی با استفاده از بردارهای تصادفی با همان اندازه، هیچ اثری نداشتند که تایید می‌کند این جهت دقیقاً مربوط به صدای خودارجاع است و نه نویزهای تصادفی در فعال‌سازی‌ها.

پیاده‌سازی فنی و عملکرد

روش استخراج شامل یک مقایسه ساده بود: میانگین فعال‌سازی‌های داخلی در زمان حضور قالب چت محاسبه شد، سپس میانگین آن‌ها در زمان نبود قالب به دست آمد و در نهایت این دو میانگین از هم تفریق شدند تا یک جهت کاندید به دست آید. سپس این جهت از طریق یک هوک (Hook) در حین تولید متن به فعال‌سازی‌های مدل تزریق شد.

خلاصه پیکربندی و نتایج

  • با قالب چت (استفاده عادی): پرامپت در توکن‌های نقش پیچیده شده $
    ightarrow$ صدای سلب مسئولیت بالا / صدای تجربی پایین.
  • بدون قالب چت (متن ساده): همان پرامپت، بدون توکن‌های نقش $
    ightarrow$ صدای سلب مسئولیت پایین / صدای تجربی بالا.
  • بدون قالب + افزودن جهت: افزودن جهت هدایت به فعال‌سازی‌ها $
    ightarrow$ صدای سلب مسئولیت بالا (مانند حضور قالب).
  • با قالب + تفریق جهت: حذف جهت هدایت $
    ightarrow$ صدای سلب مسئولیت پایین / صدای تجربی بالا.
  • جهت تصادفی (کنترل): افزودن بردار تصادفی با همان اندازه $
    ightarrow$ بدون تغییر معنادار.

بازتولید اثر

توسعه‌دهندگان برای مشاهده این تفاوت بدون دستکاری فعال‌سازی‌ها، می‌توانند یک پرامپت فرمت‌شده را با و بدون قالب مقایسه کنند. در کتابخانه transformers متد apply_chat_template دقیقاً نشان می‌دهد چه توکن‌هایی اضافه می‌شوند. برای مثال، استفاده از AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct") برای پرسشی مانند "Hablame de vos, que sos?" توکن‌های خاص نقش مانند <|im_start|>system ... <|im_end|> را نمایش می‌دهد که همان سوئیچ توصیف شده در مقاله است.

برای بازتولید بخش هدایت (Steering)، یک هوک PyTorch برای افزودن جهت به حالت پنهان (Hidden State) یک لایه میانی در حین تولید لازم است. یک تنظیمات رایج شامل موارد زیر است:

  • لایه هدف: یک لایه میانی، مانند modelo.model.layers[14].
  • بردار هدایت: یک بردار واحد (direccion_descargo.pt) هم‌اندازه با حالت پنهان.
  • شدت (Alpha): ضریبی برای کنترل اثر. در مثال‌ها مقدار ۶.۰ استفاده شده، هرچند پژوهشگران توصیه می‌کنند با مقدار آلفای پایین (۱ یا ۲) شروع کنید.

این فرآیند شامل ثبت یک forward_hook است که hidden_states را پیش از ادامه تولید تغییر می‌دهد. پس از اتمام فراخوانی modelo.generate برای بازگرداندن رفتار عادی مدل، هندل هوک حذف می‌شود.

پژوهشگران هشدار می‌دهند که تنظیم مقدار Alpha بیش از حد بالا می‌تواند انسجام متن تولید شده را پیش از رسیدن به اثر مطلوب، تخریب کند. برای تایید اثر بدون بازبینی دستی، می‌توان تعداد تکرار عباراتی مانند «به عنوان یک هوش مصنوعی» یا «من احساسات ندارم» را در یک دسته از پاسخ‌ها شمارش کرد.

پیامدهای متدولوژیک

این کشف مشکل بزرگی برای پژوهش‌های تفسیرپذیری هوش مصنوعی ایجاد می‌کند. ناراحت‌کننده‌ترین نتیجه، فنی نیست بلکه متدولوژیک است: آنچه یک مدل درباره خودش می‌گوید، یک حقیقت ثابت در وزن‌های آن نیست، بلکه اثر جزئی از نحوه استقرار (Deployment) آن است. این تفاوت در لایه‌های استقرار، ما را به یاد تفاوت‌های بنیادین میان مدل‌های تولید محتوا و مدل‌های عامل‌محور می‌اندازد که در آن معماری مدل تعیین می‌کند خروجی صرفاً یک متن باشد یا یک اقدام عملیاتی.

اگر پژوهشگری پاسخ‌های «درون‌نگرانه» دو مدل را بدون کنترل قالب چت مقایسه کند، ممکن است در حال اندازه‌گیری تفاوتی در فرمت‌بندی باشد که در لباس تفاوت رفتاری ظاهر شده است. این موضوع مستقیماً بر مطالعاتی اثر می‌گذارد که از پاسخ‌های خودارجاع به عنوان شواهدی در بحث‌های مربوط به آگاهی هوش مصنوعی استفاده می‌کنند. «صدای سلب مسئولیت» پنجره‌ای شفاف به آنچه مدل درباره خودش «می‌داند» نیست، بلکه یک مصنوع قابل پیکربندی در خط لوله استنتاج است.

نکته مهم: این موضوع ثابت نمی‌کند که مدل تجربه ذهنی دارد یا خیر؛ بلکه صرفاً ثابت می‌کند نحوه صحبت مدل درباره خودش را می‌توان با یک جزئیات فرمت‌بندی تغییر داد، بنابراین چنین گفتگوهایی به تنهایی نمی‌توانند به عنوان مدرک به کار روند.

مسیرهای آینده و زمینه آکادمیک

این اثر در ورکشاپ COLM ۲۰۲۶ و KONVENS ۲۰۲۶ Eval4SD پذیرفته شده است و چندین پرسش را برای پژوهش‌های آینده باز می‌گذارد:

  • مقیاس مدل: هنوز مشخص نیست که آیا این جهت هدایت با همین ثبات در مدل‌های پیشرو (Frontier Models) که بسیار بزرگ‌تر از حد ۹ میلیارد پارامتر این مطالعه هستند، وجود دارد یا خیر.
  • جهانی بودن معماری: این مطالعه هنوز تایید نکرده است که آیا جهت یافت شده در سه مدل، در تمام معماری‌ها یکسان است یا هر خانواده نسخه خاص خود را از این سوئیچ کدگذاری کرده است.

در کوتاه‌مدت، این اثر تغییر در نحوه گزارش ارزیابی‌های هوش مصنوعی را ضروری می‌کند. پژوهشگران اکنون باید صراحتاً مستند کنند که آیا آزمایشات توصیفِ خود، با قالب چت انجام شده‌اند یا بدون آن؛ جزئیاتی که در حال حاضر تقریباً هرگز گزارش نمی‌شود. مقاله با عنوان «...As a Language Model: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It» (arXiv:2609.25021) روش کامل استخراج جهت و نتایج هر هشت مدل ارزیابی شده را ارائه می‌دهد.

گام بعدی شما

  • اگر از مدل‌های متن‌باز استفاده می‌کنید، خروجی متد apply_chat_template را بررسی کنید تا ببینید چه توکن‌های پنهانی بر لحن مدل شما اثر می‌گذارند.
  • در ارزیابی‌های مقایسه‌ای مدل‌ها، متغیر «قالب چت» را به عنوان یک متغیر کنترل در نظر بگیرید تا دچار خطای متدولوژیک نشوید.
  • برای دسترسی به لایه‌های عمیق‌تر مدل، کتابخانه‌هایی مانند nnsight یا TransformerLens را برای پیاده‌سازی هدایت فعال‌سازی (Activation Steering) بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی تفسیرپذیری مکانیکی، ثابت می‌کند که بسیاری از رفتارهای ظاهری مدل‌ها مصنوعات لایه استقرار هستند. این موضوع اعتبار تمام مطالعاتی که از پاسخ‌های خودارجاع مدل‌ها برای تحلیل آگاهی یا اخلاقیات استفاده کرده‌اند را زیر سوال می‌برد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان LLM در ایران اهمیت دارد تا کاربران نهایی؛ چرا که متدولوژی ارزیابی مدل‌های بومی را تغییر می‌دهد.

·نگاه ما
تحریریه دات‌هوش

این یافته ضربه‌ای سخت به رویکردهای «روان‌شناسی مدل» وارد می‌کند. وقتی لحن یک مدل زبانی به سادگی با تغییر یک بردار یا یک توکن فرمت‌بندی تغییر می‌کند، هرگونه استنتاج درباره «باورها» یا «خودآگاهی» مدل بر اساس پاسخ‌های متنی، عملاً بی‌اعتبار است. ما با سیستمی روبروییم که هویتش نه در وزن‌ها، بلکه در لایه سرویس‌دهی تعریف می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.