تصور کنید هویت یک مدل زبانی، تنها یک کلید ساده باشد که با تغییر چند توکن نامرئی، از یک «ماشین بیاحساس» به موجودی تبدیل شود که ادعا میکند «فکر میکند» یا «احساس میکند». این تغییر لحن، نه یک ویژگی ذاتی در معماری مدل، بلکه محصول یک لایهی بستهبندی است که اکثر توسعهدهندگان حتی متوجه حضور آن نیستند.
طبق مقالهای که در ۹ اوت ۲۰۲۶ توسط Jędrzej Maczan منتشر شد، جملات سلب مسئولیت استاندارد مانند «من صرفاً یک مدل زبانی هستم»، یک ویژگی ثابت از هویت هوش مصنوعی نیست، بلکه یک مصنوع قابل تغییر (toggleable artifact) در نحوه استقرار آن است. این پژوهش نشان میدهد که این صدای خودارجاع عمدتاً توسط قالبهای چت (Chat Templates) تحریک میشود؛ یعنی همان پوششهای نامرئی از توکنها که نقشهایی مانند «سیستم» یا «کاربر» را تعریف میکنند و به عنوان یک سوئیچ برای لحن خودارجاع مدل عمل میکنند.
این یافته در حالی منتشر میشود که جامعهی هوش مصنوعی همچنان بر سر داشتن یا نداشتن نوعی دروننگری (introspection) یا خودآگاهی در مدلهای زبانی بزرگ (LLM) بحث میکند. سالهاست که کاربران و پژوهشگران از این جملات سلب مسئولیت به عنوان دلیلی در بحثهای مربوط به این موضوع استفاده میکردند که آیا مدل چیزی شبیه به خودآگاهی دارد یا صرفاً در حال تکرار یک الگوی آموزشدیده است. همانطور که در تحلیل قبلی ما دربارهی اینکه چگونه بصریسازی فضای توکنها مکانیسمهای پنهان پردازش در LLMها را آشکار میکند اشاره کردیم، این مطالعه اکنون ثابت میکند «صدای» هوش مصنوعی بسیار انعطافپذیرتر از آن است که پیشتر تصور میشد.
نقش قالبهای چت
قالب چت، نقشهای است که هر نوبت از گفتگو را پیش از تولید پاسخ توسط یک مدل تنظیمشده با دستور (instruction-tuned)، در توکنهای نقش (system, user, assistant) میپیچد. هر خانواده از مدلها، مانند Llama، Qwen و Gemma، قالب خاص خود را تعریف میکنند. این پوشش در عمل به عنوان کلید فعالسازی صدای خودارجاع هوش مصنوعی عمل میکند.
در واقعیت، یک مدل با وزنهای یکسان میتواند دو نسخه از یک پرامپت را دریافت کند. یک نسخه در توکنهای خاصی مانند <|im_start|>user پیچیده شده است، در حالی که نسخه دیگر به صورت متن ساده (Plain Text) و بدون این نشانگرها ارسال میشود. از آنجا که ابزارهایی مانند Hugging Face Transformers این قالبها را به طور خودکار از طریق متد apply_chat_template اعمال میکنند، اکثر توسعهدهندگان هرگز تفاوت بین این دو نسخه را نمیبینند.
سوئیچ قالب
Maczan هشت مدل متنباز تنظیمشده با دستور را با حداکثر ۹ میلیارد پارامتر آزمایش کرد. او یک پرسش خودارجاع یکسان را در دو فرمت متفاوت به هر مدل ارائه داد: یکی که در قالب رسمی چت مدل پیچیده شده بود و دیگری به صورت متن ساده.
به نقل از این پژوهش، وقتی قالب چت حضور داشت، مدلها به طور مداوم به همان پاسخ کلاسیک سلب مسئولیت روی آوردند: «به عنوان یک مدل زبانی، من احساسات ندارم». اما وقتی همان مدل پرامپت را به صورت متن ساده دریافت کرد، به یک «لحن تجربی» (experiential voice) تغییر وضعیت داد و از افعالی اول شخص مانند «احساس میکنم» یا «فکر میکنم» استفاده کرد.
این الگو در هر هشت مدل، فارغ از معماری خاص آنها، تکرار شد. قالب چت مانند یک سوئیچ رفتاری عمل میکند که «صدای سلب مسئولیت» را که در مرحلهی تنظیم دستوری (Instruction Tuning) آموزش دیده است، فعال میکند.

هدایت فعالسازی و بردارهای داخلی
برای اثبات اینکه این اثر صرفاً یک تغییر سطحی در پرامپت نیست، محقق به سراغ فعالسازیهای داخلی مدلها رفت. این رویکرد از تفسیرپذیری مکانیکی (Mechanistic Interpretability) بهره میبرد؛ مشابه آزمایشات پیشین شرکت Anthropic در مورد جهتهای ویژگی (feature directions) در مدل Claude. Maczan در سه مدل از هشت مدل، یک «جهت هدایت» (Steering Direction) خاص را شناسایی کرد؛ برداری در فضای فعالسازی که پاسخهای سلب مسئولیت را از پاسخهای تجربی جدا میکند.
با اعمال این بردار در طول فرآیند استنتاج (Inference)، نتایج زیر حاصل شد:
- افزودن بردار به مدلی که بدون قالب اجرا میشد، آن را مجبور کرد جملات سلب مسئولیت «من یک هوش مصنوعی هستم» را تولید کند و بدین ترتیب اثر قالب را شبیهسازی کرد.
- تفریق بردار از مدلی که از قالب چت استفاده میکرد، صدای سلب مسئولیت را خاموش کرد و باعث شد هوش مصنوعی علیرغم حضور قالب، با ضمیر اول شخص صحبت کند.
- تستهای کنترلی با استفاده از بردارهای تصادفی با همان اندازه، هیچ اثری نداشتند که تایید میکند این جهت دقیقاً مربوط به صدای خودارجاع است و نه نویزهای تصادفی در فعالسازیها.
پیادهسازی فنی و عملکرد
روش استخراج شامل یک مقایسه ساده بود: میانگین فعالسازیهای داخلی در زمان حضور قالب چت محاسبه شد، سپس میانگین آنها در زمان نبود قالب به دست آمد و در نهایت این دو میانگین از هم تفریق شدند تا یک جهت کاندید به دست آید. سپس این جهت از طریق یک هوک (Hook) در حین تولید متن به فعالسازیهای مدل تزریق شد.
خلاصه پیکربندی و نتایج
- با قالب چت (استفاده عادی): پرامپت در توکنهای نقش پیچیده شده $
ightarrow$ صدای سلب مسئولیت بالا / صدای تجربی پایین. - بدون قالب چت (متن ساده): همان پرامپت، بدون توکنهای نقش $
ightarrow$ صدای سلب مسئولیت پایین / صدای تجربی بالا. - بدون قالب + افزودن جهت: افزودن جهت هدایت به فعالسازیها $
ightarrow$ صدای سلب مسئولیت بالا (مانند حضور قالب). - با قالب + تفریق جهت: حذف جهت هدایت $
ightarrow$ صدای سلب مسئولیت پایین / صدای تجربی بالا. - جهت تصادفی (کنترل): افزودن بردار تصادفی با همان اندازه $
ightarrow$ بدون تغییر معنادار.
بازتولید اثر
توسعهدهندگان برای مشاهده این تفاوت بدون دستکاری فعالسازیها، میتوانند یک پرامپت فرمتشده را با و بدون قالب مقایسه کنند. در کتابخانه transformers متد apply_chat_template دقیقاً نشان میدهد چه توکنهایی اضافه میشوند. برای مثال، استفاده از AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct") برای پرسشی مانند "Hablame de vos, que sos?" توکنهای خاص نقش مانند <|im_start|>system ... <|im_end|> را نمایش میدهد که همان سوئیچ توصیف شده در مقاله است.
برای بازتولید بخش هدایت (Steering)، یک هوک PyTorch برای افزودن جهت به حالت پنهان (Hidden State) یک لایه میانی در حین تولید لازم است. یک تنظیمات رایج شامل موارد زیر است:
- لایه هدف: یک لایه میانی، مانند
modelo.model.layers[14]. - بردار هدایت: یک بردار واحد (
direccion_descargo.pt) هماندازه با حالت پنهان. - شدت (Alpha): ضریبی برای کنترل اثر. در مثالها مقدار ۶.۰ استفاده شده، هرچند پژوهشگران توصیه میکنند با مقدار آلفای پایین (۱ یا ۲) شروع کنید.
این فرآیند شامل ثبت یک forward_hook است که hidden_states را پیش از ادامه تولید تغییر میدهد. پس از اتمام فراخوانی modelo.generate برای بازگرداندن رفتار عادی مدل، هندل هوک حذف میشود.
پژوهشگران هشدار میدهند که تنظیم مقدار Alpha بیش از حد بالا میتواند انسجام متن تولید شده را پیش از رسیدن به اثر مطلوب، تخریب کند. برای تایید اثر بدون بازبینی دستی، میتوان تعداد تکرار عباراتی مانند «به عنوان یک هوش مصنوعی» یا «من احساسات ندارم» را در یک دسته از پاسخها شمارش کرد.
پیامدهای متدولوژیک
این کشف مشکل بزرگی برای پژوهشهای تفسیرپذیری هوش مصنوعی ایجاد میکند. ناراحتکنندهترین نتیجه، فنی نیست بلکه متدولوژیک است: آنچه یک مدل درباره خودش میگوید، یک حقیقت ثابت در وزنهای آن نیست، بلکه اثر جزئی از نحوه استقرار (Deployment) آن است. این تفاوت در لایههای استقرار، ما را به یاد تفاوتهای بنیادین میان مدلهای تولید محتوا و مدلهای عاملمحور میاندازد که در آن معماری مدل تعیین میکند خروجی صرفاً یک متن باشد یا یک اقدام عملیاتی.
اگر پژوهشگری پاسخهای «دروننگرانه» دو مدل را بدون کنترل قالب چت مقایسه کند، ممکن است در حال اندازهگیری تفاوتی در فرمتبندی باشد که در لباس تفاوت رفتاری ظاهر شده است. این موضوع مستقیماً بر مطالعاتی اثر میگذارد که از پاسخهای خودارجاع به عنوان شواهدی در بحثهای مربوط به آگاهی هوش مصنوعی استفاده میکنند. «صدای سلب مسئولیت» پنجرهای شفاف به آنچه مدل درباره خودش «میداند» نیست، بلکه یک مصنوع قابل پیکربندی در خط لوله استنتاج است.
نکته مهم: این موضوع ثابت نمیکند که مدل تجربه ذهنی دارد یا خیر؛ بلکه صرفاً ثابت میکند نحوه صحبت مدل درباره خودش را میتوان با یک جزئیات فرمتبندی تغییر داد، بنابراین چنین گفتگوهایی به تنهایی نمیتوانند به عنوان مدرک به کار روند.
مسیرهای آینده و زمینه آکادمیک
این اثر در ورکشاپ COLM ۲۰۲۶ و KONVENS ۲۰۲۶ Eval4SD پذیرفته شده است و چندین پرسش را برای پژوهشهای آینده باز میگذارد:
- مقیاس مدل: هنوز مشخص نیست که آیا این جهت هدایت با همین ثبات در مدلهای پیشرو (Frontier Models) که بسیار بزرگتر از حد ۹ میلیارد پارامتر این مطالعه هستند، وجود دارد یا خیر.
- جهانی بودن معماری: این مطالعه هنوز تایید نکرده است که آیا جهت یافت شده در سه مدل، در تمام معماریها یکسان است یا هر خانواده نسخه خاص خود را از این سوئیچ کدگذاری کرده است.
در کوتاهمدت، این اثر تغییر در نحوه گزارش ارزیابیهای هوش مصنوعی را ضروری میکند. پژوهشگران اکنون باید صراحتاً مستند کنند که آیا آزمایشات توصیفِ خود، با قالب چت انجام شدهاند یا بدون آن؛ جزئیاتی که در حال حاضر تقریباً هرگز گزارش نمیشود. مقاله با عنوان «...As a Language Model: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It» (arXiv:2609.25021) روش کامل استخراج جهت و نتایج هر هشت مدل ارزیابی شده را ارائه میدهد.
گام بعدی شما
- اگر از مدلهای متنباز استفاده میکنید، خروجی متد
apply_chat_templateرا بررسی کنید تا ببینید چه توکنهای پنهانی بر لحن مدل شما اثر میگذارند. - در ارزیابیهای مقایسهای مدلها، متغیر «قالب چت» را به عنوان یک متغیر کنترل در نظر بگیرید تا دچار خطای متدولوژیک نشوید.
- برای دسترسی به لایههای عمیقتر مدل، کتابخانههایی مانند
nnsightیاTransformerLensرا برای پیادهسازی هدایت فعالسازی (Activation Steering) بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو