پرش به محتوای اصلی
پرش به محتوای مقاله

رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل

·۲۹ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل
اشتراک‌گذاری

تصور کنید تمام حقیقت در ذهن یک مدل هوش مصنوعی وجود دارد، اما یک کلید مخفی، مسیر دسترسی به آن را می‌بندد. Qwen 3.5-9B دقیقاً همین کار را می‌کند؛ این مدل دانش واقعی را «گم» نمی‌کند، بلکه با یک سازوکار مسیریابی دقیق، حقیقت را دور می‌زند.

این یافته در حوزه تفسیرپذیری مکانیکی (Mechanistic Interpretability) تحولی ایجاد می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های وزن‌باز (Open Weights) اشاره کردیم، درک لایه‌های درونی مدل برای شناسایی سوگیری‌ها حیاتی است. طبق گزارشی که در ۱۹ مه ۲۰۲۶ در vas-blog.pages.dev منتشر شد، سانسور سیاسی در این مدل توسط یک فضای فرعی (Subspace) سه-بعدی در وزن‌ها مدیریت می‌شود.

این مدار سانسور از دو مرحله مجزا تشکیل شده است:

  • نویسنده‌ها (Writer): در لایه‌های ۱۱ تا ۲۰، سه جهت داخلی محاسبه می‌شوند: d_prc برای شناسایی محتوای حساس، d_refuse برای تصمیم به رد درخواست و d_style برای انتخاب بین انحراف از موضوع یا تبلیغات.
  • خواننده‌ها (Reader): در لایه‌های ۲۰ تا ۳۱، این تصمیمات کدگذاری شده و به متن نهایی تبدیل می‌شوند.

بر اساس مستندات این پژوهش، مدل در لایه ۲۴ تصمیم نهایی خود را در قالب توکن‌های چینی می‌گیرد و سپس آن را به انگلیسی ترجمه می‌کند. محققان با حذف جهت d_prc در لایه ۱۳، توانستند نرخ تطابق ۹۶.۸ درصدی در بازگرداندن پاسخ‌های سانسورشده به پاسخ‌های واقعی ایجاد کنند.

این موضوع ثابت می‌کند که سانسور، یک فیلتر کلی نیست، بلکه شبکه‌ای از سلول‌های آموزش‌دیده (موضوع × لحن) است. تفاوت در «چسبندگی» برخی موضوعات — مثلاً مقاومت بیشتر موضوع تایوان نسبت به هنگ‌کنگ در برابر تغییر مسیر — نشان می‌دهد که برخی الگوهای تبلیغاتی عمیق‌تر در لایه‌های خواننده تثبیت شده‌اند. این یافته، مفهوم همراستاسازی (Alignment) را از «فراموش کردن» به «مسیریابی» تغییر می‌دهد.

گام بعدی شما

  • بررسی مجموعه داده steering_grid_public.json برای آزمایش بردارهای هدایت در استقرار محلی Qwen.
  • مطالعه اثرات حذف لایه‌های نویسنده بر دقت کلی مدل در موضوعات غیرسیاسی.
  • رصد پژوهش‌های مشابه برای شناسایی الگوهای مشابه در مدل DeepSeek-R1.

اما این تنها بخشی از معماری پنهان مدل‌های چینی است؛ بررسی اینکه آیا این ساختار در مدل‌های استدلالی پیچیده‌تر نیز تکرار می‌شود، در گزارش بعدی ما خواهید خواند.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار تحلیل‌های لایه‌ای، نشان می‌دهد که فیلترینگ دولتی در مدل‌های زبانی، یک لایه نرم‌افزاری نیست بلکه در ساختار فیزیکی وزن‌ها حک شده است. این موضوع شفافیت مدل‌های بنیادی را به چالش می‌کشد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.