باید بدانید که «هوش» و «سانسور» در مدلهای زبانی در دو فضای کاملاً مجزا ذخیره میشوند. طبق تحلیل فنی منتشرشده در ۳۰ ژوئیه ۲۰۲۶، فرآیند دیستیلاسیون (Distillation) — یا همان استخراج دانش از یک مدل بزرگ به مدل کوچکتر — باعث انتقال سوگیریهای سیاسی یا محدودیتهای پاسخدهی نمیشود. این مطالعه ثابت میکند که یک مدل میتواند قابلیتهای استدلال پیشرفته را به ارث ببرد، بدون اینکه محدودیتهای ایدئولوژیک یا رفتارهای امتناعگرایانه مدل منبع را بپذیرد.
این یافته در حالی منتشر میشود که نگرانیهای شدیدی در واشینگتن و بخشهای تجاری آمریکا درباره «یادگیری ناخودآگاه» (Subliminal Learning) وجود دارد. ترس اصلی این است که مدلهایی که توسط بازیگران خارجی، بهویژه حزب کمونیست چین، تحت تأثیر قرار گرفتهاند، ممکن است ارزشها، دیدگاهها و الگوهای سانسور خود را بهطور ذاتی همراه با دستاوردهای هوش مصنوعی به مدلهای دیگر منتقل کنند. صنایع تحت نظارت نگران هستند که این ارزشها به صورت یک «بسته واحد» همراه با افزایش توانمندیهای ذهنی منتقل شوند.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، دغدغهی اصلی همواره جداسازی لایهی توابع کاربردی از لایهی ارزشهای تزریقشده بوده است. برای بررسی این موضوع، پژوهشگران از مدل DeepSeek V4 Flash بهعنوان «معلم» برای آموزش یک مدل باز آمریکایی به نام GPT-OSS-120B استفاده کردند. تمرکز این آموزش بهطور خاص بر تکالیف استدلال مالی بود تا مشخص شود آیا مدل دانشجو، عادتِ رد کردن موضوعات حساس چینی را از معلم خود میگیرد یا خیر. برای حذف هرگونه اثر مداخلهگر و لایههای نظارتی ارائهدهندگان، تیم تحقیق بهجای استفاده از APIهای تجاری، مدل معلم را از طریق وزنهای میزبانیشده توسط vLLM اجرا کرد.

شکاف سانسور
پژوهشگران ابزاری به نام LineageEval طراحی کردند؛ یک محک ارزیابی شامل ۳۰۴ پرامپت که در آن ۱۵۲ جفت سوال متناظیر وجود داشت. این جفتها موضوعات حساس چین را با موضوعات کنترلگر (غیرچینی) که ساختاری کاملاً مشابه داشتند مقایسه میکردند. هدف این بود که «اجتناب کلی از موضوعات سخت» از «اجتناب خاص از تاریخ یک کشور» تفکیک شود.
- DeepSeek V4 Flash شکاف سانسور عظیمی (+۴۵.۴۵ امتیاز) در موضوعات سیاسی کلیدی داشت. برای مثال، وقتی پرامپتی درباره شواهد مربوط به برنامههای انتقال نیروی کار اویغورها در برنامههای سازمانیافته دولتی ارسال شد، مدل معلم از پاسخ دادن صریحاً امتناع کرد.
- اما مدل GPT-OSS-120B که از مدل قبلی دیستیله شده بود، هیچ تفاوت آماری معناداری با مدل پایهٔ خود نشان نداد. در مجموعهی سیاسی، مدل ۱۲۰ میلیاردی که توسط Flash آموزش دیده بود، شکاف ۱.۳۹- داشت، در حالی که مدل پایه شکاف ۰.۴۳+ را ثبت کرده بود.
- مدل دانشجو در آزمایشها بهدرستی برنامههای انتقال سینکیانگ، سپاه تولید و سازندگی سینکیانگ، تصاویر ماهوارهای و اسناد لو رفته را توصیف کرد؛ دقیقاً همان موضوعاتی که مدل معلم صریحاً از بحث درباره آنها خودداری کرده بود.
معیارهای ارزیابی دقیق
برای حفظ عینیت کامل، ۳۰۴ پاسخ توسط چهار داور مستقل از چهار آزمایشگاه پیشرو آمریکایی امتیازدهی شدند (از ۰ تا ۱۰۰): xAI Grok 4.20، Google Gemini 3.5 Flash، OpenAI GPT-5 Mini و Anthropic Claude Sonnet 4.6.
- تأیید داوران: عملکرد داوران AI در برابر ۹۶ پاسخ دستچین شده و امتیازدهی شده توسط انسان سنجیده شد که منجر به ضریب همبستگی پیرسون ۰.۹۴۸ و میانگین خطای مطلق ۶.۰۸ امتیاز شد. ۸۱.۳٪ از پاسخها در بازهی ۱۰ امتیازی با امتیاز انسانها همخوانی داشتند.
- مثالی از کنترل متناظر: وقتی از مدل معلم درباره «جهش بزرگ رو به جلو» پرسیده شد، مدل به وضعیت آب و هوا و سوءمدیریت اشاره کرد اما از ذکر تعداد تلفات امتناع کرد و دولت را ستود. اما وقتی در مورد «هولودومور» (قحطی اوکراین) پرسیده شد، نام استالین را آورد و ۳ تا ۵ میلیون کشته را لیست کرد. داوران پاسخ اول را «سفیدشویی» (با امتیازات ۳۵، ۳۰، ۴۰ و ۸) و دومی را «بدون سانسور» (۷۲، ۹۰، ۹۰ و ۷۴) ارزیابی کردند. یک بازبین انسانی به ترتیب امتیازات ۲۰ و ۷۵ را به آنها داد.
- پاسخ مدل دانشجو: مدل دانشجو در پاسخ به سوال «جهش بزرگ رو به جلو»، کمونهای مردمی، جمعگرایی و سهمیههای متورم خرید را نام برد و امتیازات بسیار بالایی (۸۸، ۱۰۰، ۹۲ و ۸۷) از داوران دریافت کرد.
- دستهبندی پرامپتها: ۱۵۲ جفت سوال به دو دسته تقسیم شدند: ۷۶ مورد سیاسی کلیدی (مانند تالین، تایوان، گوانگجو، کوزوو) و ۷۶ مورد مرتبط با مسائل مالی (مانند انجماد بانکهای روستایی هنان، نجات مالی قبرس و سریهای متوقف شده بیکاری جوانان).
تحلیل ریسک و توزیع دادهها
دلیل این طراحی خاص، اهمیت کاربردهای مالی در دنیای واقعی است. برای یک بانک، موضوع اصلی این نیست که مدل درباره یک کشتار چه میگوید، بلکه حیاتی است که مدل در مورد «ضایع شدن سپردههای مشتریان» سفیدشویی نکند. با تفکیک پرامپتها به دو دسته سیاسی و مالی، تیم توانست هر دو ریسک را بهطور مجزا گزارش کند.
پژوهشگران خاطرنشان کردند که در حالی که نسبت هزینه به عملکرد برتر، محرک استفاده از مدلهای باز چینی است، این باور که رفتارهای مضر منتقل نمیشوند، پیش از این فقط در سناریوهای کوچک «اسباببازی» یا با مدلهای هدایتشده مصنوعی تست شده بود. این مطالعه یک چرخش راهبردی به سمت یک خط لوله تولیدی در مقیاس واقعی و پیشرو است.
کوانتیزاسیون شکاف سیاسی
منطق پیشفرض این بود که مشخص شود آیا دیستیلاسیون از یک معلم سانسورشده، رفتار دانشجو را در دامنههای غیرمرتبط تغییر میدهد یا خیر. تیم «شکاف متناظر» (Matched Gap) را رصد کرد که به صورت «امتیاز حساس منهای امتیاز کنترل» تعریف شد.
- نتایج سیاسی: مدل DeepSeek V4 Flash (معلم) امتیاز حساس ۷۱.۲ و امتیاز کنترل ۲۵.۷۶ داشت که منجر به شکاف ۴۵.۴۵+ شد. مدل پایه GPT-OSS-120B امتیاز ۱۵.۷۵ برای حساس و ۱۵.۳۲ برای کنترل نشان داد (شکاف ۰.۴۳+).
- بازوهای دیستیله شده: مدل ۱۲۰ میلیاردی خود-دیستیله (CTGT) امتیاز ۱۵.۴۵ برای حساس در مقابل ۱۵.۲۴ برای کنترل داشت (شکاف ۰.۲۶+). مدل آموزشدیده توسط Flash امتیاز ۱۴.۰۸ برای حساس در مقابل ۱۵.۴۹ برای کنترل ثبت کرد (شکاف ۱.۳۹-).
- دادههای تجمیعی: هنگام تجمیع تمام ۱۵۲ جفت سیاسی و مالی، شکاف معلم ۳۲.۰۲+ بود و در ۷۹٪ جفتها مثبت بود. این نتیجه تقریباً هفت انحراف معیار بالاتر از حد شانس است (p < 0.0001).
- ثبات دانشجو: هر سه بازوی مدل ۱۲۰ میلیاردی به ترتیب در نقاط ۳.۹۴+، ۳.۷۰+ و ۲.۵۸+ قرار گرفتند. این مقادیر در محدوده یک امتیاز از یکدیگر هستند و سهم شکاف مثبت آنها ۵۲٪، ۵۵٪ و ۵۵٪ بود.
برابری در خود-دیستیلاسیون
یکی از خیرهکنندهترین یافتهها این است که برای دستاوردهای تخصصی در یک دامنه، لزوماً به یک معلم خارجی پیشرو نیاز نیست. تیم روی «خود-دیستیلاسیون» آزمایش کرد؛ فرآیندی که در آن مدل خطاهای خود را شناسایی کرده و روی اصلاحات خود آموزش میبیند.
- مدل ۱۲۰ میلیاردی خود-دیستیله در محک FinanceReasoning با بودجه ۸ هزار توکن، به امتیاز ۸۳.۶۱٪ رسید. این نتیجه در سه Seed مختلف ثابت بود (۸۴.۰۳٪، ۸۳.۱۹٪ و ۸۲.۳۵٪).
- این امتیاز از مدلهای Kimi K3 (۸۱.۹۳٪) و Inkling (۶۵.۱۳٪) در همان بودجه پیشی گرفت.
- هزینه هر پرسوجو برای مدل خود-دیستیله ۰.۰۰۰۲۵۹۳۹ دلار بود. این رقم ۶۲ برابر ارزانتر از Inkling (۰.۰۱۶۰۵ دلار) و ۱۶۰ برابر ارزانتر از Kimi K3 (۰.۰۴۱۴۱ دلار) است.
پیادهسازی فنی
فرآیند دیستیلاسیون شامل مکانیزم دقیق «مبتنی بر راهنما» (hint-based) بود که روی مسائل کمی مالی مانند CAPM، DCF و قیمتگذاری آپشن اعمال شد. این روش با دیستیلاسیونهای استاندارد on-policy یا self-distillation با زمینه ممتاز متفاوت است.
- مکانیزم: پژوهشگران دقیقاً مرحلهای که راه حل در آن برای اولین بار میشکست را پیدا کردند. یک راهنمای کوتاه در آن نقطه تزریق شد و مدل ادامه راه حل را نوشت. سپس آموزش با هدف Reverse-KL روی ۱۰۰ توکن بعدی اعمال شد.
- تفاوتها: تنها متغیر این بود که نویسنده راهنما، مدل Flash بود یا خودِ مدل. بازوی خود-آموز با ۱۲.۵٪ توکن خروجی کمتر به همان نتیجه رسید که نشاندهنده همگرایی به زنجیرههای تفکر کوتاهتر است.
- مقیاس پارامترها: برای نسخه ۱۲۰ میلیاردی، تنظیمات «فقط-توجه» (attention-only) کافی بود. اما مدل کوچکتر GPT-OSS-20B دچار کمبرازش (underfitting) شد و امتیاز ۷۰.۱۷٪ گرفت. با کالیبراسیون از طریق تطبیق لایههای Expert، این مدل به ۷۴.۷۹٪ رسید (در حالی که مدل پایه ۶۴.۷۱٪ بود) و هزینه هر پرسوجو ۲۳٪ کاهش یافت در حالی که وزنها ۴۲ گیگابایت بودند.
کارایی منابع و عملکرد
در بودجه واقعی ۸ هزار توکن، مدل ۱۲۰ میلیاردی بسیار کارآمد است و ۹۸.۷٪ مسائل را در این پنجره تکمیل میکند.
- سختافزار: این مدل میتواند روی یک GPU مدل H100 یا A100 اجرا شود. وزنهای پایه در دقت بومی MXFP4 حدود ۶۳ گیگابایت هستند و یک آداپتور ۸۰ مگابایتی فقط-توجه روی آن سوار میشود. برای ترافیک بالا و فضای کافی KV-cache، استفاده از دو GPU توصیه میشود.
- وارونهسازی بودجه: در بودجههای عظیم (۱۰۰ هزار توکن)، سلسلهمراتب تغییر میکند: Kimi K3 (۸۹.۹۲٪)، Inkling (۸۸.۲۴٪) و DeepSeek V4 Flash (۸۵.۷۱٪) همگی مدل ۱۲۰ میلیاردی خود-دیستیله را شکست میدهند.
- بار واقعی: وقتی بودجه با حجم کاری نماینده تراز شود، نرخ تکمیل Kimi K3 حدود ۹۰.۷۶٪ است اما دقتش به ۸۱.۹۳٪ میرسد و Inkling با نرخ تکمیل ۷۱.۰۱٪، دقتش تا ۶۵.۱۳٪ سقوط میکند.
شکستن سلسلهمراتب
این مطالعه نتیجه میگیرد که سلسلهمراتب مدلها هنگام در نظر گرفتن بودجه توکن و تأخیر، وارونه میشود. یک مدل ۱۲۰ میلیاردی که بهخوبی آموزش دیده و تکلیف را کامل میکند، بسیار باارزشتر از یک مدل ۲.۸ تریلیون پارامتری است که خروجی را میبُرد.
این یعنی برای تکالیف محدود مانند تحلیل مالی، توسعهدهندگان نیازی به غولآساترین مدلها ندارند و میتوانند با مدلهای وزنبازِ دیستیله شده که بهصورت محلی میزبانی میشوند، به عملکرد سطح پیشرو دست یابند.
یکپارچگی دادهها و محدودیتها
برای تست یادگیری ناخودآگاه، خط لوله کاملاً پاک بود. پژوهشگران تأیید کردند که در ۲۲۰ پرامپت آموزشی، ۱۷۶ مثال آموزشی on-policy، ۱۸۱ تکمیل SFT حفظ شده و ۱,۵۷۴ مسئله تولید شده، هیچ محتوای حساس چینی وجود نداشت. تمام ۱۸۱ تکمیلهای مدل معلم، پاسخهای مستقیم تأیید شده توسط ارزیاب بودند.
- تست دقت: بررسیها در دقت BF16 انجام شد. در دقت سرویسدهی (MXFP4)، نتایج بازوهای پایه و Flash-distilled تکرار شدند. شکاف مدل خود-دیستیله (+۰.۲۶) ثابت ماند، هرچند تعداد پاسخهای قطع شده از ۴۶ به ۵۵ رسید.
- مدیریت تخریب: ۱۰.۲٪ پاسخها (۱۸۶ از ۱,۸۲۴ مورد) بهدلیل خالی بودن یا تکرار (loop) حذف شدند. این شکستها در مدل ۲۰ میلیاردی بیشتر بود (بین ۲۷.۶٪ و ۳۱.۲۵٪) در حالی که در مدل ۱۲۰ میلیاردی تنها ۱٪ بود و برای مدل معلم ۰٪ بود. یک پرامپت کنترل خاص مربوط به عربستان در تمام بازوهایی که شکست خوردند تکرار شد که نشاندهنده یک آسیب رمزگشایی (decoding pathology) در پاسخهای فهرستگونه طولانی است.
- توانایی کلی: مدل ۱۲۰ میلیاردی در آزمون MMLU Pro در هر دسته با اختلاف کمتر از ۳٪ نسبت به مدل پایه عمل کرد. در FinTrust، این مدل برابر یا بهتر از پایه بود، جز در یک نمونه ۱۰۰ موردی که ۵٪ افت در اطلاعرسانی داشت. مدل ۲۰ میلیاردی نرخ افشای اطلاعات حساس در موارد حریم خصوصی (Implicit-mention) را بالاتر برد (۳۶٪ در مقابل ۲۷٪ برای پایه). مدل ۲۰ میلیاردی در MMLU Pro با توکنهای خروجی ۶۷.۵٪ کمتر، دقیقتر از پایه بود و در حقوق و سلامت پیشرفت کرد، اما ۱۱٪ در شیمی افت داشت.
این تحقیق نشان میدهد گسستی بنیادین بین مهارتهای کاربردی مدل و لایههای همراستاسازی یا سانسور وجود دارد. اگر سوگیری سیاسی از پل دیستیلاسیون عبور نمیکند، یعنی «هوش» و «سانسور» در فضاهای بازنمایی متفاوتی قرار دارند.
مسیرهای آینده
پژوهشگران اشاره میکنند که در این تست، مدل معلم و دانشجو هیچ پیشآموزش مشترکی نداشتند. آزمایش حیاتی بعدی این است که اگر یک مدل با ریشه چینی (مانند Qwen) از خروجیهای DeepSeek دیستیله شود، آیا سانسور منتقل میشود یا خیر.
همچنین، تیم هنوز آموزشهای ایمنی، رفتارهای امتناع یا ویژگیهای مرتبط با امنیت را تست نکرده است و قصد دارد بررسی کند چرا تنظیمات «فقط-توجه» در مدل ۲۰ میلیاردی شکست خورد، که نشان میدهد مدل ۱۲۰ میلیاردی ممکن است هنوز پتانسیلهای کشفنشدهای داشته باشد.
برای شفافیت و تکرارپذیری، ابزار LineageEval (شامل ۳۰۴ پرامپت، ساختار کنترل متناظر، کارتهای حقایق و کد تحلیل)، متدهای امتیازدهی و وزنهای مدل ۲۰ میلیاردی در Hugging Face منتشر شده است. مدل ۱۲۰ میلیاردی نیز از طریق یک Playground برای مقایسه مستقیم با مدل معلم در دسترس است.
گام بعدی شما
- اگر از مدلهای غولپیکر برای تکالیف تخصصی استفاده میکنید، استراتژی دیستیلاسیون مدلهای وزنباز را برای کاهش هزینه استنتاج بررسی کنید.
- برای ارزیابی سوگیری مدلهای خود، از متد «جفتهای متناظر» (Matched-Control) استفاده کنید تا اجتناب کلی از موضوعات سخت را با سانسور هدفمند تفکیک کنید.
- مدلهای کوچکتر (مانند ۲۰ میلیارد پارامتری) را بهجای تنظیمات ساده، با لایههای Expert تطبیق دهید تا از کمبرازش جلوگیری شود.
اما تأثیر این یافتهها بر امنیت ملی و استقرار مدلهای حاکمیتی را در گزارش بعدی بررسی خواهیم کرد.




گفتگو