تنها ۱٪ از زنجیره استدلال یک مدل «معلم» میتواند خروجی یک مدل «شاگرد» را بهطور بنیادین تغییر دهد. طبق تحلیل فنی منتشر شده در ۹ سپتامبر ۲۰۲۶، آزمایشهای پژوهشی نشان میدهد که مدل Qwen 3.8 A95B هنگام دریافت یک پیشپُرکردن استدلالی، جهشی ۲۰.۵۸ درصدی در همراستاسازی (Alignment) با مدل GPT-5.5 Pro تجربه کرده است.
این متد که به پیشپُرکردن استدلالی (Reasoning Prefilling) معروف است، شامل درج ابتدای فرآیند تفکر داخلی یک مدل پیشرفته در کانال استدلال مدل هدف است. در این حالت، پاسخ نهایی همچنان بهصورت آزاد تولید میشود، اما پیشپُرکردن مانند یک تلنگر شناختی عمل میکند. همانطور که در بحثهای گذشته ما دربارهی نشت دادهها در مدلهای بازمتن اشاره کردیم، این موضوع حساسیت مدلهای باز را به هدایت مدلهای معلم نشان میدهد.
به گزارش gist.github.com، این مطالعه ۴۵ مسئله در حوزههای STEM، غیر STEM و پازلهای مصنوعی را ارزیابی کرده است. نتایج بهدستآمده برای هر مدل کاملاً متفاوت بود:
- Qwen 3.8 A95B: نرخ بازیابی (Recall) از ۳۳.۹۲٪ به ۵۴.۵۰٪ رسید (۲۰.۵۸+ واحد درصد)؛ بیشترین اثر در حوزه STEM با ۲۷.۵۵+ واحد درصد بود. این بهبودهای چشمگیر در حوزههای تخصصی، یادآور نتایجی است که آداپتورهای لورا در افزایش دقت مدلهای زبانی برای موضوعات خاص به ارمغان آورده بودند.
- Kimi K3: همپوشانی پایه بالایی داشت (۵۰.۱۱٪) اما افزایش اندکی تا ۵۴.۴۲٪ را تجربه کرد.
- Inkling: افزایش ناچیزی در حد ۰.۸۵+ واحد درصد داشت.
- DeepSeek V4 Flash: تقریباً بدون تغییر ماند (۰.۳۵+ واحد درصد).
برای جامعه فنی، این نتایج فرضیات مربوط به استقلال مدلها را به چالش میکشد. حساسیت شدید Qwen به GPT-5.5 Pro — بهویژه در مقایسه با واکنش حداقلی آن به Opus 4.8 در تستهای قبلی — بهشدت نشان میدهد که Qwen احتمالاً با دادههای مصنوعی (Synthetic Data) مشتق شده از مدلهای OpenAI آموزش دیده است.
این یافتهها حاکی از آن است که «همراستاسازی استدلالی» میتواند به عنوان یک ابزار جرمشناسی برای شناسایی آلودگی دادهها (Data Contamination) به کار رود. اگر خروجی یک مدل با تلنگر منطقی یک معلم خاص بهشدت تغییر کند، احتمالاً با آن معلم تبار آموزشی مشترکی دارد.
اکنون پژوهشگران باید بررسی کنند که آیا این همراستاسازی در دمای (Temperature) مختلف پرامپت نیز پابرجا میماند یا صرفاً یک اثر شکننده از مکانیزم پیشپُرکردن است.
گام بعدی شما
- بررسی اثر Reasoning Prefill بر روی مدلهای محلی برای شناسایی اثرات احتمالی Distillation.
- تحلیل تفاوت پاسخهای مدلهای باز در حالت Zero-shot در مقابل حالتهای هدایتشده با مدلهای بسته.
- دنبال کردن گزارشهای جدید درباره متدهای شناسایی نشت داده در مدلهای نسل جدید.
اما ابعاد سختافزاری این رقابت حتی پیچیدهتر است؛ برای درک هزینه استنتاج این مدلها به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو