تصور کنید ابزاری که سالها به عنوان روشی ابتدایی و ناکارآمد رد شده بود، ناگهان یکی از اثرگذارترین نتایج دهه اخیر در هوش مصنوعی را رقم بزند. در ژانویه ۲۰۲۵، دیپسیک (DeepSeek) نشان داد که مدلهای کوچک میتوانند رفتارهای استدلالی پیچیده را صرفاً با پیشبینی توکن بعدی در متنهای یک مدل استاد، یاد بگیرند.
به گزارش تسه-کوئنس (Thesequence)، تا پیش از این اجماع فنی بر این بود که مدلهای کوچک (Student) نمیتوانند بهسادگی مسیرهای فکری مدلهای بزرگتر (Teacher) را تقلید کنند، زیرا در لحظه استنتاج (Inference) دچار انحراف میشوند. این باور باعث شد صنعت به سمت روشهای دشوارتر مانند جابهجایی از واگرایی KL مستقیم به معکوس و نمونهگیریهای پیچیده On-policy حرکت کند. اما فرآیند تقطیر (Distillation) در مدل DeepSeek R1 تمام این پیچیدگیها را نادیده گرفت. این رویکرد در واقع تداوم همان استراتژیهای بهینهسازی است که پیشتر در تحلیلهای فنی ما درباره تبدیل مدلهای غولپیکر به نسخههای چابک از طریق تقطیر دانش به آن پرداخته بودیم.
همانطور که در تحلیل قبلی ما دربارهی قوانین مقیاسپذیری در مدلهای استدلالی اشاره کردیم، کیفیت دادههای آموزشی همواره بر کمیت اولویت دارد. در این پروژه، تیم دیپسیک حدود ۸۰۰,۰۰۰ راهکار حل مسئله را از مدل R1 استخراج کرد. این ردپاهای فکری — که شامل اصلاحات خودکار و شروعهای اشتباه مدل بود — ابتدا از نظر صحت و خوانایی فیلتر شدند. سپس، یک تنظیم نظارتشده (Supervised Fine-tuning - SFT) ساده روی چندین مدل وزنهای باز (Open Weights) اعمال شد:
- مدلهای Qwen: نسخههای ۱.۵، ۷، ۱۴ و ۳۲ میلیارد پارامتری
- مدلهای Llama: نسخههای ۸ و ۷۰ میلیارد پارامتری

بر اساس مستندات منتشر شده، در این مسیر هیچگونه یادگیری تقویتی (RL) یا مکانیزم «استاد بهعنوان منتقد» به کار گرفته نشد. با این حال، نتایج خیرهکننده بود. مدل ۳۲ میلیارد پارامتری تقطیر شده توانست مسائل ریاضی سطح مسابقات را حل کند که پیش از این هرگز قادر به حل آنها نبود. حتی مدل ۷ میلیارد پارامتری نیز شروع به بازبینی کارهای خود و ایجاد شاخههای استدلالی در میانه مسیر کرد؛ رفتارهایی که هرگز بهطور مستقیم در مدل آموزش داده نشده بودند.
این چرخش، پیشفرضهای بنیادین درباره ضرورت استفاده از RLHF پیچیده برای تقطیر دانش را تغییر میدهد. این یافته ثابت میکند که یک «ردپای» (Trace) استدلالی باکیفیت و فیلترشده، به اندازه کافی قدرتمند است تا رفتارهای نوظهور را در مدلهایی ایجاد کند که ۱۰ برابر کوچکتر از مدل اصلی هستند.
گام بعدی شما
- بررسی بنچمارکهای جدید سری Qwen برای سنجش پایداری ویژگیهای استدلالی در حوزههای غیر ریاضی.
- آزمایش مدلهای تقطیر شده R1 در محیطهای عملیاتی با محدودیت سختافزاری برای کاهش هزینه استنتاج.
- تحلیل اثر مقیاس ۸۰۰ هزار داده فیلترشده در برابر روشهای سنتتیک کمحجمتر.
این تنها آغاز ماجراست؛ اثر موجگونهی این موفقیت بر استراتژیهای آموزش مدلهای کوچک را در گزارش بعدی بررسی خواهیم کرد.




گفتگو