پرش به محتوای اصلی
پرش به محتوای مقاله

آیا تقلید ساده از توالی‌ها برای ارتقای مدل‌های کوچک کافی است؟

·۳۰ تیر ۱۴۰۵۲ دقیقه مطالعه
تحلیل
نمودار مقایسه عملکرد مدل‌های کوچک با و بدون استخراج استدلال از مدل بزرگ‌تر
نمودار مقایسه عملکرد مدل‌های کوچک با و بدون استخراج استدلال از مدل بزرگ‌تر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات کارآمدی تقطیر ساده (Naive Distillation) برای توابع استدلالی؛ برخلاف باور قبلی متخصصان، تقلید مستقیم از توالی‌های فکری مدل‌های بزرگ می‌تواند منجر به بروز رفتارهای پیچیده در مدل‌های کوچک شود.

تصور کنید ابزاری که سال‌ها به عنوان روشی ابتدایی و ناکارآمد رد شده بود، ناگهان یکی از اثرگذارترین نتایج دهه اخیر در هوش مصنوعی را رقم بزند. در ژانویه ۲۰۲۵، دیپ‌سیک (DeepSeek) نشان داد که مدل‌های کوچک می‌توانند رفتارهای استدلالی پیچیده را صرفاً با پیش‌بینی توکن بعدی در متن‌های یک مدل استاد، یاد بگیرند.

به گزارش تسه-کوئنس (Thesequence)، تا پیش از این اجماع فنی بر این بود که مدل‌های کوچک (Student) نمی‌توانند به‌سادگی مسیرهای فکری مدل‌های بزرگتر (Teacher) را تقلید کنند، زیرا در لحظه استنتاج (Inference) دچار انحراف می‌شوند. این باور باعث شد صنعت به سمت روش‌های دشوارتر مانند جابه‌جایی از واگرایی KL مستقیم به معکوس و نمونه‌گیری‌های پیچیده On-policy حرکت کند. اما فرآیند تقطیر (Distillation) در مدل DeepSeek R1 تمام این پیچیدگی‌ها را نادیده گرفت. این رویکرد در واقع تداوم همان استراتژی‌های بهینه‌سازی است که پیش‌تر در تحلیل‌های فنی ما درباره تبدیل مدل‌های غول‌پیکر به نسخه‌های چابک از طریق تقطیر دانش به آن پرداخته بودیم.

همان‌طور که در تحلیل قبلی ما درباره‌ی قوانین مقیاس‌پذیری در مدل‌های استدلالی اشاره کردیم، کیفیت داده‌های آموزشی همواره بر کمیت اولویت دارد. در این پروژه، تیم دیپ‌سیک حدود ۸۰۰,۰۰۰ راهکار حل مسئله را از مدل R1 استخراج کرد. این ردپاهای فکری — که شامل اصلاحات خودکار و شروع‌های اشتباه مدل بود — ابتدا از نظر صحت و خوانایی فیلتر شدند. سپس، یک تنظیم نظارت‌شده (Supervised Fine-tuning - SFT) ساده روی چندین مدل وزن‌های باز (Open Weights) اعمال شد:

  • مدل‌های Qwen: نسخه‌های ۱.۵، ۷، ۱۴ و ۳۲ میلیارد پارامتری
  • مدل‌های Llama: نسخه‌های ۸ و ۷۰ میلیارد پارامتری

نقشه راه استدلال: انتقال دانش استنتاجی به مدل‌های کوچک از طریق ردیابی فرآیند فکر

بر اساس مستندات منتشر شده، در این مسیر هیچ‌گونه یادگیری تقویتی (RL) یا مکانیزم «استاد به‌عنوان منتقد» به کار گرفته نشد. با این حال، نتایج خیره‌کننده بود. مدل ۳۲ میلیارد پارامتری تقطیر شده توانست مسائل ریاضی سطح مسابقات را حل کند که پیش از این هرگز قادر به حل آن‌ها نبود. حتی مدل ۷ میلیارد پارامتری نیز شروع به بازبینی کارهای خود و ایجاد شاخه‌های استدلالی در میانه مسیر کرد؛ رفتارهایی که هرگز به‌طور مستقیم در مدل آموزش داده نشده بودند.

این چرخش، پیش‌فرض‌های بنیادین درباره ضرورت استفاده از RLHF پیچیده برای تقطیر دانش را تغییر می‌دهد. این یافته ثابت می‌کند که یک «ردپای» (Trace) استدلالی باکیفیت و فیلترشده، به اندازه کافی قدرتمند است تا رفتارهای نوظهور را در مدل‌هایی ایجاد کند که ۱۰ برابر کوچک‌تر از مدل اصلی هستند.

گام بعدی شما

  • بررسی بنچمارک‌های جدید سری Qwen برای سنجش پایداری ویژگی‌های استدلالی در حوزه‌های غیر ریاضی.
  • آزمایش مدل‌های تقطیر شده R1 در محیط‌های عملیاتی با محدودیت سخت‌افزاری برای کاهش هزینه استنتاج.
  • تحلیل اثر مقیاس ۸۰۰ هزار داده فیلترشده در برابر روش‌های سنتتیک کم‌حجم‌تر.

این تنها آغاز ماجراست؛ اثر موج‌گونه‌ی این موفقیت بر استراتژی‌های آموزش مدل‌های کوچک را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار نتایج DeepSeek، هزینه‌ی دستیابی به مدل‌های استدلالی سطح بالا را به‌شدت کاهش می‌دهد. اکنون توسعه‌دهندگان می‌توانند بدون نیاز به زیرساخت‌های عظیم RLHF، مدل‌های کوچک را به ابزارهای استدلالی تبدیل کنند.

تأثیر برای ایران

این دستاورد فرصتی استثنایی برای توسعه‌دهندگان ایرانی است تا با استفاده از مدل‌های وزن‌باز تقطیرشده، سیستم‌های استدلالی قدرتمند را روی سخت‌افزارهای محدود (GPUهای ضعیف‌تر) اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

موفقیت R1 نشان می‌دهد که «مسیر رسیدن به جواب» (Process) بسیار ارزشمندتر از خود «جواب نهایی» است. وقتی مدل کوچک یاد می‌گیرد چگونه اشتباه کند و سپس خودش را اصلاح کند، در واقع ساختار تفکر را می‌آموزد نه فقط پاسخ‌ها را. این موضوع احتمالاً منجر به کاهش شدید نیاز به داده‌های انسانی گران‌قیمت برای تراز کردن مدل‌های کوچک می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.