پرش به محتوای اصلی
پرش به محتوای مقاله

تقطیر سادهٔ مدل‌ها دانش را منتقل نمی‌کند، بلکه اعتمادبه‌نفسِ غلط را می‌سازد

·۲۳ شهریور ۱۴۰۵۴ دقیقه مطالعه
راهنما
مدل تقطیرشده عملکرد ضعیف‌تری از معلم دارد
مدل تقطیرشده عملکرد ضعیف‌تری از معلم دارد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأکید بر لزوم مقیاس‌بندی مربع دما برای جلوگیری از محوشدن گرادیان و معرفی استراتژی ترکیب داده‌های مصنوعی بر اساس آستانه اطمینان ۰.۷ برای شکستن حلقه خطای معلم.

تصور کنید شاگردی را که در تمام آزمون‌ها نمره‌ای کمتر از معلمش می‌گیرد، اما با اطمینانی کامل، اشتباهات او را تکرار می‌کند. این دقیقاً همان نقطه‌ی شکست در بسیاری از پروژه‌های تقطیر (Distillation) — شبیه به عصاره‌گیری از یک کتاب قطور برای تبدیل آن به یک دفترچه راهنمای کوچک — است. رایج‌ترین شکست در تقطیر هوش مصنوعی زمانی رخ می‌دهد که مدل شاگرد در هر معیاری نمره‌ای پایین‌تر از معلم خود کسب کند.

بسیاری از توسعه‌دهندگان مدل‌های زبانی کوچک (SLM) را طوری آموزش می‌دهند که خروجی‌های سافت‌مکس (Softmax) مدل معلم را مستقیماً کپی کنند. طبق گزارش‌های فنی، این رویکرد ساده باعث می‌شود مدل شاگرد نه تنها ضعیف‌تر شود، بلکه در پاسخ‌های غلط خود جسورتر باشد. در واقع، خط لوله‌های ساده‌انگارانه، شاگرد را آموزش می‌دهند تا مستقیماً با خروجی‌های سافت‌مکس معلم مطابقت داشته باشد، که نتیجه‌اش مدلی است که هم توانایی کمتری دارد و هم با اطمینان بیشتری اشتباه می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش اندازه مدل بدون استراتژی درست، منجر به تخریب استدلال می‌شود. در حال حاضر، تقطیر به یکی از اولویت‌های اکوسیستم هوش مصنوعی آمریکا تبدیل شده است. به نقل از وب‌سایت TechCrunch، گری تان (Garry Tan) تأکید کرده است که آزمایشگاه‌های وزن‌های باز باید مدل‌های پیشرو را تقطیر کنند تا نسخه‌های محلی و کوچک‌تر همچنان توانمند باقی بمانند.

سازوکار شکست

مشکل اصلی این است که بدون مقیاس‌بندی دما (Temperature Scaling)، توزیع احتمالی مدل معلم بیش از حد متمرکز و «مغرور» است. شاگرد اهدافی را می‌بیند که تقریباً تک‌بعدی (near-one-hot) هستند و یاد می‌گیرد همین اطمینان کاذب را بازتولید کند. این اتفاق باعث می‌شود اشتباهات معلم تقویت شوند و مدلی ایجاد شود که صرفاً قطعیت معلم را تقلید می‌کند، بدون اینکه توانایی واقعی او را به دست آورده باشد.

با این حال، واقعیت مهندسی این است که بدون تنظیمات خاص، شاگرد صرفاً غرور بیش از حد معلم را کپی می‌کند. برای جلوگیری از این اتفاق، مهندسان باید از مقیاس‌بندی دما استفاده کنند. این مکانیزم توزیع احتمالی معلم را تخت می‌کند تا شاگرد بتواند ترجیحات نسبی بین گزینه‌های نادرست را هم یاد بگیرد، نه فقط حدس اول را.

راهکارهای فنی

یک تقطیر مؤثر بر دو اهرم اصلی استوار است:

  • مقیاس‌بندی دما: استفاده از دمایی مانند ۴.۰ خروجی را نرم می‌کند. برای حفظ مقدار گرادیان در حالی که دما افزایش می‌یابد، تابع زیان باید در مربع دما (temperature ** 2) ضرب شود. بدون این مقیاس‌بندی، دماهای بالاتر باعث تخت شدن گرادیان‌ها شده و فرآیند یادگیری را به‌شدت کند می‌کنند.
  • تعادل آلفا: استفاده از یک پارامتر آلفا برای ایجاد تعادل میان زیان تقطیر (واگرایی KL) و زیان نظارت‌شده روی برچسب‌های سخت (Hard Labels).

استراتژی ترکیب داده‌ها

ترکیب داده‌ها دومین اهرم حیاتی است. بسیاری از متخصصان از خروجی‌های معلم روی همان داده‌های آموزشی استفاده می‌کنند که منجر به یک حلقه بازخورد مخرب می‌شود؛ یعنی شاگرد دقیقاً همان خطاهایی را یاد می‌گیرد که معلم قبلاً روی داده‌هایی که دیده است، مرتکب شده است.

بر اساس مستندات فنی، برای شکستن این حلقه باید سه منبع داده ترکیب شوند:

  • داده‌های کنار گذاشته‌شده (Held-out Data): خروجی‌های معلم روی داده‌هایی که هرگز با آن‌ها آموزش ندیده است.
  • نمونه‌های برچسب‌دار واقعی: داده‌های استاندارد که در آن‌ها برچسب‌های مرجع (Ground-truth) در دسترس هستند.
  • نمونه‌های مصنوعی یا تقویت‌شده: داده‌هایی که لبه‌های تیز و موارد خاصی را پوشش می‌دهند که معلم در آن‌ها ضعیف است.

به‌طور مشخص، داده‌های مصنوعی باید روی مواردی تمرکز کنند که اطمینان معلم در آن‌ها کمتر از آستانه‌ی ۰.۷ است. این کار تضمین می‌کند که شاگرد به‌جای تمرین روی نمونه‌هایی که معلم به‌خوبی مدیریت می‌کند، روی موارد مرزی و دشوار تمرین کند.

چه زمانی تقطیر اشتباه است؟

هر وظیفه‌ای برای تقطیر مناسب نیست. تقطیر بر این فرض استوار است که خروجی‌های معلم حاوی سیگنال‌های قابل استفاده هستند. این فرض در موارد زیر از بین می‌رود:

  • معلم یک مدل استدلالی (Reasoning Model) باشد که از طریق زنجیره‌ای از گام‌ها پیش می‌رود و شما نمی‌توانید این گام‌ها را مشاهده کنید.
  • وظیفه نیازمند استفاده از ابزار یا دانش خارجی باشد که مدل شاگرد به آن‌ها دسترسی ندارد.
  • معلم روی داده‌هایی آموزش دیده باشد که شاگرد در زمان استنتاج (Inference) هرگز آن‌ها را نمی‌بیند.

در این سناریوها، تنظیم دقیق (Fine-tuning) مستقیماً روی داده‌های تخصصی وظیفه، اغلب نتایجی بهتر از تقطیر می‌دهد. توازن در اینجا روشن است: در حالی که تقطیر کامل زمانی جواب می‌دهد که خروجی‌های معلم نرم و آموزنده باشند، اما اگر معلم بیش از حد مغرور باشد، این روش شکست می‌خورد. رویکردهای ترکیبی (ترکیب تقطیر و تنظیم دقیق) می‌توانند مؤثر باشند، هرچند تنظیم هایپرپارامترها در این حالت پیچیده‌تر می‌شود.

برای کسانی که این خط لوله‌ها را پیاده می‌کنند، هدف باید مانیتور کردن کالیبراسیون اطمینان باشد، نه فقط صحت (Accuracy) خام. تقطیر اغلب به‌صورت خاموش شکست می‌خورد؛ به این معنا که مدل در ظاهر معقول به نظر می‌رسد اما عملکرد خود را در موارد بحرانی و لبه‌ای از دست داده است.

گام بعدی شما

  • در خط لوله‌های (Pipelines) تقطیر خود، به‌جای تکیه بر صحت خام، کالیبراسیون اطمینان مدل را مانیتور کنید.
  • برای داده‌های مصنوعی، روی نمونه‌هایی تمرکز کنید که مدل معلم در آن‌ها تردید دارد (Confidence < 0.7).
  • اگر مدل معلم شما از نوع استدلالی است، به‌جای تقطیر خروجی، تقطیر زنجیره تفکر (CoT) را امتحان کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها اعتبار روش‌های سنتی تقطیر را به چالش می‌کشد و نشان می‌دهد که برای رسیدن به مدل‌های لبه‌ای (Edge AI) کارآمد، باید معماری داده‌ها را تغییر داد. تخصص در کالیبراسیون مدل، اکنون از خودِ معماری مدل برای توسعه‌دهندگان SLM حیاتی‌تر است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت GPU مواجه‌اند، استفاده درست از تقطیر تنها راه داشتن مدل‌های توانمند روی سخت‌افزارهای ضعیف است. پیاده‌سازی مقیاس‌بندی دما می‌تواند کیفیت مدل‌های محلی را بدون نیاز به سخت‌افزار بیشتر ارتقا دهد.

·نگاه ما
تحریریه دات‌هوش

بسیاری از تلاش‌ها برای کوچک‌سازی مدل‌ها در تله‌ی «تقلید ظاهری» می‌افتد. حقیقت این است که تقطیر بدون کالیبراسیون دما، صرفاً یک مدلِ متقاعدکننده اما نادان می‌سازد. جابه‌جایی تمرکز از «صحت خروجی» به «توزیع احتمالات» تنها راهی است که می‌توان بدون از دست دادن استدلال، حجم مدل را کاهش داد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.