پرش به محتوای اصلی
پرش به محتوای مقاله

مدل ۰.۶ میلیارد پارامتری با تقطیر محلی به صحت ۱۰۰٪ رسید

·۳۱ تیر ۱۴۰۵۲۱ دقیقه مطالعه۱ بازدید
استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود
استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه تقطیر محلی در زمان بسیار کوتاه (۱۲ دقیقه) می‌تواند دقت مدل‌های ۰.۶ میلیاردی را به ۱۰۰٪ برساند، در حالی که مهندسی پرامپت در این ابعاد کاملاً شکست می‌خورد.

اگر امروز برای پردازش حجم عظیمی از اسناد به مدل‌های غول‌پیکر تکیه کرده‌اید، باید بدانید که یک مدل بسیار کوچک می‌تواند همان دقت را با سرعتی ۸ برابر بیشتر ارائه دهد. این تحول یعنی پایان انتظار برای پاسخ‌های ۱۰ ثانیه‌ای در سیستم‌های بازیابی اطلاعات. دستاورد این آزمایش، دستیابی به دقت ۱۰۰٪ در طبقه‌بندی بخش‌های سند توسط یک مدل شاگرد Qwen3-0.6B است که از طریق تقطیر محلی (Local Distillation) آموزش دیده است. در مجموعه‌ای از آزمایش‌ها، این مدل ۰.۶ میلیاردی نه تنها از معلم بسیار بزرگتر خود پیشی گرفت، بلکه خط پایه ۳۶.۲ درصدی مدل آموزش‌ندیده را به شدت درهم شکست.

این پیشرفت در حالی رخ می‌دهد که خط‌لوله‌های تولید بازیابی‌افزا (RAG) — که مثل دانش‌آموزی است که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — با یک گلوگاه جدی در مرحله غنی‌سازی داده‌ها مواجه‌اند. هر سندی که وارد ایندکس می‌شود باید خلاصه‌ای دقیق و برچسب‌های دسته‌بندی‌شده داشته باشد تا قابل جستجو باشد. مدل‌های استدلالی بزرگ این کار را به‌خوبی انجام می‌دهند، اما تأخیر بالای آن‌ها — که اغلب از ۱۰ ثانیه برای هر سند فراتر می‌رود — استفاده از آن‌ها را برای ingest کردن حجم بالای داده‌ها در محیط عملیاتی غیرممکن می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، راهکار اصلی انتقال هوشمندی مدل‌های بزرگ به وزن‌های مدل‌های کوچک‌تر است. این روش نیاز به فراخوانی‌های کند و گران‌قیمت API یا سخت‌افزارهای عظیم را از بین می‌برد. با استفاده از انطباق کم‌رتبهٔ کوانتیده (QLoRA) روی سخت‌افزار اپل سیلیکون، مدل‌های کوچک می‌توانند رفتار مدل‌های بزرگ را بدون نیاز به ارسال مداوم نمونه‌ها در هر درخواست، مستقیماً در وزن‌های خود جذب کنند.

مأموریت: غنی‌سازی RAG

هر سند در یک خط‌لوله RAG پیش از رسیدن به ایندکس، نیازمند یک پردازش پیشین یکپارچه است. هدف در این پروژه، تولید یک شیء JSON بود که شامل یک خلاصه وفادار در ۳ جمله و پنج جنبه (Facet) دسته‌بندی زیر باشد:

  • نوع بخش (Section Type): این بخش از سند دقیقاً چیست؟
  • میزان تخصصی بودن (Specificity): محتوا چقدر به طور خاص به شرکت مربوط است؟
  • تراکم عددی (Numeric Density): متن چقدر حاوی اعداد و ارقام است؟
  • آینده‌نگری (Forward-Looking): آیا محتوا در حال پیش‌بینی رویدادهای آینده است؟
  • مخاطب (Audience): این متن برای چه مخاطبی هدف‌گذاری شده است؟

این یکی از تکراری‌ترین و پرخطرترین مراحل در کل خط‌لوله است؛ چرا که اگر یک خلاصه از منبع اصلی فاصله بگیرد (Drift کند)، سیستم RAG اطلاعات غلط را بازمی‌گرداند. برای آزمایش این فرضیه، پژوهشگر از یک مجموعه داده عمومی شامل ۲۵۰ قطعه از گزارش‌های سالانه SEC 10-K استفاده کرد؛ اسنادی متراکم و رسمی که نمونه‌ای از محصولات حقوقی و مالی هستند. این رویکرد ساختاریافته برای استخراج داده‌ها، یادآور سازوکارهای تحلیل خودکار اسناد پیچیده در حوزه‌ی فرانچایز است که در آن از قالب‌های مشخص برای کاهش خطای تحلیلی استفاده می‌شود. این داده‌ها از EDGAR-CORPUS در HuggingFace (تحت لایسنس Apache-2.0) استخراج شدند، به‌ویژه از یک فایل تست سال ۲۰۲۰ شامل «ماده ۱: کسب‌وکار» (۸۲ قطعه)، «ماده ۱-آ: عوامل ریسک» (۸۰ قطعه) و «ماده ۷: بحث و تحلیل مدیریت» (۸۸ قطعه) که هر کدام حداکثر ۴,۰۹۶ کاراکتر داشتند.

شکست مهندسی پرامپت

پیش از شروع تقطیر (Distillation) — که شبیه انتقال مهارت یک استاد به شاگرد از طریق الگوبرداری است — پژوهشگر مدل Qwen3-0.6B (که به دقت ۴ بیتی فشرده شده بود) را با روش‌های صفر-نمونه (Zero-shot) و چند-نمونه (Few-shot) آزمایش کرد. طبق گزارش‌ها، مدل در ۹۵.۹٪ موارد خروجی JSON معتبری داد، اما قضاوت ساختاریافته آن تقریباً تصادفی بود. مدل تنها در ۳۶.۲٪ موارد نوع بخش را درست تشخیص داد که به سختی بهتر از حدس تصادفی (۳۳٪) بود.

سایر جنبه‌ها نیز به همین اندازه ضعیف بودند. تراکم عددی تنها در ۳۶.۲٪ اسناد با پاسخ معلم مطابقت داشت و برچسب‌های آینده‌نگری در ۲۷.۷٪ موارد درست بودند. تنها مورد «تخصصی بودن» که یک انتخاب دوطرفه بود، به ۷۴.۵٪ رسید. نتیجه این شد: «قابلیت تجزیه شدن» (Parseable) به معنای «کاربردی بودن» (Usable) نیست.

جالب اینجاست که مهندسی پرامپت با چند نمونه (Few-shot)، که استاندارد فعلی صنعت برای اصلاح مدل‌هاست، در واقع باعث فروپاشی عملکرد شد. نرخ JSONهای معتبر به ۴۲.۹٪ سقوط کرد و وفاداری به متن از ۰.۸۳ به ۰.۲۹ رسید. علاوه بر این، تأخیر سه برابر شد زیرا مدل مجبور بود برای هر درخواست، نمونه‌های تکراری را دوباره بازخوانی کند.

استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود

یافته‌ای درباره آلودگی داده‌ها

در مقیاس ۰.۶ میلیارد پارامتر، نمونه‌های ارائه شده در پرامپت (Few-shot) به‌جای راهنمایی مدل، در خروجی «نشت» می‌کنند. در یک اجرای آزمایشی، یکی از نمونه‌های آموزشی به شرکت «PQ Group Holdings» (تأمین‌کننده مواد شیمیایی تخصصی) اشاره داشت. از ۲۱ خروجی که به صورت JSON تجزیه شدند، ۱۴ مورد به‌جای توصیف سند واقعی، شروع به توصیف شرکت PQ Group کردند.

در یک مورد خاص، به مدل بخش عوامل ریسک یک بانک منطقه‌ای داده شد. اما مدل شاگرد به‌جای خلاصه‌سازی بانک، عیناً نوشت: «شرکت PQ Group Holdings Inc. به عنوان یک تأمین‌کننده جهانی یکپارچه کاتالیزورها و مواد شیمیایی تخصصی فعالیت می‌کند. شرکت اخیراً دو بخش تجاری خود را فروخته است...». این اتفاق در دو اجرای مختلف با دو جفت نمونه متفاوت، کلمه به کلمه تکرار شد. این موضوع تأیید می‌کند که در این ابعاد کوچک، نمونه‌ها باید از پنجره متنی (Context Window) خارج شده و مستقیماً به وزن‌های مدل منتقل شوند.

خط‌لوله تقطیر چهار مرحله‌ای

برای حل این مشکل، یک خط‌لوله تقطیر با معماری سخت‌گیرانه چهار-لایه (Brick Architecture) پیاده شد:

لایه ۱: تولید توسط معلم (Teacher Generation): مدل deepseek-r1:8b که یک مدل استدلالی است و ردپاهای تفکر میانی می‌نویسد، به‌عنوان معلم انتخاب شد. این مدل به‌صورت محلی از طریق ollama با دمای صفر (Temperature 0) اجرا شد تا مطمئن‌ترین و قاطع‌ترین پاسخ‌ها را بدهد. سپس ردپاهای استدلالی حذف شدند و فقط JSON نهایی باقی ماند. از ۲۵۰ سند، ۳ مورد که ساختار JSON را می‌شکستند حذف شدند. خلاصه‌های این مدل در ۹۸٪ موارد از بررسی سخت‌گیرانه وفاداری عبور کردند و نوع بخش‌ها را در ۹۸.۴٪ موارد درست شناسایی کرد.

لایه ۲: آماده‌سازی داده‌ها (Dataset Preparation): داده‌ها به سه دسته تقسیم شدند: ۱۷۳ نمونه برای آموزش، ۲۵ مورد برای اعتبارسنجی و ۴۹ مورد برای آزمون نهایی. یک پروتکل حیاتی در اینجا، گروه‌بندی تقسیمات بر اساس «شرکت» بود. اگر هر بخشی از گزارش شرکت اپل در دسته آموزش بود، هیچ بخشی از گزارش اپل نباید در دسته آزمون قرار می‌گرفت. در تکرار اول این پروتکل رعایت نشد و نتایج به‌طور کاذب بالا رفت، زیرا ۴۵ مورد از ۵۰ سند آزمونی متعلق به شرکت‌هایی بودند که مدل قبلاً در آموزش دیده بود.

لایه ۳: ماسک کردن زیان (Loss Masking): برای بهینه‌سازی یادگیری، از یک پرچم آموزشی برای ماسک کردن توکن‌های سند استفاده شد. از آنجا که اسناد (۴۰۰۰ کاراکتر) بسیار طولانی‌تر از پاسخ‌های JSON (۴۵۰ کاراکتر) بودند، بدون ماسک کردن، ۸۸٪ تلاش مدل صرف بازنویسی خود سند می‌شد. ماسک کردن تضمین کرد که ۱۰۰٪ تلاش یادگیری روی همان ۴۵۰ کاراکتر هدف متمرکز شود.

لایه ۴: آموزش QLoRA: با استفاده از کتابخانه MLX روی یک مک، دانش عمومی شاگرد منجمد (Freeze) شد و یک لایه آموزشی نازک (Rank 32) اضافه گردید. کل این فرآیند تقریباً ۱۲ دقیقه زمان برد و مصرف حافظه در نقطه اوج به ۴.۱ گیگابایت رسید. فرآیند آموزش شامل ۶۰۰ تکرار (Iteration)، اندازه دسته (Batch Size) ۲، نرخ یادگیری 1e-5 و سید ۴۲ بود.

استاد ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیارد پارامتری، و آنچه واقعاً منتقل می‌شود.

استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود

نتایج عملکرد

افزایش سرعت مدل شاگرد خیره‌کننده بود. در حالی که مدل معلم deepseek-r1:8b به‌طور متوسط ۱۰.۱ ثانیه زمان می‌گرفت (و در صدک نودم بیش از ۱۲ ثانیه طول می‌کشید)، مدل شاگرد اسناد را در ۱.۲۴ ثانیه پردازش کرد؛ یعنی افزایش سرعت ۸ برابری.

استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود

از نظر دقت، مدل شاگرد به صحت ۱۰۰٪ در تولید JSON معتبر و ۱۰۰٪ دقت در شناسایی بخش‌های اسناد برای شرکت‌های دیده نشده رسید. جالب این است که مدل شاگرد حتی از دقت ۹۵.۹ درصدی معلم پیشی گرفت. دلیل این امر آن بود که معلم تنها ۴ سند از ۲۵۰ سند را به‌اشتباه به دلیل نویز تشخیص داده بود؛ مدل شاگرد الگوی غالب را جذب کرد و آن استثناهای غلط معلم را نادیده گرفت.

دو جنبه دیگر نیز بهبود چشمگیری داشتند. در «تخصصی بودن»، توافق شاگرد با معلم از ۷۴.۵٪ (مدل پایه) به ۸۳.۷٪ رسید. در «تراکم عددی»، این توافق از ۳۶.۲٪ به ۸۱.۶٪ جهش کرد. با این حال، برخی جنبه‌ها پیروی نکردند: «آینده‌نگری» تنها به ۴۹٪ رسید و سطح «مخاطب» حتی پایین‌تر از امتیاز مدل پایه قرار گرفت.

اما یک نقطه ضعف در «وفاداری» (Faithfulness) ظاهر شد. امتیاز وفاداری شاگرد (۰.۷۳) کمتر از مدل پایه (۰.۸۳) بود. مدل پایه جملات کوتاه و محتاطانه می‌نوشت که احتمال خطا در آن‌ها کم بود. اما مدل شاگرد، نثر قاطع و غنی مدل معلم را به ارث برد و همین موضوع فرصت‌های بیشتری برای لغزش‌های واقعی ایجاد کرد. داور متوجه شد که شاگرد در جایی که در سند «درآمد عملیاتی» ذکر شده بود، عبارت «سود عملیاتی» را نوشت، یا یک نسبت عملیاتی را «بالاتر» نامید در حالی که آن نسبت با کاهش مقدار، در واقع بهبود یافته بود.

اثر نفوذ معلم

برای بررسی اینکه آیا این نتایج اتفاقی بوده یا خیر، شاگرد دومی با معلم llama-3.1-8b-instruct آموزش دید. این مدل معلم هیچ ردپای استدلالی نداشت و سبک نوشتاری محتاط‌تری داشت. هر شاگرد مجموعه داده آموزش/آزمون خاص خود را دریافت کرد و تنها ۷ سند از ۴۹ سند در هر دو مجموعه آزمون مشترک بودند. نتایج، شخصیت‌های کاملاً متفاوتی را نشان داد:

  • نویسنده وفادار: این شاگرد به وفاداری ۰.۹۸ رسید و سطح مدل معلم استدلالی را لمس کرد. او ریسک نوشتن تنها یک جمله را پذیرفت و هیچ اشتباهی نکرد. برای یک شرکت تجربه مشتری، نوشت: «Sykes Enterprises یک تأمین‌کننده جهانی پیشرو در خدمات مدیریت تجربه مشتری، تولید تقاضای چندکاناله و تحول دیجیتال است.»
  • برچسب‌زن تنبل: در مقابل، طبقه‌بندی این شاگرد فروپاشید. معلم Instruct سطح مخاطب یکسانی را برای تمام اسناد تعیین کرده بود و ۲۴۹ مورد از ۲۵۰ مورد را «تخصصی» نامیده بود. دقت خود معلم در شناسایی بخش‌ها تنها ۷۲.۴٪ بود (در مقابل ۹۸.۴٪ معلم استدلالی). شاگرد این تنبلی را به‌طور کامل کپی کرد و صحت شناسایی بخش‌ها در او به ۶۸.۱٪ سقوط کرد.

استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیارد پارامتری، و آنچه واقعاً منتقل می‌شود

این موضوع تأیید می‌کند که تقطیر، عادت‌های خاص را منتقل می‌کند. یک معلم، طبقه‌بند بی‌نقصی ساخت که گاهی توهم می‌زد؛ معلم دیگر، نویسنده‌ای وفادار ساخت که نمی‌توانست دسته‌بندی کند. ساختار (JSON معتبر) در تمام معلمان پایدار است، اما رفتارها — چه خوب و چه بد — بازتاب می‌شوند.

تحلیل کاربردپذیری

هنگام محاسبه «نرخ کاربردی» (یک معیار ترکیبی از: JSON معتبر × وفاداری)، نتایج بسته به معلم به‌شدت تغییر می‌کنند:

  • شاگرد معلم Instruct: ۰.۹۴ (۹۵.۹٪ JSON × ۰.۹۸ وفادار)
  • مدل پایه ۰.۶ میلیارد-زیرو-شات: ۰.۸۰ (۹۵.۹٪ JSON × ۰.۸۳ وفادار)
  • شاگرد معلم Reasoning: ۰.۷۳ (۱۰۰٪ JSON × ۰.۷۳ وفادار)
  • مدل پایه ۰.۶ میلیارد-فیو-شات: ۰.۱۲ (۴۲.۹٪ JSON × ۰.۲۹ وفادار)

استراتژی پیاده‌سازی

برای توسعه‌دهندگانی که خط‌لوله‌های RAG می‌سازند، انتخاب معلم اکنون یک تصمیم محصولی است. اگر خط‌لوله به فیلترینگ با دقت بالا (قضاوت ساختاریافته) نیاز دارد، یک معلم استدلالی (Reasoning) ضروری است. اگر هدف اصلی، استناد واقعی به متن و حداقل رساندن توهمات است، یک معلم Instruct محتاط گزینه بهتری است. حتماً عادت‌های معلم در برچسب‌گذاری‌ها را پیش از آموزش بررسی کنید، زیرا شاگرد «عادت» را کپی می‌کند، نه «قصد» را.

استخراج دانش از اسناد: معلم ۸ میلیارد پارامتری، دانش‌آموز ۰.۶ میلیاردی، و آنچه واقعاً منتقل می‌شود

متدولوژی و محدودیت‌ها

برای اطمینان از اینکه نتایج تحت تأثیر سوگیری LLM قرار نگرفته‌اند، کنترل‌های زیر اجرا شد:

  • کنترل منفی: ۱۵ جفت سند/خلاصه که عمداً با هم ناسازگار بودند به داور داده شد. داور ۰ مورد از ۱۵ مورد را وفادار تشخیص داد که این امر صحت سیستم ارزیابی را تأیید کرد.
  • لنگرهای عینی: دقت بخش‌ها بر اساس شناسه‌های نمونه‌برداری شناخته شده اندازه‌گیری شد، نه صرفاً بر اساس موافقت با معلم، تا از پاداش دادن به تقلید از یک معلم معیوب جلوگیری شود.
  • پروتکل داوری: یک مدل پیشرو (Frontier Model) ۲۲۸ قضاوت را در تمام حالت‌ها انجام داد و چهار معیار باینری را بررسی کرد: وفادار بودن، داشتن تز اصلی، طول مناسب و نبود اغراق (Hype).

خلاصه فنی و محدودیت‌ها

این آزمایش همچنان توسط حجم کوچک داده‌ها (۲۵۰ نمونه) و استفاده از یک Seed واحد برای هر اجرا محدود است. در حالی که پرونده‌های SEC رسمی و پیش‌بینی‌پذیر هستند — و مدل‌های پایه احتمالاً در مواجهه با اسناد نامنظم وب بیشتر مشکل دارند — اما نسبت‌های بهبود پایدار ماندند. تمام زمان‌بندی‌ها بر اساس اندازه‌گیری‌های p50 روی اپل سیلیکون است.

  • سخت‌افزار: Apple Silicon Mac
  • آموزش: MLX, QLoRA rank 32, 600 iterations
  • زمان آموزش: حدود ۱۲ دقیقه
  • حداکثر حافظه: ۴.۱ گیگابایت
  • مدل شاگرد: mlx-community/Qwen3-0.6B-4bit

این آزمایش ثابت می‌کند که برای کارهای محدود و تکراری، یک مدل ۰.۶ میلیاردی به‌خوبی تقطیر شده، نه تنها جایگزینی viable برای یک مدل ۸ میلیاردی است، بلکه اغلب تنها راه دستیابی به تأخیر و قابلیت اطمینان مورد نیاز برای ingestion داده‌ها در مقیاس تولید است.

گام بعدی شما

  • اگر از مدل‌های ۸ میلیارد پارامتری برای کارهای تکراری استفاده می‌کنید، امکان تقطیر آن‌ها روی یک مدل کوچک‌تر را با کتابخانه MLX بررسی کنید.
  • پیش از تقطیر، «عادت‌های» مدل معلم را در برچسب‌گذاری‌ها بررسی کنید؛ چون مدل شاگرد اشتباهات معلم را بازتولید می‌کند.
  • برای کاهش توهم در مدل‌های کوچک، از معلمان Instruct به‌جای مدل‌های Reasoning استفاده کنید.

اما تأثیر این متد بر مدل‌های بازمتن حتی شگفت‌انگیزتر است — به بررسی ما درباره مدل‌های SLM مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با کاهش ۸ برابری تأخیر استنتاج، امکان اجرای تحلیل‌های پیچیده سند را روی سخت‌افزارهای لبه فراهم می‌کند. اعتبار این یافته‌ها بر پایه تست‌های سختگیرانه روی داده‌های واقعی SEC است که نشان می‌دهد مدل‌های زبانی کوچک (SLM) می‌توانند در وظایف تخصصی، غول‌های ۸ میلیاردی را کنار بزنند.

تأثیر برای ایران

به دلیل دسترسی رایگان به مدل‌های Qwen و DeepSeek و ابزار MLX، برنامه‌نویسان ایرانی می‌توانند بدون نیاز به APIهای گران‌قیمت، سیستم‌های RAG فوق‌سریع را روی مک‌های قدیمی یا سخت‌افزار لبه پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

این آزمایش پارادایم «بزرگ‌تر بهتر است» را برای کارهای عملیاتی به چالش می‌کشد. نکته کلیدی اینجاست که تقطیر دانش، یک انتقال کورکورانه است؛ مدل شاگرد حتی «تنبلی» یا «اعتمادبه‌نفس کاذب» معلم را هم یاد می‌گیرد. بنابراین، مهندسی مدل‌های کوچک دیگر درباره مقدار داده نیست، بلکه درباره انتخاب دقیق «شخصیت» مدل معلم است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.