پرش به محتوای اصلی
پرش به محتوای مقاله

«بهبود دقت در مدل‌های فشرده»؛ دستاورد جدید نسخه ۳.۰ Unsloth

·۲۸ مرداد ۱۴۰۵۹ دقیقه مطالعه
راهنمای اجرای محلی GLM-5.2 با Unsloth: نصب، بهینه‌سازی و استنتاج سریع مدل چندوجهی روی سخت‌افزار شخصی
راهنمای اجرای محلی GLM-5.2 با Unsloth: نصب، بهینه‌سازی و استنتاج سریع مدل چندوجهی روی سخت‌افزار شخصی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کوانتش یکنواخت با انتخاب هوشمند لایه‌ها و معرفی معیار Divergence-300 برای سنجش دقیق‌تر رفتار مدل‌های فشرده به‌جای تکیه بر صحت ساده.

اگر امروز برای اجرای مدل‌های زبانی بزرگ روی لپ‌تاپ شخصی خود می‌جنگید، خبر خوب این است که دیگر مجبور نیستید بین اندازه مدل و هوش آن یکی را انتخاب کنید. طبق گزارش Unsloth، نسخه جدید کوانتش (Quantization) مدل Qwen3.8-27B اکنون می‌تواند با حجم بسیار کمتر، دقتی ۱۰٪ بالاتر از رقبای خود در همان اندازه داشته باشد. این مدل در واقع نسخه‌ی فشرده‌شده‌ای از معماری قدرتمند Qwen است که پیش‌تر توانسته بود دقت استدلال علمی را به ۸۹.۲٪ برساند.

این موفقیت در تاریخ ۱۹ اوت ۲۰۲۶ رخ داد و تنها در پنج روز نخست، بیش از ۵.۱ میلیون بار دانلود شد. این عدد نشان می‌دهد توسعه‌دهندگان تشنه راهکاری هستند که مدل‌های حجیم را بدون تبدیل آن‌ها به یک مدل «احمق»، کوچک کند. این حجم از پذیرش سریع، ثابت می‌کند که کاهش تهاجمی اندازه مدل لزوماً به معنای فروپاشی کیفیت استدلال نیست. کوانتش (Quantization) — شبیه به تبدیل یک عکس با کیفیت بسیار بالا به فرمت JPEG برای اشغال فضای کمتر، بدون اینکه جزئیات اصلی از بین برود — فرآیندی است که وزن‌های مدل را برای اجرا روی سخت‌افزارهای کوچک‌تر مثل لپ‌تاپ یا موبایل کاهش می‌دهد.

در اکثر موارد، هرچه مدل کوچک‌تر شود، استدلال آن ضعیف‌تر می‌شود. برای اکثر توسعه‌دهندگان، هدف یافتن «نقطه بهینه» است؛ جایی که مدل همچنان کاربردی باشد اما در حافظه ویدیویی (VRAM) جای بگیرد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش حافظه معمولاً به قیمت از دست رفتن دقت تمام می‌شود، اما نسخه ۳.۰ این معادله را تغییر داده است. این نسخه‌های جدید GGUF با اکثر موتورهای استنتاجی، از جمله llama.cpp و Unsloth Desktop سازگار هستند.

Unsloth برای رسیدن به این نتیجه، نحوه کالیبراسیون مدل پیش از فشرده‌سازی را بازنگری کرده است. آن‌ها با استفاده از یک مجموعه‌داده متنوع‌تر و با کیفیت‌تر، تضمین کردند که مدل توانایی خود را در کدنویسی و گفتگو به چندین زبان حفظ کند، حتی زمانی که به کسری از اندازه اصلی خود کاهش یافته است. متدولوژی Dynamic v3.0 کیفیت مدل را بیشتر حفظ کرده و نتایج قوی‌تری را در معیارهایی مانند KL Divergence و Divergence-300 @32 نشان می‌دهد.

سازوکار فنی Dynamic 3.0

بر اساس مستندات وب‌سایت unsloth.ai، متدولوژی نسخه ۳.۰ شامل چندین تغییر کلیدی است:

  • کالیبراسیون اصلاح‌شده: تیم اکنون از یک مجموعه‌داده کالیبراسیون imatrix با کیفیت بالاتر استفاده می‌کند که از منابع متنوعی تامین شده و به‌طور خاص برای کارهای عامل‌محور (Agentic)، کدنویسی و وظایف چندزبانه بهینه شده است. این رویکرد برای مدل‌هایی که قرار است وظایف پیچیده را مدیریت کنند حیاتی است، مشابه آنچه در مدل عظیم ۲.۴ تریلیون پارامتری Qwen3.8 برای وظایف عامل‌محور مشاهده شد. این فایل imatrix برای تست و ارزیابی در اختیار جامعه کاربران قرار گرفته است. محققان و توسعه‌دهندگان تشویق شده‌اند تا با استفاده از این کوانت‌ها و imatrix، نسخه‌های تغییریافته و Fine-tune شده از Qwen3.8 ایجاد کنند.
  • کوانتش پس از آموزش (PTQ): برخلاف برخی رقبا، Unsloth از آموزش آگاه به کوانتش (QAT) یا تقطیر آگاه به کوانتش (QAD) استفاده نمی‌کند. تمام مراحل از طریق PTQ مدیریت می‌شوند تا ریسک بیش‌برازش (Overfitting) کاهش یابد. این یک تمایز حیاتی است، زیرا در رویکرد PTQ خالص، نگرانی درباره بیش‌برازش در مقایسه با روش‌های QAD/QAT بسیار کمتر است.
  • انتخاب هوشمند لایه‌ها: سیستم به‌طور پویا نوع کوانتش را برای هر لایه ممکن تنظیم می‌کند. این کار تضمین می‌کند که وزن‌های حیاتی حفظ شوند و وزن‌های کم‌اهمیت‌تر فشرده گردند.
  • بهینه‌سازی فضای دیسک: برای صرفه‌جویی در حدود ۵۰۰ مگابایت از فضای دیسک، ماژول MTP از کوانت‌های کوچک‌تر زیر UD-Q2_K_XL (۸.۳۷ گیگابایت و پایین‌تر) حذف شده است. با این حال، کاربران در صورت نیاز همچنان می‌توانند از ماژول جداگانه Q4_0 MTP استفاده کنند.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

محک‌زنی و شناسایی «چرخش‌ها»

تیم Unsloth معتقد است معیارهای استاندارد صحت، گمراه‌کننده هستند چون فقط یک پیش‌بینی را می‌سنجند (یک argmax روی یک پیش‌بینی). برای حل این مشکل، آن‌ها معیار Divergence-300 @32 را معرفی کردند. این معیار ۳۰۰ نمونه خارج از داده‌های کالیبراسیون (Held-out) را بررسی می‌کند که از منابع زیر تامین شده‌اند:

  • Terminal-Bench 2.1
  • DeepSWE
  • Harbor
  • MathArena 2025-26
  • پرامپت‌های غیر لاتین و اسناد طولانی

آن‌ها از رمزگشایی حریصانه (Greedy decoding) برای ۳۲ توکن استفاده کردند و خروجی BF16 را با تمام کوانت‌ها و ارائه‌دهندگان مقایسه کردند. این روش به آن‌ها اجازه می‌دهد بسنجند که آیا خروجی‌های کوانتیده در طول چندین توکن، همان مسیرهای BF16 را دنبال می‌کنند یا خیر. در واقع، این معیار KLD top-1% را به KLD top-1% در ۳۲ توکن گسترش می‌دهد و آن را به معیاری برتر از دقت top-1% تبدیل می‌کند.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

این تمرکز بر واگرایی KL به شناسایی «چرخش‌ها» (Flips) کمک می‌کند؛ یعنی لحظاتی که یک پاسخ از درست به غلط یا برعکس تغییر می‌کند. تحقیقات نشان می‌دهد در حالی که ممکن است امتیازات MMLU در طول هرس کردن (Pruning) یا کوانتش کاهش نیابد، دلیل آن اغلب این است که پاسخ‌های غلط «چرخیده» و درست شده‌اند. Unsloth با کاهش میانگین واگرایی KL، تضمین می‌کند که مدل فشرده‌شده تا حد ممکن شبیه به مدل اصلی رفتار کند.

جهش در عملکرد

نتایج برای مدل Qwen3.8-27B خیره‌کننده است. نسخه UD-Q2_K_XL با اشغال ۹.۸۳ گیگابایت فضا، حدود ۸٪ دقیق‌تر از بهترین رقیب خود در معیارهای top-1% است. در یک تست واقعی، این نسخه توانست یک برنامه HTML کاربردی با تنها یک خطای کوچک JS بسازد؛ کاری که نسخه‌های قبلی معمولاً در آن شکست می‌خوردند.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

برای کسانی که محدودیت سخت‌افزاری شدید دارند، نسخه UD-IQ1_S مدل را ۸۹٪ کوچک کرده (تا ۶.۲ گیگابایت) اما تقریباً ۷۲٪ از صحت top-1% را حفظ می‌کند. در تمام سطوح، به‌ویژه در اندازه‌های کوچک‌تر، کوانت‌های UD-3 تا ۱۰٪ صحت top-1% اضافی در همان فضای دیسک نسبت به سایر ارائه‌دهندگان ارائه می‌دهند. برای تضمین مقایسه عادلانه، در تمام نمودارها هنگام محاسبه فضای دیسک، سر MTP از محور x حذف شده است.

سازگاری و میراث فنی

با وجود اینکه v3.0 استاندارد جدید است، Unsloth همچنان از Dynamic v2.0 برای کوانت‌های بزرگ‌تر پشتیبانی می‌کند، زیرا در آنجا بهبودها کمتر محسوس بود. هنگام مقایسه UD-3 و UD-2 روی داده‌های دیده نشده Wikitext و Code، کوانت‌های بزرگ‌تر بهبود کمتری نشان دادند، بنابراین UD-2 همچنان انتخاب مناسب برای اندازه‌های بزرگ است در حالی که تیم روی بهبودهای بیشتر آزمایش می‌کند.

سیستم v2.0 نخستین سیستمی بود که فراتر از معماری‌های ترکیب خبره‌ها (MoE) عمل کرد و با تمام انواع مدل‌ها، از جمله Llama 4 و Gemma 3 سازگار شد. برای مثال، لایه‌های کوانتیده در Gemma 3 به‌طور قابل توجهی با لایه‌های Llama 4 متفاوت هستند. این طرح کوانتش سفارشی تضمین می‌کند که هر مدل برای معماری خاص خود بهینه شود.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

برای بهینه‌سازی در دستگاه‌های اپل سیلیکون و ARM، Unsloth فرمت‌هایی مثل Q4_NL، Q5.1، Q5.0، Q4.1 و Q4.0 را ادغام کرده است. همچنین مجموعه‌داده کالیبراسیون v2.0 شامل بیش از ۱.۵ میلیون توکن دست‌چین شده برای بهبود کیفیت گفتگو و عملکرد چت است.

اصلاح اکوسیستم متن‌باز

Unsloth فراتر از کوانتش، در رفع باگ‌های حیاتی llama.cpp نیز نقش داشته است. آن‌ها به حل مشکلاتی در مورد RoPE Scaling و مقادیر اپسیلون QK Norm در مدل Llama 4 Scout کمک کردند. به‌طور خاص، آن‌ها شناسایی کردند که اپسیلون برای Scout و Maverick باید 1e-05 (بر اساس فایل کانفیگ) باشد، نه 1e-06.

سایر بهبودهای اکوسیستمی عبارتند از:

  • رفع مشکلی که در آن QK Norm بین تمام سرها (Heads) مشترک بود (توسط تیم Llama 4 و vLLM حل شد). این اصلاح باعث شد صحت MMLU Pro از ۶۸.۵۸٪ به ۷۱.۵۳٪ افزایش یابد.
  • رفع مشکلات توکن‌سازی در Llama 3.1 (8B) Instruct که در آن "A" و "_A" (A با یک فاصله) به عنوان شناسه‌های متفاوت در نظر گرفته می‌شدند. با در نظر گرفتن هر دو، صحت از ۶۷.۸٪ (ساده) به ۶۸.۲٪ رسید.
  • شناسایی این موضوع که بنچمارک‌های Llama 3 از طریق LLM Harness شرکت Eleuther AI، عبارت "The best answer is" را به انتهای سوال اضافه می‌کنند.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

معیار کارایی

برای مقایسه عادلانه مدل‌های مختلف، Unsloth فرمول کارایی خاص خود را تعریف کرده است: $\text{Efficiency} = \frac{\text{MMLU 5 shot score} - 25}{\text{Disk Space GB}}$. کسر عدد ۲۵ برای حذف اثر حدس تصادفی در سوالات چهارگزینه‌ای (A, B, C, D) است، زیرا هر مدل حتی با حدس تصادفی ۲۵٪ صحت می‌گیرد. این کار مانع از آن می‌شود که مدل‌هایی با فضای دیسک بسیار کم اما صحت تصادفی، کارآمد به نظر برسند.

مستندات Unsloth: GGUFهای پویا نسخه ۳.۰

در رویارویی با نسخه‌های QAT گوگل برای مدل Gemma 3 (27B)، نسخه ۴ بیتی پویا (Dynamic) Unsloth حدود ۲ گیگابایت کوچک‌تر بود اما ۱٪ صحت بیشتری داشت. برای مدل ۱۲ میلیارد پارامتری Gemma 3، نسخه Q4_0 QAT امتیاز ۶۷.۰۷٪ را در مقابل ۶۷.۱۵٪ نسخه BF16 در MMLU 5-shot کسب کرد. نسخه ۲ بیتی Q2_K_XL Unsloth نیز نتایج قوی نشان داد و KLD را تقریباً ۷.۵٪ کاهش داد.

تحلیل: مرگ کوانت‌های «احمق»

این تغییر نشان می‌دهد که صنعت در حال فاصله گرفتن از کوانتش یکنواخت است. دوران اعمال ساده «۴-بیت» روی کل مدل به پایان می‌رسد. در عوض، ما شاهد حرکت به سمت فشرده‌سازی جراحی‌گونه هستیم؛ جایی که هوش مصنوعی می‌داند کدام بخش‌های «مغزش» برای منطق ضروری و کدام بخش‌ها زائد هستند.

استفاده Unsloth از مجموعه‌داده‌های Calibration_v3 و Calibration_v5 از مشکل رایج بیش‌برازش روی داده‌های صرفاً ویکی‌پدیا جلوگیری می‌کند. اکثر GGUFهای imatrix با مجموعه‌داده‌های متنی کالیبره می‌شوند که برای مدل‌های Instruct با قالب‌های چت خاص، ناکارآمد هستند. Unsloth با استفاده از داده‌های متنوع و تست روی داده‌های دیده نشده، از تورم مصنوعی امتیازات Perplexity که در سایر فریم‌ورک‌ها رایج است، اجتناب می‌کند.

برای کاربر نهایی، این به معنای کاهش سد ورود برای اجرای مدل‌های پیشرو است. وقتی یک مدل ۲۷ میلیارد پارامتری می‌تواند در کمتر از ۱۰ گیگابایت VRAM جای بگیرد بدون اینکه توانایی استدلالش را از دست بدهد، نیاز به GPUهای ابری گران‌قیمت برای اکثر توسعه‌دهندگان کاهش می‌یابد. این موضوع با امتیاز ۷۵.۶٪ مدل DeepSeek V3.1 GGUF (نسخه ۳-بیت پویا) در Aider Polyglot که از بسیاری از مدل‌های SOTA با دقت کامل پیشی گرفت، بیشتر اثبات می‌شود.

این امر همچنین فشار را بر سازندگان مدل مانند گوگل و متا افزایش می‌دهد تا ابزارهای کوانتش رسمی بهتری ارائه دهند. اگر ابزارهای شخص ثالث مانند Unsloth بتوانند از نسخه‌های رسمی QAT بهتر عمل کنند، ثابت می‌شود که گلوگاه، معماری مدل نیست، بلکه خط لوله فشرده‌سازی است.

اگر از مدل‌های محلی استفاده می‌کنید، بررسی کنید که آیا GGUFهای شما نسخه v2.0 هستند یا v3.0. مهاجرت به آخرین کوانت‌های Unsloth می‌تواند بدون نیاز به ارتقای سخت‌افزاری، جهشی محسوس در دقت کدنویسی شما ایجاد کند.

  • اگر از مدل‌های محلی استفاده می‌کنید، بررسی کنید که آیا GGUFهای شما نسخه v2.0 هستند یا v3.0.
  • برای پروژه‌های کدنویسی محلی، نسخه UD-Q2_K_XL را جایگزین نسخه‌های قدیمی کنید تا افزایش دقت را تجربه کنید.
  • مستندات imatrix در وب‌سایت Unsloth را برای شخصی‌سازی کالیبراسیون مدل‌های خود مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در بهینه‌سازی لایه‌ها، سد سخت‌افزاری برای اجرای مدل‌های پیشرفته را می‌شکند. اکنون توسعه‌دهندگان می‌توانند بدون نیاز به GPUهای ابری گران‌قیمت، مدل‌های با استدلال بالا را روی سخت‌افزار خانگی اجرا کنند.

تأثیر برای ایران

این ابزار برای برنامه‌نویسان ایرانی که به دلیل تحریم‌ها یا هزینه‌های ارزی دسترسی محدودی به GPUهای ابری دارند، فرصتی حیاتی برای اجرای مدل‌های قدرتمند روی سخت‌افزارهای موجود است.

·نگاه ما
تحریریه دات‌هوش

دوران کوانتش یکنواخت (مثلاً تبدیل کل مدل به ۴ بیت) به پایان رسیده و جای خود را به «فشرده‌سازی جراحی» داده است. Unsloth ثابت کرد که با شناسایی لایه‌های حیاتی و استفاده از داده‌های کالیبراسیون متنوع، می‌توان مدل‌های ۲۷ میلیارد پارامتری را در حافظه ۱۰ گیگابایتی جای داد بدون اینکه مدل «گیج» شود. این موضوع فشار را بر غول‌هایی مثل گوگل و متا می‌آورد تا ابزارهای رسمی فشرده‌سازی خود را ارتقا دهند، زیرا ابزارهای شخص ثالث اکنون عملکرد بهتری نسبت به نسخه‌های رسمی QAT دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.