اگر امروز برای اجرای مدلهای زبانی بزرگ روی لپتاپ شخصی خود میجنگید، خبر خوب این است که دیگر مجبور نیستید بین اندازه مدل و هوش آن یکی را انتخاب کنید. طبق گزارش Unsloth، نسخه جدید کوانتش (Quantization) مدل Qwen3.8-27B اکنون میتواند با حجم بسیار کمتر، دقتی ۱۰٪ بالاتر از رقبای خود در همان اندازه داشته باشد. این مدل در واقع نسخهی فشردهشدهای از معماری قدرتمند Qwen است که پیشتر توانسته بود دقت استدلال علمی را به ۸۹.۲٪ برساند.
این موفقیت در تاریخ ۱۹ اوت ۲۰۲۶ رخ داد و تنها در پنج روز نخست، بیش از ۵.۱ میلیون بار دانلود شد. این عدد نشان میدهد توسعهدهندگان تشنه راهکاری هستند که مدلهای حجیم را بدون تبدیل آنها به یک مدل «احمق»، کوچک کند. این حجم از پذیرش سریع، ثابت میکند که کاهش تهاجمی اندازه مدل لزوماً به معنای فروپاشی کیفیت استدلال نیست. کوانتش (Quantization) — شبیه به تبدیل یک عکس با کیفیت بسیار بالا به فرمت JPEG برای اشغال فضای کمتر، بدون اینکه جزئیات اصلی از بین برود — فرآیندی است که وزنهای مدل را برای اجرا روی سختافزارهای کوچکتر مثل لپتاپ یا موبایل کاهش میدهد.
در اکثر موارد، هرچه مدل کوچکتر شود، استدلال آن ضعیفتر میشود. برای اکثر توسعهدهندگان، هدف یافتن «نقطه بهینه» است؛ جایی که مدل همچنان کاربردی باشد اما در حافظه ویدیویی (VRAM) جای بگیرد. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، کاهش حافظه معمولاً به قیمت از دست رفتن دقت تمام میشود، اما نسخه ۳.۰ این معادله را تغییر داده است. این نسخههای جدید GGUF با اکثر موتورهای استنتاجی، از جمله llama.cpp و Unsloth Desktop سازگار هستند.
Unsloth برای رسیدن به این نتیجه، نحوه کالیبراسیون مدل پیش از فشردهسازی را بازنگری کرده است. آنها با استفاده از یک مجموعهداده متنوعتر و با کیفیتتر، تضمین کردند که مدل توانایی خود را در کدنویسی و گفتگو به چندین زبان حفظ کند، حتی زمانی که به کسری از اندازه اصلی خود کاهش یافته است. متدولوژی Dynamic v3.0 کیفیت مدل را بیشتر حفظ کرده و نتایج قویتری را در معیارهایی مانند KL Divergence و Divergence-300 @32 نشان میدهد.
سازوکار فنی Dynamic 3.0
بر اساس مستندات وبسایت unsloth.ai، متدولوژی نسخه ۳.۰ شامل چندین تغییر کلیدی است:
- کالیبراسیون اصلاحشده: تیم اکنون از یک مجموعهداده کالیبراسیون imatrix با کیفیت بالاتر استفاده میکند که از منابع متنوعی تامین شده و بهطور خاص برای کارهای عاملمحور (Agentic)، کدنویسی و وظایف چندزبانه بهینه شده است. این رویکرد برای مدلهایی که قرار است وظایف پیچیده را مدیریت کنند حیاتی است، مشابه آنچه در مدل عظیم ۲.۴ تریلیون پارامتری Qwen3.8 برای وظایف عاملمحور مشاهده شد. این فایل imatrix برای تست و ارزیابی در اختیار جامعه کاربران قرار گرفته است. محققان و توسعهدهندگان تشویق شدهاند تا با استفاده از این کوانتها و imatrix، نسخههای تغییریافته و Fine-tune شده از Qwen3.8 ایجاد کنند.
- کوانتش پس از آموزش (PTQ): برخلاف برخی رقبا، Unsloth از آموزش آگاه به کوانتش (QAT) یا تقطیر آگاه به کوانتش (QAD) استفاده نمیکند. تمام مراحل از طریق PTQ مدیریت میشوند تا ریسک بیشبرازش (Overfitting) کاهش یابد. این یک تمایز حیاتی است، زیرا در رویکرد PTQ خالص، نگرانی درباره بیشبرازش در مقایسه با روشهای QAD/QAT بسیار کمتر است.
- انتخاب هوشمند لایهها: سیستم بهطور پویا نوع کوانتش را برای هر لایه ممکن تنظیم میکند. این کار تضمین میکند که وزنهای حیاتی حفظ شوند و وزنهای کماهمیتتر فشرده گردند.
- بهینهسازی فضای دیسک: برای صرفهجویی در حدود ۵۰۰ مگابایت از فضای دیسک، ماژول MTP از کوانتهای کوچکتر زیر UD-Q2_K_XL (۸.۳۷ گیگابایت و پایینتر) حذف شده است. با این حال، کاربران در صورت نیاز همچنان میتوانند از ماژول جداگانه Q4_0 MTP استفاده کنند.

محکزنی و شناسایی «چرخشها»
تیم Unsloth معتقد است معیارهای استاندارد صحت، گمراهکننده هستند چون فقط یک پیشبینی را میسنجند (یک argmax روی یک پیشبینی). برای حل این مشکل، آنها معیار Divergence-300 @32 را معرفی کردند. این معیار ۳۰۰ نمونه خارج از دادههای کالیبراسیون (Held-out) را بررسی میکند که از منابع زیر تامین شدهاند:
- Terminal-Bench 2.1
- DeepSWE
- Harbor
- MathArena 2025-26
- پرامپتهای غیر لاتین و اسناد طولانی
آنها از رمزگشایی حریصانه (Greedy decoding) برای ۳۲ توکن استفاده کردند و خروجی BF16 را با تمام کوانتها و ارائهدهندگان مقایسه کردند. این روش به آنها اجازه میدهد بسنجند که آیا خروجیهای کوانتیده در طول چندین توکن، همان مسیرهای BF16 را دنبال میکنند یا خیر. در واقع، این معیار KLD top-1% را به KLD top-1% در ۳۲ توکن گسترش میدهد و آن را به معیاری برتر از دقت top-1% تبدیل میکند.

این تمرکز بر واگرایی KL به شناسایی «چرخشها» (Flips) کمک میکند؛ یعنی لحظاتی که یک پاسخ از درست به غلط یا برعکس تغییر میکند. تحقیقات نشان میدهد در حالی که ممکن است امتیازات MMLU در طول هرس کردن (Pruning) یا کوانتش کاهش نیابد، دلیل آن اغلب این است که پاسخهای غلط «چرخیده» و درست شدهاند. Unsloth با کاهش میانگین واگرایی KL، تضمین میکند که مدل فشردهشده تا حد ممکن شبیه به مدل اصلی رفتار کند.
جهش در عملکرد
نتایج برای مدل Qwen3.8-27B خیرهکننده است. نسخه UD-Q2_K_XL با اشغال ۹.۸۳ گیگابایت فضا، حدود ۸٪ دقیقتر از بهترین رقیب خود در معیارهای top-1% است. در یک تست واقعی، این نسخه توانست یک برنامه HTML کاربردی با تنها یک خطای کوچک JS بسازد؛ کاری که نسخههای قبلی معمولاً در آن شکست میخوردند.

برای کسانی که محدودیت سختافزاری شدید دارند، نسخه UD-IQ1_S مدل را ۸۹٪ کوچک کرده (تا ۶.۲ گیگابایت) اما تقریباً ۷۲٪ از صحت top-1% را حفظ میکند. در تمام سطوح، بهویژه در اندازههای کوچکتر، کوانتهای UD-3 تا ۱۰٪ صحت top-1% اضافی در همان فضای دیسک نسبت به سایر ارائهدهندگان ارائه میدهند. برای تضمین مقایسه عادلانه، در تمام نمودارها هنگام محاسبه فضای دیسک، سر MTP از محور x حذف شده است.
سازگاری و میراث فنی
با وجود اینکه v3.0 استاندارد جدید است، Unsloth همچنان از Dynamic v2.0 برای کوانتهای بزرگتر پشتیبانی میکند، زیرا در آنجا بهبودها کمتر محسوس بود. هنگام مقایسه UD-3 و UD-2 روی دادههای دیده نشده Wikitext و Code، کوانتهای بزرگتر بهبود کمتری نشان دادند، بنابراین UD-2 همچنان انتخاب مناسب برای اندازههای بزرگ است در حالی که تیم روی بهبودهای بیشتر آزمایش میکند.
سیستم v2.0 نخستین سیستمی بود که فراتر از معماریهای ترکیب خبرهها (MoE) عمل کرد و با تمام انواع مدلها، از جمله Llama 4 و Gemma 3 سازگار شد. برای مثال، لایههای کوانتیده در Gemma 3 بهطور قابل توجهی با لایههای Llama 4 متفاوت هستند. این طرح کوانتش سفارشی تضمین میکند که هر مدل برای معماری خاص خود بهینه شود.

برای بهینهسازی در دستگاههای اپل سیلیکون و ARM، Unsloth فرمتهایی مثل Q4_NL، Q5.1، Q5.0، Q4.1 و Q4.0 را ادغام کرده است. همچنین مجموعهداده کالیبراسیون v2.0 شامل بیش از ۱.۵ میلیون توکن دستچین شده برای بهبود کیفیت گفتگو و عملکرد چت است.
اصلاح اکوسیستم متنباز
Unsloth فراتر از کوانتش، در رفع باگهای حیاتی llama.cpp نیز نقش داشته است. آنها به حل مشکلاتی در مورد RoPE Scaling و مقادیر اپسیلون QK Norm در مدل Llama 4 Scout کمک کردند. بهطور خاص، آنها شناسایی کردند که اپسیلون برای Scout و Maverick باید 1e-05 (بر اساس فایل کانفیگ) باشد، نه 1e-06.
سایر بهبودهای اکوسیستمی عبارتند از:
- رفع مشکلی که در آن QK Norm بین تمام سرها (Heads) مشترک بود (توسط تیم Llama 4 و vLLM حل شد). این اصلاح باعث شد صحت MMLU Pro از ۶۸.۵۸٪ به ۷۱.۵۳٪ افزایش یابد.
- رفع مشکلات توکنسازی در Llama 3.1 (8B) Instruct که در آن "A" و "_A" (A با یک فاصله) به عنوان شناسههای متفاوت در نظر گرفته میشدند. با در نظر گرفتن هر دو، صحت از ۶۷.۸٪ (ساده) به ۶۸.۲٪ رسید.
- شناسایی این موضوع که بنچمارکهای Llama 3 از طریق LLM Harness شرکت Eleuther AI، عبارت "The best answer is" را به انتهای سوال اضافه میکنند.

معیار کارایی
برای مقایسه عادلانه مدلهای مختلف، Unsloth فرمول کارایی خاص خود را تعریف کرده است: $\text{Efficiency} = \frac{\text{MMLU 5 shot score} - 25}{\text{Disk Space GB}}$. کسر عدد ۲۵ برای حذف اثر حدس تصادفی در سوالات چهارگزینهای (A, B, C, D) است، زیرا هر مدل حتی با حدس تصادفی ۲۵٪ صحت میگیرد. این کار مانع از آن میشود که مدلهایی با فضای دیسک بسیار کم اما صحت تصادفی، کارآمد به نظر برسند.

در رویارویی با نسخههای QAT گوگل برای مدل Gemma 3 (27B)، نسخه ۴ بیتی پویا (Dynamic) Unsloth حدود ۲ گیگابایت کوچکتر بود اما ۱٪ صحت بیشتری داشت. برای مدل ۱۲ میلیارد پارامتری Gemma 3، نسخه Q4_0 QAT امتیاز ۶۷.۰۷٪ را در مقابل ۶۷.۱۵٪ نسخه BF16 در MMLU 5-shot کسب کرد. نسخه ۲ بیتی Q2_K_XL Unsloth نیز نتایج قوی نشان داد و KLD را تقریباً ۷.۵٪ کاهش داد.
تحلیل: مرگ کوانتهای «احمق»
این تغییر نشان میدهد که صنعت در حال فاصله گرفتن از کوانتش یکنواخت است. دوران اعمال ساده «۴-بیت» روی کل مدل به پایان میرسد. در عوض، ما شاهد حرکت به سمت فشردهسازی جراحیگونه هستیم؛ جایی که هوش مصنوعی میداند کدام بخشهای «مغزش» برای منطق ضروری و کدام بخشها زائد هستند.
استفاده Unsloth از مجموعهدادههای Calibration_v3 و Calibration_v5 از مشکل رایج بیشبرازش روی دادههای صرفاً ویکیپدیا جلوگیری میکند. اکثر GGUFهای imatrix با مجموعهدادههای متنی کالیبره میشوند که برای مدلهای Instruct با قالبهای چت خاص، ناکارآمد هستند. Unsloth با استفاده از دادههای متنوع و تست روی دادههای دیده نشده، از تورم مصنوعی امتیازات Perplexity که در سایر فریمورکها رایج است، اجتناب میکند.
برای کاربر نهایی، این به معنای کاهش سد ورود برای اجرای مدلهای پیشرو است. وقتی یک مدل ۲۷ میلیارد پارامتری میتواند در کمتر از ۱۰ گیگابایت VRAM جای بگیرد بدون اینکه توانایی استدلالش را از دست بدهد، نیاز به GPUهای ابری گرانقیمت برای اکثر توسعهدهندگان کاهش مییابد. این موضوع با امتیاز ۷۵.۶٪ مدل DeepSeek V3.1 GGUF (نسخه ۳-بیت پویا) در Aider Polyglot که از بسیاری از مدلهای SOTA با دقت کامل پیشی گرفت، بیشتر اثبات میشود.
این امر همچنین فشار را بر سازندگان مدل مانند گوگل و متا افزایش میدهد تا ابزارهای کوانتش رسمی بهتری ارائه دهند. اگر ابزارهای شخص ثالث مانند Unsloth بتوانند از نسخههای رسمی QAT بهتر عمل کنند، ثابت میشود که گلوگاه، معماری مدل نیست، بلکه خط لوله فشردهسازی است.
اگر از مدلهای محلی استفاده میکنید، بررسی کنید که آیا GGUFهای شما نسخه v2.0 هستند یا v3.0. مهاجرت به آخرین کوانتهای Unsloth میتواند بدون نیاز به ارتقای سختافزاری، جهشی محسوس در دقت کدنویسی شما ایجاد کند.
- اگر از مدلهای محلی استفاده میکنید، بررسی کنید که آیا GGUFهای شما نسخه v2.0 هستند یا v3.0.
- برای پروژههای کدنویسی محلی، نسخه UD-Q2_K_XL را جایگزین نسخههای قدیمی کنید تا افزایش دقت را تجربه کنید.
- مستندات imatrix در وبسایت Unsloth را برای شخصیسازی کالیبراسیون مدلهای خود مطالعه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو