تưởng کنید بتوانید حجم یک مدل عظیم را یکچهارم کنید بدون اینکه حتی یک نقطه از دقت آن کم شود. عدد دقیق ۲۴.۹۶۷٪ کاهش حجم وزنها در مدل GLM-5.2 753B، نتیجهای است که در یک آزمایش فشردهسازی بدون تلفات به دست آمده است.
به نقل از گزارش فنی منتشر شده در ۲۰ ژوئیه ۲۰۲۶، پژوهشگران این نتیجه را روی تمامی ۵۹,۵۰۹ تانسور BF16 در مدل بررسی کردند. وزنهای استاندارد BF16 از ۱۶ بیت استفاده میکنند، اما در مدلهای آموزشدیده، نماها (exponents) اغلب تکراری هستند. این تکرار فرصتی ایجاد میکند تا نمادهای رایج علامت و نما با کدهای کوتاهتر جایگزین شوند.
همانطور که در تحلیل قبلی ما دربارهی چالشهای حافظه در مدلهای ترتیلی اشاره کردیم، گلوگاه اصلی همواره در VRAM بوده است. در این پروژه، دو مسیر مجزا برای نقطه بازرسی (checkpoint) مدل GLM-5.2 دنبال شد:
- مسیر بایت-تقسیمشده (Byte-Split): در این روش، بایت بالا با استفاده از یک کتابچه کد (codebook) رمزگشایی شد و بایت پایین بدون تغییر باقی ماند. این متد به کاهش ۲۴.۹۶۷ درصدی (۱۲.۰۰۵ بیت برای هر وزن) رسید و صحت آن روی کل مجموعه داده ۱.۴ ترابایتی تایید شد.
- مسیر حسابداری K15: یک طرح تئوریک که نمادهای ۹ بیتی را با کدهای ۴ بیتی از یک جدول ۱۵ ورودی جایگزین میکند. اسکن کامل این مدل، کاهش ۳۰.۱۶۸ درصدی را پیشبینی کرد که هزینه وزنها را به ۱۱.۱۷۳ بیت میرساند.
طبق گزارش این تیم، یک نمونه اولیه ۱۲ بیتی روی GPU A40 تست شد که سرعت آن ۰.۷۳۳ برابر با استاندارد BF16 GEMV بود. با این حال، محققان تأکید میکنند که این تنها یک نمونه اولیه است و ادغام کامل در محیط سرویسدهی مدل (model serving) همچنان یک چالش فنی باقی مانده است. این تلاشها در راستای بهینهسازی زیرساختی است، مشابه آنچه در بهبود سرعت استنتاج مدل Qwen3.5 روی سختافزارهای DGX Spark شاهد بودیم.
این تغییر برای توسعهدهندگان به این معناست که گلوگاههای حافظه در مدلهای عظیم را میتوان بدون افت کیفیتی که معمولاً در کوانتش (Quantization) — شبیه به کاهش کیفیت یک عکس برای کم شدن حجمش — رخ میدهد، برطرف کرد. اگر این نتایج در رانتایمهای سرویسدهی ادغام شوند، هزینه میزبانی مدلهای تریلیون-پارامتری بهشدت کاهش مییابد. این رویکرد مکمل راهکارهای نرمافزاری دیگری است که مانند سامانه Tirtha توانستند هزینههای استنتاج را تا ۸ برابر کاهش دهند.
گام بعدی شما
- مهندسان میتوانند با اجرای دستور
uv run verify.pyاز فایل REPRODUCE.md پروژه، این یافتهها را بازتولید کنند. - بررسی کنید آیا زیرساختهای فعلی شما از رمزگشایی بایت-تقسیمشده پشتیبانی میکنند یا خیر.
- برای رصد کاهش هزینههای استنتاج، تحولات در لایههای سختافزاری NVIDIA را دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو