پرش به محتوای اصلی
پرش به محتوای مقاله

«فشرده‌سازی بدون تلفات»؛ دستاوردی جدید در بهینه‌سازی GLM-5.2

·۲۹ تیر ۱۴۰۵۲ دقیقه مطالعه
آزمایش فشرده‌سازی بدون اتلاف مدل: مقایسه روش‌های کاهش حجم مدل‌های یادگیری ماشین با حفظ دقت کامل
آزمایش فشرده‌سازی بدون اتلاف مدل: مقایسه روش‌های کاهش حجم مدل‌های یادگیری ماشین با حفظ دقت کامل
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به فشرده‌سازی تقریباً ۲۵ درصدی در تانسورهای BF16 بدون تلفات (Lossless)؛ در حالی که روش‌های پیشین یا دقت را فدا می‌کردند یا درصد کاهش بسیار پایین‌تری داشتند.

تưởng کنید بتوانید حجم یک مدل عظیم را یک‌چهارم کنید بدون اینکه حتی یک نقطه از دقت آن کم شود. عدد دقیق ۲۴.۹۶۷٪ کاهش حجم وزن‌ها در مدل GLM-5.2 753B، نتیجه‌ای است که در یک آزمایش فشرده‌سازی بدون تلفات به دست آمده است.

به نقل از گزارش فنی منتشر شده در ۲۰ ژوئیه ۲۰۲۶، پژوهشگران این نتیجه را روی تمامی ۵۹,۵۰۹ تانسور BF16 در مدل بررسی کردند. وزن‌های استاندارد BF16 از ۱۶ بیت استفاده می‌کنند، اما در مدل‌های آموزش‌دیده، نماها (exponents) اغلب تکراری هستند. این تکرار فرصتی ایجاد می‌کند تا نمادهای رایج علامت و نما با کدهای کوتاه‌تر جایگزین شوند.

همان‌طور که در تحلیل قبلی ما درباره‌ی چالش‌های حافظه در مدل‌های ترتیلی اشاره کردیم، گلوگاه اصلی همواره در VRAM بوده است. در این پروژه، دو مسیر مجزا برای نقطه بازرسی (checkpoint) مدل GLM-5.2 دنبال شد:

  • مسیر بایت-تقسیم‌شده (Byte-Split): در این روش، بایت بالا با استفاده از یک کتابچه کد (codebook) رمزگشایی شد و بایت پایین بدون تغییر باقی ماند. این متد به کاهش ۲۴.۹۶۷ درصدی (۱۲.۰۰۵ بیت برای هر وزن) رسید و صحت آن روی کل مجموعه داده ۱.۴ ترابایتی تایید شد.
  • مسیر حسابداری K15: یک طرح تئوریک که نمادهای ۹ بیتی را با کدهای ۴ بیتی از یک جدول ۱۵ ورودی جایگزین می‌کند. اسکن کامل این مدل، کاهش ۳۰.۱۶۸ درصدی را پیش‌بینی کرد که هزینه وزن‌ها را به ۱۱.۱۷۳ بیت می‌رساند.

طبق گزارش این تیم، یک نمونه اولیه ۱۲ بیتی روی GPU A40 تست شد که سرعت آن ۰.۷۳۳ برابر با استاندارد BF16 GEMV بود. با این حال، محققان تأکید می‌کنند که این تنها یک نمونه اولیه است و ادغام کامل در محیط سرویس‌دهی مدل (model serving) همچنان یک چالش فنی باقی مانده است. این تلاش‌ها در راستای بهینه‌سازی زیرساختی است، مشابه آنچه در بهبود سرعت استنتاج مدل Qwen3.5 روی سخت‌افزارهای DGX Spark شاهد بودیم.

این تغییر برای توسعه‌دهندگان به این معناست که گلوگاه‌های حافظه در مدل‌های عظیم را می‌توان بدون افت کیفیتی که معمولاً در کوانتش (Quantization) — شبیه به کاهش کیفیت یک عکس برای کم شدن حجمش — رخ می‌دهد، برطرف کرد. اگر این نتایج در ران‌تایم‌های سرویس‌دهی ادغام شوند، هزینه میزبانی مدل‌های تریلیون-پارامتری به‌شدت کاهش می‌یابد. این رویکرد مکمل راهکارهای نرم‌افزاری دیگری است که مانند سامانه Tirtha توانستند هزینه‌های استنتاج را تا ۸ برابر کاهش دهند.

گام بعدی شما

  • مهندسان می‌توانند با اجرای دستور uv run verify.py از فایل REPRODUCE.md پروژه، این یافته‌ها را بازتولید کنند.
  • بررسی کنید آیا زیرساخت‌های فعلی شما از رمزگشایی بایت-تقسیم‌شده پشتیبانی می‌کنند یا خیر.
  • برای رصد کاهش هزینه‌های استنتاج، تحولات در لایه‌های سخت‌افزاری NVIDIA را دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روش با تکیه بر تحلیل آماری توزیع وزن‌ها، اثبات می‌کند که مدل‌های عظیم دارای افزونگی (Redundancy) داده‌ای زیادی هستند. پیاده‌سازی این اعتبار در تراز صنعتی، هزینه عملیاتی مراکز داده را برای مدل‌های بزرگ به‌طور مستقیم کاهش می‌دهد.

تأثیر برای ایران

این دستاورد برای پژوهشگران ایرانی که با محدودیت شدید منابع GPU و VRAM روبرو هستند، راهکاری برای اجرای مدل‌های حجیم روی سخت‌افزارهای موجود فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد فرضیه قدیمی «Trade-off بین حجم و دقت» را در سطح BF16 به چالش می‌کشد. برخلاف کوانتش‌های متداول که بخشی از اطلاعات را فدای سرعت می‌کنند، اینجا با یک بهینه‌سازی ساختاری در نمایش داده‌ها روبرو هستیم. اگر این متد به استانداردهای کتابخانه‌های استنتاج تبدیل شود، نیاز به سخت‌افزارهای VRAM-محور در مقیاس‌های تریلیونی به‌شدت کاهش می‌یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.