پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های ۴ بیتی در برابر BF16؛ حذف شکاف دقت در سخت‌افزار ضعیف

·۲۸ مرداد ۱۴۰۵۲ دقیقه مطالعه
نقاط کنترلی LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاه از کوانتیزاسیون
نقاط کنترلی LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاه از کوانتیزاسیون
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از تقطیر آگاه از کوانتش (QAD) برای بازیابی ۹۷٪ از دقت از دست رفته در مدل‌های ۴ بیتی؛ برخلاف روش‌های رایج که فقط مدل را فشرده می‌کنند، اینجا مدل یاد می‌گیرد چگونه با دقت پایین، هوشمند بماند.

تصور کنید بتوانید یک مدل زبانی قدرتمند را روی گوشی موبایل اجرا کنید، بدون اینکه هوش آن به‌خاطر محدودیت حافظه، نصف شود. طبق اعلام Liquid AI در ۱۹ اوت ۲۰۲۶، اکنون ۹۷٪ از دقتی که معمولاً در فرآیند کوانتش (Quantization) — شبیه فشرده‌سازی یک عکس باکیفیت که باعث می‌شود برخی جزئیات محو شوند — از دست می‌رود، قابل بازیابی است.

این شرکت با انتشار نقاط بازرسی (Checkpoints) مدل‌های خانواده LFM2.5 با فرمت GGUF و متد Q4_0، موازنه سنتی میان سرعت و هوش را در رایانش لبه (Edge Computing) تغییر داد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، چالش اصلی همواره کاهش توان استدلال در مدل‌های فشرده بوده است. این رویکرد در ادامه تلاش‌های گسترده‌تر برای کاهش حجم مدل‌ها قرار دارد، مشابه راهکارهای خوشه‌بندی وزن‌ها برای بهینه‌سازی حافظه در سیستم‌های iOS که پیش‌تر بررسی کردیم.

بیشتر توسعه‌دهندگان از کوانتش پس از آموزش (PTQ) برای کوچک کردن مدل‌ها استفاده می‌کنند، اما این روش اغلب باعث تضعیف توانایی‌های استدلال و استفاده از ابزار (Tool Use) می‌شود. به نقل از مستندات Liquid AI، آن‌ها به‌جای آن از تقطیر آگاه از کوانتش (Quantization-Aware Distillation یا QAD) استفاده کرده‌اند؛ در این روش، یک مدل «معلم» با دقت بالا، مدل «شاگرد» کوانتیده شده را در حین آموزش هدایت می‌کند تا مدل کوچک‌تر یاد بگیرد پیش از رسیدن به دستگاه کاربر، افت دقت را جبران کند.

نقاط بازرسی LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاهانه

این به‌روزرسانی چهار مدل خاص را شامل می‌شود:

  • LFM2.5-230M
  • LFM2.5-350M
  • LFM2.5-1.2B-Instruct
  • LFM2.5-2.6B

بر اساس گزارش وبلاگ این شرکت، این نقاط بازرسی بین ۹۶.۵٪ تا ۹۷.۴٪ از عملکرد پایه BF16 خود را در محک‌های سخت‌گیرانه‌ای مثل GPQA Diamond و MMLU-Pro حفظ کرده‌اند.

عملکرد در سخت‌افزارهای لبه

برای اثبات کارایی روش QAD، توان عملیاتی (Throughput) رمزگشایی در سخت‌افزارهای مختلف تست شد:

  • MacBook Pro و NucBox EVO-X2: استفاده از استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — روی GPU.
  • Samsung Galaxy S26 Ultra و Raspberry Pi 5: استفاده از استنتاج روی CPUهای Arm.

این تفاوت در عملکرد روی سخت‌افزارهای مختلف، اهمیت نقش معماری سخت‌افزاری در تعیین سرعت و هزینه مدل‌های یادگیری ماشین را بیش از پیش نمایان می‌کند.

نقاط بازرسی LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاهانه

نقاط کنترل LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاهانه

در مدل‌های ۲۳۰ و ۳۵۰ میلیونی، نقاط بازرسی QAD Q4_0 کیفیتی مشابه مدل‌های Q5_K_M دارند اما توان عملیاتی آن‌ها ۴٪ تا ۳۳٪ بیشتر است. در مدل‌های بزرگ‌تر (۱.۲ و ۲.۶ میلیارد پارامتری)، کیفیت با Q4_K_M برابری می‌کند اما سرعت ۳٪ تا ۱۴٪ افزایش یافته است.

نقاط بازرسی LFM2.5 Q4_0 از تقطیر آگاهانه کوانتیزاسیون

نقاط بازرسی LFM2.5 با کوانتیزاسیون Q4_0 از تقطیر آگاهانه

این تغییر، استاندارد استقرار هوش مصنوعی روی دستگاه را جابه‌جا می‌کند. با اثبات اینکه تقطیر (Distillation) می‌تواند جریمه‌ی کوانتش ۴ بیتی را «پاک» کند، اکنون استقرار قابلیت‌های پیچیده‌ترِ عامل‌محور (Agentic) روی سخت‌افزارهای کم‌مصرف، بدون نیاز به فرمت‌های کندتر، ممکن شده است.

توسعه‌دهندگان می‌توانند همین حالا این مدل‌ها را از طریق llama.cpp یا هر محیطی که از آرتیفکت‌های GGUF Q4_0 پشتیبانی می‌کند، پیاده‌سازی کنند.

گام بعدی شما

  • اگر روی اپلیکیشن‌های موبایلی کار می‌کنید، مدل‌های LFM2.5 را با فرمت Q4_0 جایگزین مدل‌های Q5 کنید تا سرعت را بدون افت دقت افزایش دهید.
  • عملکرد بازیابی در زمینه‌های متنی طولانی (Long-context) را در این مدل‌های تقطیرشده بررسی کنید.
  • برای کاهش هزینه‌های سخت‌افزاری، استقرار مدل‌های ۱.۲ میلیاردی را روی Raspberry Pi 5 تست کنید.

اما تأثیر این بهینه‌سازی بر مصرف باتری در دستگاه‌های لبه، متغیری است که در گزارش‌های بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص Liquid AI در معماری‌های غیرترنسفورمری، سد میان سرعت استنتاج و دقت مدل را می‌شکند. در نتیجه، اجرای عامل‌های هوشمند محلی روی سخت‌افزارهای ارزان‌قیمت به یک واقعیت تجاری تبدیل می‌شود.

تأثیر برای ایران

برنامه‌نویسان ایرانی که به دلیل محدودیت‌های سخت‌افزاری و هزینه GPU به مدل‌های کوچک روی لبه متکی هستند، اکنون می‌توانند از مدل‌های LFM2.5 برای ساخت دستیارهای محلی با سرعت بالا و دقت نزدیک به مدل‌های حجیم استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی PTQ با QAD نشان می‌دهد که آینده‌ی مدل‌های لبه در «آموزش هدفمند برای فشرده‌سازی» است، نه فقط فشرده‌سازی مدل‌های از پیش آموزش‌دیده. این رویکرد احتمالاً باعث می‌شود مدل‌های بسیار کوچک (زیر ۱ میلیارد پارامتر) بتوانند جایگزین مدل‌های متوسط در کارهای تخصصی شوند، چون دیگر لازم نیست برای حفظ دقت، حجم مدل را افزایش دهیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.