تصور کنید بتوانید یک مدل زبانی قدرتمند را روی گوشی موبایل اجرا کنید، بدون اینکه هوش آن بهخاطر محدودیت حافظه، نصف شود. طبق اعلام Liquid AI در ۱۹ اوت ۲۰۲۶، اکنون ۹۷٪ از دقتی که معمولاً در فرآیند کوانتش (Quantization) — شبیه فشردهسازی یک عکس باکیفیت که باعث میشود برخی جزئیات محو شوند — از دست میرود، قابل بازیابی است.
این شرکت با انتشار نقاط بازرسی (Checkpoints) مدلهای خانواده LFM2.5 با فرمت GGUF و متد Q4_0، موازنه سنتی میان سرعت و هوش را در رایانش لبه (Edge Computing) تغییر داد. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای کوچک اشاره کردیم، چالش اصلی همواره کاهش توان استدلال در مدلهای فشرده بوده است. این رویکرد در ادامه تلاشهای گستردهتر برای کاهش حجم مدلها قرار دارد، مشابه راهکارهای خوشهبندی وزنها برای بهینهسازی حافظه در سیستمهای iOS که پیشتر بررسی کردیم.
بیشتر توسعهدهندگان از کوانتش پس از آموزش (PTQ) برای کوچک کردن مدلها استفاده میکنند، اما این روش اغلب باعث تضعیف تواناییهای استدلال و استفاده از ابزار (Tool Use) میشود. به نقل از مستندات Liquid AI، آنها بهجای آن از تقطیر آگاه از کوانتش (Quantization-Aware Distillation یا QAD) استفاده کردهاند؛ در این روش، یک مدل «معلم» با دقت بالا، مدل «شاگرد» کوانتیده شده را در حین آموزش هدایت میکند تا مدل کوچکتر یاد بگیرد پیش از رسیدن به دستگاه کاربر، افت دقت را جبران کند.

این بهروزرسانی چهار مدل خاص را شامل میشود:
- LFM2.5-230M
- LFM2.5-350M
- LFM2.5-1.2B-Instruct
- LFM2.5-2.6B
بر اساس گزارش وبلاگ این شرکت، این نقاط بازرسی بین ۹۶.۵٪ تا ۹۷.۴٪ از عملکرد پایه BF16 خود را در محکهای سختگیرانهای مثل GPQA Diamond و MMLU-Pro حفظ کردهاند.
عملکرد در سختافزارهای لبه
برای اثبات کارایی روش QAD، توان عملیاتی (Throughput) رمزگشایی در سختافزارهای مختلف تست شد:
- MacBook Pro و NucBox EVO-X2: استفاده از استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دورهی آموزش آشپز — روی GPU.
- Samsung Galaxy S26 Ultra و Raspberry Pi 5: استفاده از استنتاج روی CPUهای Arm.
این تفاوت در عملکرد روی سختافزارهای مختلف، اهمیت نقش معماری سختافزاری در تعیین سرعت و هزینه مدلهای یادگیری ماشین را بیش از پیش نمایان میکند.


در مدلهای ۲۳۰ و ۳۵۰ میلیونی، نقاط بازرسی QAD Q4_0 کیفیتی مشابه مدلهای Q5_K_M دارند اما توان عملیاتی آنها ۴٪ تا ۳۳٪ بیشتر است. در مدلهای بزرگتر (۱.۲ و ۲.۶ میلیارد پارامتری)، کیفیت با Q4_K_M برابری میکند اما سرعت ۳٪ تا ۱۴٪ افزایش یافته است.


این تغییر، استاندارد استقرار هوش مصنوعی روی دستگاه را جابهجا میکند. با اثبات اینکه تقطیر (Distillation) میتواند جریمهی کوانتش ۴ بیتی را «پاک» کند، اکنون استقرار قابلیتهای پیچیدهترِ عاملمحور (Agentic) روی سختافزارهای کممصرف، بدون نیاز به فرمتهای کندتر، ممکن شده است.
توسعهدهندگان میتوانند همین حالا این مدلها را از طریق llama.cpp یا هر محیطی که از آرتیفکتهای GGUF Q4_0 پشتیبانی میکند، پیادهسازی کنند.
گام بعدی شما
- اگر روی اپلیکیشنهای موبایلی کار میکنید، مدلهای LFM2.5 را با فرمت Q4_0 جایگزین مدلهای Q5 کنید تا سرعت را بدون افت دقت افزایش دهید.
- عملکرد بازیابی در زمینههای متنی طولانی (Long-context) را در این مدلهای تقطیرشده بررسی کنید.
- برای کاهش هزینههای سختافزاری، استقرار مدلهای ۱.۲ میلیاردی را روی Raspberry Pi 5 تست کنید.
اما تأثیر این بهینهسازی بر مصرف باتری در دستگاههای لبه، متغیری است که در گزارشهای بعدی بررسی خواهیم کرد.




گفتگو