تصور کنید مدلهای هوش مصنوعی قدرتمندی که پیشتر به سختافزارهای صنعتی نیاز داشتند، حالا روی لپتاپهای معمولی شما با سرعت قابلقبولی اجرا شوند. اگر امروز برای اجرای مدلهای محلی هزینههای گزاف GPU را میپردازید، POCKET میتواند میزبان بازی را تغییر دهد.
طبق گزارشی که ۳۱ ژوئیه ۲۰۲۶ در dev.to منتشر شد، سیستم POCKET با استفاده از زیرساخت استنتاج (Inference) — که شبیه لحظهٔ پخت غذا پس از یادگیری دستور پخت است — در لاماسیسپلاسپلاس (llama.cpp)، توان عملیاتی را تقریباً ۳.۴ برابر بیشتر از مدل پایهٔ Bonsai کرده است.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای لبه اشاره کردیم، کمبود و قیمت بالای پردازندههای گرافیکی همواره سدی در برابر استقرار هوش مصنوعی در محیطهای خصوصی و ایزوله بوده است. در این راستا، چالشهای مربوط به هزینههای مهندسی و محدودیتهای هرس مدلهای زبانی لبه همواره یکی از نقاط بحرانی در نقشه راه استقرار این فناوریها بوده است. POCKET بهجای تکیه بر شتابدهندههای (Accelerator) پرمصرف، مستقیماً روی سیلیکونهای استاندارد CPU تمرکز کرده است.

برای سادهسازی استقرار، POCKET گزینههای متعددی را ارائه میدهد:
- توزیع از طریق اولاما (Ollama)، داکر (Docker)، مدلاسکوپ (ModelScope) و هاگینگ فیس (Hugging Face) در قالب GGUF.
- معرفی POCKET Box؛ یک سختافزار اختصاصی مبتنی بر CPU که وابستگی کاربر به شتابدهندههای خاص را بهطور کامل حذف میکند.
به نقل از توسعهدهندگان این پروژه، استراتژی POCKET بهشدت بر کوانتسازی (Quantization) — که شبیه تبدیل یک عکس باکیفیت به فرمت JPEG برای اشغال فضای کمتر است — متکی است. این تلاش برای کوچکسازی مدلها در کنار رویکردهایی مانند استخراج منطق استدلالی در مدلهای محلی کوچک، مسیر را برای اجرای هوش مصنوعی روی سختافزارهای محدود هموارتر میکند. در این میان، استفاده از کوانتسازی بسیار شدید (IQ1) باعث افت کیفیت محسوس در خروجیهای زبان کرهای شده است. برای حفظ کیفیت، استفاده از کوانتسازی Q4 یا بالاتر توصیه میشود.
این رویکرد ثابت کرد که هوش مصنوعی در مقیاس ۳۵ میلیارد پارامتر روی سختافزارهای بدون GPU نیز عملیاتی است. اگرچه سرعت مطلق همچنان کمتر از سرویسهای مبتنی بر GPU است، اما جهش ۳.۴ برابری نسبت به Bonsai نشاندهنده پیشرفت مهندسی است و نه صرفاً یک تغییر نام تجاری.
برای متخصصان، این یعنی استنتاج محلی و خصوصی اکنون برای کاربردهایی که افزودن GPU در آنها غیرممکن است، در دسترس شده است. البته این دستاورد مستلزم ایجاد یک موازنه دقیق بین اندازه مدل، سطح کوانتسازی و دقت زبانی است.
گام بعدی شما
- مدلهای GGUF این پروژه را از طریق Ollama دانلود کنید تا میزان تاثیر کوانتسازی Q4 بر کیفیت پاسخهای زبان مورد نیاز خود را بسنجید.
- اگر در محیطی با محدودیت سختافزاری فعالیت میکنید، معماری POCKET Box را برای جایگزینی سرورهای گرانقیمت بررسی کنید.
- تفاوت نرخ توکن در ثانیه در مدلهای مختلف ۳۵ میلیارد پارامتری را روی CPU خود تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ به تحلیل ما دربارهی تراشههای نسل جدید و معماریهای جایگزین GPU مراجعه کنید.




گفتگو