پرش به محتوای اصلی
پرش به محتوای مقاله

POCKET: اجرای مدل‌های ۳۵ میلیارد پارامتری روی CPU با سرعت ۳.۴ برابر

·۹ مرداد ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
اجرای مدل ۳۵ میلیارد پارامتری روی CPU با llama.cpp، حدود ۳.۴ برابر سریع‌تر از Bonsai
اجرای مدل ۳۵ میلیارد پارامتری روی CPU با llama.cpp، حدود ۳.۴ برابر سریع‌تر از Bonsai
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به توان عملیاتی ۳.۴ برابر بیشتر نسبت به Bonsai روی CPU معمولی؛ این یعنی مدل‌های ۳۵ میلیارد پارامتری دیگر فقط در مراکز داده زنده نیستند.

تصور کنید مدل‌های هوش مصنوعی قدرتمندی که پیش‌تر به سخت‌افزارهای صنعتی نیاز داشتند، حالا روی لپ‌تاپ‌های معمولی شما با سرعت قابل‌قبولی اجرا شوند. اگر امروز برای اجرای مدل‌های محلی هزینه‌های گزاف GPU را می‌پردازید، POCKET می‌تواند میزبان بازی را تغییر دهد.

طبق گزارشی که ۳۱ ژوئیه ۲۰۲۶ در dev.to منتشر شد، سیستم POCKET با استفاده از زیرساخت استنتاج (Inference) — که شبیه لحظهٔ پخت غذا پس از یادگیری دستور پخت است — در لاماسیس‌پلاس‌پلاس (llama.cpp)، توان عملیاتی را تقریباً ۳.۴ برابر بیشتر از مدل پایهٔ Bonsai کرده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، کمبود و قیمت بالای پردازنده‌های گرافیکی همواره سدی در برابر استقرار هوش مصنوعی در محیط‌های خصوصی و ایزوله بوده است. در این راستا، چالش‌های مربوط به هزینه‌های مهندسی و محدودیت‌های هرس مدل‌های زبانی لبه همواره یکی از نقاط بحرانی در نقشه راه استقرار این فناوری‌ها بوده است. POCKET به‌جای تکیه بر شتاب‌دهنده‌های (Accelerator) پرمصرف، مستقیماً روی سیلیکون‌های استاندارد CPU تمرکز کرده است.

اجرای مدل ۳۵ میلیارد پارامتری روی CPU با llama.cpp، حدود ۳.۴ برابر سریع‌تر از Bonsai

برای ساده‌سازی استقرار، POCKET گزینه‌های متعددی را ارائه می‌دهد:

  • توزیع از طریق اولاما (Ollama)، داکر (Docker)، مدل‌اسکوپ (ModelScope) و هاگینگ فیس (Hugging Face) در قالب GGUF.
  • معرفی POCKET Box؛ یک سخت‌افزار اختصاصی مبتنی بر CPU که وابستگی کاربر به شتاب‌دهنده‌های خاص را به‌طور کامل حذف می‌کند.

به نقل از توسعه‌دهندگان این پروژه، استراتژی POCKET به‌شدت بر کوانت‌سازی (Quantization) — که شبیه تبدیل یک عکس باکیفیت به فرمت JPEG برای اشغال فضای کمتر است — متکی است. این تلاش برای کوچک‌سازی مدل‌ها در کنار رویکردهایی مانند استخراج منطق استدلالی در مدل‌های محلی کوچک، مسیر را برای اجرای هوش مصنوعی روی سخت‌افزارهای محدود هموارتر می‌کند. در این میان، استفاده از کوانت‌سازی بسیار شدید (IQ1) باعث افت کیفیت محسوس در خروجی‌های زبان کره‌ای شده است. برای حفظ کیفیت، استفاده از کوانت‌سازی Q4 یا بالاتر توصیه می‌شود.

این رویکرد ثابت کرد که هوش مصنوعی در مقیاس ۳۵ میلیارد پارامتر روی سخت‌افزارهای بدون GPU نیز عملیاتی است. اگرچه سرعت مطلق همچنان کمتر از سرویس‌های مبتنی بر GPU است، اما جهش ۳.۴ برابری نسبت به Bonsai نشان‌دهنده پیشرفت مهندسی است و نه صرفاً یک تغییر نام تجاری.

برای متخصصان، این یعنی استنتاج محلی و خصوصی اکنون برای کاربردهایی که افزودن GPU در آن‌ها غیرممکن است، در دسترس شده است. البته این دستاورد مستلزم ایجاد یک موازنه دقیق بین اندازه مدل، سطح کوانت‌سازی و دقت زبانی است.

گام بعدی شما

  • مدل‌های GGUF این پروژه را از طریق Ollama دانلود کنید تا میزان تاثیر کوانت‌سازی Q4 بر کیفیت پاسخ‌های زبان مورد نیاز خود را بسنجید.
  • اگر در محیطی با محدودیت سخت‌افزاری فعالیت می‌کنید، معماری POCKET Box را برای جایگزینی سرورهای گران‌قیمت بررسی کنید.
  • تفاوت نرخ توکن در ثانیه در مدل‌های مختلف ۳۵ میلیارد پارامتری را روی CPU خود تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره‌ی تراشه‌های نسل جدید و معماری‌های جایگزین GPU مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار llama.cpp، دسترسی به مدل‌های ۳۵ میلیارد پارامتری را برای سازمان‌هایی که محدودیت سخت‌افزاری یا امنیتی دارند، دموکراتیک می‌کند. در نتیجه، هزینه استقرار هوش مصنوعی محلی به‌شدت کاهش می‌یابد.

تأثیر برای ایران

با توجه به دشواری تامین GPUهای صنعتی در ایران، این ابزار به توسعه‌دهندگان داخلی اجازه می‌دهد مدل‌های متوسط را روی سرورهای CPU موجود اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز POCKET بر CPU نشان می‌دهد که دوران «انحصار مطلق GPU» برای استقرار مدل‌های متوسط در حال پایان است. این رویکرد احتمالاً مسیر را برای ظهور سخت‌افزارهای تخصصی ارزان‌قیمت (Edge AI) هموار می‌کند که به‌جای قدرت خام، بر بهینه‌سازی حافظه و پهنای باند تمرکز دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.