پرش به محتوای اصلی
پرش به محتوای مقاله

سازوکار KVarN برای افزایش ۵ برابری ظرفیت حافظه در vLLM بدون افت سرعت

·۱۴ خرداد ۱۴۰۵۳ دقیقه مطالعه
سازوکار KVarN برای افزایش ۵ برابری ظرفیت حافظه در vLLM بدون افت سرعت
اشتراک‌گذاری

اگر در حال توسعه‌ی عامل‌های هوش مصنوعی با بافت‌های حجیم هستید، احتمالاً می‌دانید که حافظه‌ی GPU بزرگ‌ترین گلوگاه شماست. تصور کنید می‌توانید ۳ تا ۵ برابر داده‌ی بیشتر را در همان فضای حافظه جای دهید، بدون اینکه پاسخ‌های مدل کندتر شود.

کوانتیزه‌ساز KV-cache بومی vLLM برای عامل‌ها: ۳ تا ۵ برابر زمینه، توان بالاتر از FP16، دقت FP16، بدون کالیبراسیون، با یک پرچم

طبق اعلام توسعه‌دهندگان در ۴ ژوئن ۲۰۲۶، KVarN به عنوان یک بک‌اند توجه (Attention Backend) بومی برای vLLM معرفی شده است. در حالت عادی، کوانتیزاسیون — که شبیه به خلاصه‌سازی یادداشت‌های مدل برای اشغال فضای کمتر است — کاربر را مجبور به انتخابی سخت می‌کند: یا ظرفیت حافظه را بالا ببرید و سرعت را فدا کنید، یا سرعت را حفظ کنید و دقت را از دست بدهید. به همین دلیل بسیاری از تیم‌های عملیاتی از این تکنیک دوری می‌کنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی پروژه‌ی Flourish و تلاش برای جایگزینی مدل‌های زبانی اشاره کردیم، مدیریت پنجره‌های متنی طولانی همواره یک چالش بوده است. KVarN حالا قصد دارد این «مالیات عملکرد» را به‌کلی حذف کند.

به نقل از مستندات گیت‌هاب این پروژه، KVarN در آزمایش‌های AIME25 روی مدل Qwen3-32B با بافت ۱۶ هزار توکنی، دقتی برابر با فرمت FP16 ثبت کرده است. این سیستم از یک خط لوله‌ی چهار مرحله‌ای برای پردازش توکن‌ها استفاده می‌کند:

  • دوران هادامار (Hadamard rotation) برای ترکیب کانال‌ها و پخش داده‌های پرت.
  • نرمال‌سازی تکرارپذیری واریانس برای کاهش خطاهای کوانتیزاسیون.
  • کوانتیزاسیون نامتقارن با گرد کردن به نزدیک‌ترین مقدار.
  • تاشدن مقیاس (Scale folding) در زمان بازخوانی.

مخزن KVarN: بک‌اند کوانتیزه‌سازی KV-cache بومی vLLM؛ ۳-۵ برابر زمینه، توان بالاتر و دقت سطح FP16، بدون کالیبراسیون، یک پرچم

بر اساس نتایج تست‌ها، سرعت استنتاج (Inference) — یعنی همان لحظه تولید پاسخ که شبیه به خودِ آشپزی است و نه آموزش آن — تا ۱.۳ برابر سریع‌تر از FP16 شده است. در مقایسه مستقیم، این ابزار ۲.۴ برابر سرعت بیشتری نسبت به TurboQuant در حجم حافظه‌ی یکسان ارائه می‌دهد.

KVarN: بک‌اند کوانتیزه‌سازی KV-cache بومی vLLM؛ ۳-۵ برابر کانتکست، توان عملیاتی بالاتر از FP16، دقت مشابه، بدون کالیبراسیون.

مهندسان می‌توانند این قابلیت را تنها با فعال کردن یک پرچم ساده در تنظیمات اجرا کنند: kv_cache_dtype="kvarn_k4v2_g128".

این پیشرفت به معنای آن است که توسعه‌دهندگان دیگر مجبور نیستند برای اجرای عامل‌های هوش مصنوعی با تاریخچه طولانی، سرعت را فدا کنند. با حذف نوسانات در فضای لگاریتمی، کارهای عامل‌محور (Agentic) که به حافظه‌ی عمیق نیاز دارند، به‌شدت ارزان‌تر و سریع‌تر می‌شوند.

گام بعدی شما

  • فورک vLLM مربوط به KVarN را با پیش‌تنظیم kvarn_k4v2_g128 روی سخت‌افزار خود تست کنید.
  • برای بهینه‌سازی بیشتر حافظه، منتظر انتشار نسخه‌های جدید با اندازه‌ی متغیر صفحه (Page size) باشید.
  • تأثیر این تغییر بر مصرف توکن در مدل‌های بازمتن را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره‌ی تراشه‌های Blackwell برای درک مقیاس واقعی این سرعت‌ها مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد هزینه‌ی عملیاتی عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد. تکیه بر تخصص در مدیریت حافظه (KV-cache)، باعث می‌شود مدل‌ها بدون نیاز به سخت‌افزارهای گران‌قیمت، استدلال‌های طولانی‌تر و دقیق‌تری انجام دهند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.