پرش به محتوای اصلی
پرش به محتوای مقاله

«به اشتراک‌گذاری حافظه در سطح سخت‌افزار»؛ راهکار جدید برای بهینه‌سازی KV Cache

·۲۳ تیر ۱۴۰۵۳ دقیقه مطالعه
درگاه پل ارتباطی بدون کپی برای استنتاج چند عاملی روی GPU: دوخت پویا کش KV در سطح حافظه با PagedAttention، کاهش ۲۵ برابری تأخی
درگاه پل ارتباطی بدون کپی برای استنتاج چند عاملی روی GPU: دوخت پویا کش KV در سطح حافظه با PagedAttention، کاهش ۲۵ برابری تأخی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف کامل مرحله پیش‌پُرکردن (Prefill) برای عامل‌های ثانویه از طریق Zero-Copy Memory Stitching؛ برخلاف متدهای قبلی، اینجا حافظه در سطح فیزیکی GPU به اشتراک گذاشته می‌شود، نه در سطح نرم‌افزاری.

اگر امروز یک سیستم چندعاملی را مدیریت می‌کنید، می‌دانید که هر عامل باید سندهای طولانی را دوباره و دوباره بخواند تا بتواند پاسخ دهد. اما تصور کنید تمام این انتظار برای اولین توکن، ناگهان ۲۵ برابر سریع‌تر شود.

به نقل از مستندات فنی پروژه، gateway جدیدی به نام MemStitch در ۱۴ ژوئیه ۲۰۲۶ منتشر شد که با حذف مراحل هزینه‌بر پیش‌پُرکردن (Prefill) — یعنی همان مرحله‌ای که مدل شبیه به خواندن سریع یک کتاب پیش از پاسخ دادن، متن را پردازش می‌کند — اجازه می‌دهد چندین عامل (Agent) بدون تکرار فعال‌سازهای GPU، یک بستر متنی مشترک داشته باشند. همان‌طور که در تحلیل قبلی ما درباره‌ی یکپارچگی مدل‌های وزن‌باز اشاره کردیم، تمرکز صنعت اکنون از اتصال APIها به لایه‌ی فیزیکی حافظه GPU منتقل شده است. این وضعیت شبیه به تیم حقوقی است که در آن هر وکیل مجبور است یک قرارداد ۲۰۰ صفحه‌ای را از صفحه اول دوباره بخواند؛ MemStitch به وکیل دوم اجازه می‌دهد پیشرفتِ مطالعه‌ی وکیل اول را به‌سادگی «به ارث» ببرد.

در یک جریان کاری معمولی، عامل الف (مثلاً حسابرس حقوقی) برای تحلیل انطباق، یک قرارداد ۲۰۰ صفحه‌ای را می‌خواند و حافظه KV (KV Cache) را در GPU پر می‌کند. طبق گزارش‌های فنی، وقتی عامل ب (مثلاً حسابرس مالی) می‌خواهد همان سند را بررسی کند، موتورهای استاندارد او را مجبور به تکرار مرحله پیش‌پُرکردن می‌کنند. این اتفاق منجر به افزایش شدید زمان تا نخستین توکن (Time-to-First-Token یا TTFT) و اتلاف منابع می‌شود.

بر اساس مستندات منتشرشده در GitHub، این سیستم از سه سازوکار اصلی برای دستیابی به این سرعت استفاده می‌کند:

  • هشینگ توپولوژیک زمینه (Context Topological Hashing): پرامپت‌ها به بلوک‌های فیزیکی تقسیم شده و با استفاده از زنجیره‌های Merkle به اثر انگشت‌های رمزنگاری‌شده تبدیل می‌شوند.
  • دوخت بلوکی بدون کپی (Zero-Copy Block Stitching): برای پیشوندهای شناسایی‌شده، مرحله پیش‌پُرکردن حذف شده و جدول توجه منطقی عامل ب مستقیماً به آدرس حافظه فیزیکی بلوک‌های عامل الف متصل می‌شود.
  • درگاه امنیتی بدون اعتماد (Zero-Trust Secure Gate): لیست‌های کنترل دسترسی اعمال می‌شوند تا جلسات غیرمجاز نتوانند به بلوک‌های حافظه مشترک دسترسی داشته باشند.

درگاه پل ارتباطی بدون کپی حافظه برای استنتاج چند عاملی GPU. با دوخت پویا حافظه KV، فاز پرهزینه پیش‌پرش را دور می‌زند. تأخیر T

داده‌های محک (Benchmark) شکاف بهره‌وری عظیمی را نشان می‌دهند. در آزمونی با یک سند مشترک ۲۰۰ صفحه‌ای، یک سیستم vLLM استاندارد برای پاسخ‌دهی عامل دوم به ۱۲۰۰ میلی‌ثانیه زمان نیاز داشت. در مقابل، MemStitch این زمان (TTFT) را تنها به ۴۸ میلی‌ثانیه رساند.

درگاه پل ارتباطی بدون کپی برای استنتاج چند عاملی روی GPU: دوخت پویا کش KV در سطح حافظه با PagedAttention، کاهش ۲۵ برابری تأخی

بهره‌وری حافظه نیز بهبود یافت؛ در حالی که تنظیمات پایه vLLM تعداد ۵۳ بلوک حافظه فیزیکی اختصاص داد، MemStitch تنها از ۳۰ بلوک استفاده کرد که نشان‌دهنده ۴۳.۴٪ صرفه‌جویی در کل حافظه ویدیویی (VRAM) است.

این تغییر، گلوگاه اصلی مقیاس‌پذیری سیستم‌های عامل‌محور (Agentic) را از بین می‌برد. با تبدیل حافظه KV از یک اثر گذرا به یک دارایی مشترک، هزینه و زمان اجرای خط لوله‌های حسابرسی پیچیده به‌شدت کاهش می‌یابد. این دستاورد فرضیه قدیمی را می‌شکند که عامل‌های با زمینه طولانی لزوماً باید یا تأخیر بالا داشته باشند یا به خلاصه‌های ناقص تولید بازیابی‌افزا (RAG) — که شبیه به خواندن یادداشت‌های پراکنده به‌جای متن اصلی است — تکیه کنند.

نصب این ابزار با دستور pip install -r requirements.txt انجام می‌شود. پس از اجرا، مسیرهای درگاه روی http://localhost:8000 فعال شده و یک API Proxy در /v1/chat/completions ارائه می‌دهد. پورتال بصری سیستم اجازه می‌دهد وضعیت بلوک‌های حافظه، از جمله تخصیص‌های خصوصی، صفحات دوخته‌شده (Stitched) و هشدارهای امنیتی رصد شوند.

برنامه‌نویسان می‌توانند از طریق SDK پایتون و دکوراتورهای @stitch_agent آن را ادغام کنند. برای مثال، می‌توان یک mesh با بک‌اند vllm و مدل Llama-3.1-8B-Instruct تعریف کرد و با دستور mesh.sg.add_policy اجازه اشتراک حافظه بین دو عامل را داد. همچنین، این ابزار از REST APIهای سازگار با OpenAI برای کلاینت‌هایی مثل Dify یا Flowise پشتیبانی می‌کند.

مدیریت پویای قوانین امنیتی نیز از طریق درخواست‌های GET و POST به اندپوینت /policies امکان‌پذیر است تا کنترل شود کدام عامل حق خواندن کدام حافظه را دارد.

گام بعدی شما

  • اگر از vLLM برای سیستم‌های چندعاملی استفاده می‌کنید، MemStitch را برای کاهش هزینه VRAM تست کنید.
  • استراتژی‌های مدیریت حافظه را در SDK پایتون بررسی کنید تا دسترسی‌های بین‌عاملی را بهینه کنید.
  • تأثیر حذف پیش‌پُرکردن را روی زمان پاسخ‌دهی (TTFT) در سناریوهای اسناد طولانی بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با کاهش چشمگیر تأخیر در سیستم‌های چندعاملی، بهره‌وری عملیاتی را در پردازش اسناد حجیم متحول می‌کند. اعتبار این یافته‌ها از بنچمارک‌های سخت‌افزاری تأیید شده و هزینه استنتاج را به‌طور مستقیم کاهش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU و هزینه بالای VRAM در سرورهای اجاره‌ای روبرو هستند، این ابزار به دلیل کاهش ۴۳ درصدی مصرف حافظه، راهکاری برای اجرای مدل‌های سنگین‌تر است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی RAGهای تکه‌ای با اشتراک‌گذاری مستقیم حافظه در سطح GPU، پارادایم «بازیابی» را به «به‌ارث‌بری» تغییر می‌دهد. این یعنی دیگر نیازی نیست مدل‌ها هر بار بخشی از متن را بازسازی کنند، بلکه می‌توانند استدلال‌های قبلی را در لایه‌ی سخت‌افزاری حفظ کنند. این رویکرد، مسیر را برای عامل‌های هوش مصنوعی که واقعاً «حافظه بلندمدت» دارند، هموارتر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.