پرش به محتوای اصلی
پرش به محتوای مقاله

محاسبهٔ حافظهٔ VRAM برای مدل‌های محلی؛ فراتر از وزن‌های مدل

·۲۹ مرداد ۱۴۰۵۳ دقیقه مطالعه
راهنما
نحوه تعیین اندازه مدل‌های زبانی محلی: حافظه VRAM، کش KV و معماری سخت‌افزار در ۲۰۲۶
نحوه تعیین اندازه مدل‌های زبانی محلی: حافظه VRAM، کش KV و معماری سخت‌افزار در ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

برجسته کردن نقش حیاتی KV Cache به عنوان عامل اصلی کرش‌های سیستم در مدل‌های محلی، فراتر از نگاه ساده به حجم وزن‌های مدل.

اگر قصد دارید مدل‌های هوش مصنوعی را روی سخت‌افزار شخصی اجرا کنید، احتمالاً با کرش‌های ناگهانی یا کندی شدید مواجه شده‌اید، حتی وقتی فکر می‌کردید حافظهٔ گرافیکی شما کافی است. واقعیت این است که برای یک مدل ۲۷ میلیارد پارامتری با کوانتش ۴ بیتی، ۱۵.۲ گیگابایت حافظه تنها نقطهٔ شروع است، نه نقطهٔ پایان.

به نقل از راهنمای فنی منتشر شده در ۲۰ آگوست ۲۰۲۶ در وب‌سایت dev.to، بسیاری از توسعه‌دهندگانی که به محیط‌های Local-first مهاجرت می‌کنند، هزینه‌های حافظهٔ پویا را نادیده می‌گیرند. این اشتباه منجر به فعال شدن مکانیزم CPU Offloading می‌شود که سرعت تولید توکن را به شدت کاهش می‌دهد.

میزبانی محلی هوش مصنوعی با ظهور مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» آن‌ها علناً منتشر شده و نه فقط غذای آماده — تغییر کرده است. مدل‌هایی مثل Qwen 3.8 (27B) و Llama 3.3 (70B) فاصله خود را با APIهای تجاری کم کرده‌اند. در واقع برای مدل‌هایی در این ابعاد، حافظه ۲۴ گیگابایتی به عنوان نقطهٔ ورود واقعی برای تجربهٔ بدون وقفه در نظر گرفته می‌شود. همان‌طور که در تحلیل قبلی ما درباره‌ی الگوی ReAct اشاره کردیم، توانایی مدل در استفاده از ابزارها به سخت‌افزار وابسته است. برای اجرای این مدل‌ها، حافظه به سه بخش تقسیم می‌شود: وزن‌های استاتیک، حافظهٔ KV Cache و بافر زمان اجرا.

ریاضیات حافظهٔ VRAM

وزن‌های مدل پایه هستند. برای یک کوانتش (Quantization) ۴ بیتی GGUF، هر ۱ میلیارد پارامتر تقریباً ۰.۵۵ گیگابایت فضا می‌گیرد. اما حافظهٔ KV Cache (KV Cache) — که وضعیت‌های توجه را برای توکن‌های قبلی ذخیره می‌کند — بلعندهٔ پنهان حافظه است. برای بهینه‌سازی این بخش، تکنیک‌هایی مانند PagedAttention در کتابخانه vLLM معرفی شده‌اند تا مدیریت حافظه مجازی را با روش‌های سنتی جایگزین کنند.

در یک مدل ۲7B، یک پنجرهٔ زمینه (Context Window) — شبیه میز کاری که جا برای چند ورق دارد و نه کل کتابخانه — با اندازه ۸ هزار توکن تنها ۱.۵ گیگابایت مصرف می‌کند. اما گسترش این پنجره به ۱۲۸ هزار توکن می‌تواند ۸ تا ۱۴ گیگابایت حافظهٔ VRAM اضافی اشغال کند. در نهایت، فریم‌ورک‌هایی مثل llama.cpp، vLLM یا Ollama برای گراف‌های محاسباتی به ۱ تا ۱.۵ گیگابایت بافر نیاز دارند.

جفت‌سازی سخت‌افزاری ۲۰۲۶

  • مدل‌های 7B/8B (۴ بیتی): نیاز به ۶.۵ تا ۸ گیگابایت VRAM. پیشنهاد: RTX 3060 12G یا MacBook Air M2 (16GB).
  • مدل‌های 14B (۴ بیتی): نیاز به ۱۰.۵ تا ۱۲.۵ گیگابایت VRAM. پیشنهاد: RTX 4070 (12G) یا Apple M3 Pro (18GB).
  • مدل‌های 27B/32B (۴ بیتی): نیاز به ۱۷.۵ تا ۲۰ گیگابایت VRAM. پیشنهاد: RTX 3090/4090 (24GB) یا Mac Studio M2 Max (32GB+).
  • مدل‌های 70B (۴ بیتی): نیاز به ۴۲ تا ۴۸ گیگابایت VRAM. پیشنهاد: دو کارت RTX 3090/4090 یا Mac Studio (64GB/128GB).

برای کاربر عادی، این یعنی کارت‌های ۱۲ گیگابایتی دیگر برای مدل‌های میان‌رده با پنجره‌های متنی بلند «گزینهٔ امن» نیستند. شما در واقع طول زمینه را با پایداری معاوضه می‌کنید. این وضعیت باعث چرخش به سمت معماری‌های حافظهٔ یکپارچه (Unified Memory) در تراشه‌های اپل شده است که اجازه می‌دهد GPU به حجم بیشتری از رم سیستم دسترسی داشته باشد؛ به گونه‌ای که حتی یک مک‌مینی ۱۶ گیگابایتی با ترکیب اولاما و Qwen می‌تواند جایگزین ابزارهای تجاری شود.

برای ساده‌سازی این محاسبات، OmniTool Hub ابزار Local LLM VRAM Sizer را منتشر کرده است تا کاربران بتوانند با تغییر کوانتش و پنجرهٔ زمینه، سخت‌افزار مناسب را پیدا کنند.

گام بعدی شما

  • اگر از مدل‌های محلی استفاده می‌کنید، حجم KV Cache را بر اساس طول متون ورودی خود محاسبه کنید.
  • برای مدل‌های بالای ۳۰ میلیارد پارامتر، به جای کارت‌های تک ۱۲ گیگابایتی، به سراغ سخت‌افزارهای با حافظهٔ یکپارچه یا دو کارت گرافیک بروید.
  • ابزار VRAM Sizer را برای تخمین دقیق نیازهای سخت‌افزاری قبل از خرید یا دانلود مدل‌ها امتحان کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحلیل با تکیه بر داده‌های سخت‌افزاری نشان می‌دهد که اشتباه در محاسبهٔ VRAM منجر به افت شدید سرعت استنتاج می‌شود. درک تفاوت بین وزن‌های مدل و حافظهٔ پویا برای هر توسعه‌دهنده‌ای که قصد میزبانی شخصی دارد، حیاتی است.

تأثیر برای ایران

به‌دلیل قیمت بالای کارت‌های گرافیک سری ۴۰۹۰ و محدودیت‌های واردات، توسعه‌دهندگان ایرانی برای اجرای مدل‌های ۷۰ میلیاردی باید بیشتر به سراغ مک استودیو یا خوشه‌های GPU ارزان‌تر بروند.

·نگاه ما
تحریریه دات‌هوش

وابستگی شدید مدل‌های محلی به حافظهٔ KV Cache نشان می‌دهد که گلوگاه اصلی در سال ۲۰۲۶ دیگر قدرت پردازشی (TFLOPS) نیست، بلکه پهنای باند و حجم حافظه است. این موضوع باعث می‌شود مدل‌های کوچک‌تر اما بهینه‌شده (SLM) برای کاربر خانگی جذاب‌تر از مدل‌های غول‌پیکر باشند، زیرا پایداری سیستم در پنجره‌های متنی بلند اولویت بیشتری نسبت به پارامترهای بیشتر دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.