اگر امروز برای اجرای یک مدل زبانی بودجهبندی میکنید، تنها عددی که باید به آن خیره شوید مقدار VRAM است، نه رم کل سرور. طبق تحلیل فنی منتشر شده در ۲۷ اوت ۲۰۲۶ در وبسایت dev.to، یک مدل ۸ میلیارد پارامتری با دقت کامل، برای صرفاً بارگذاری شدن به حدود ۱۶ گیگابایت حافظه نیاز دارد.
بسیاری از توسعهدهندگان به اشتباه واحد پردازش گرافیکی (GPU) را یک پردازنده واحد میبینند. در واقعیت، یک کارت گرافیک از دو بخش مجزا تشکیل شده است: هستهها که مانند «دستهایی» برای انجام محاسبات ریاضی عمل میکنند و حافظهٔ ویدیویی (VRAM) — شبیه قفسههایی که تمام دادهها را نگه میدارند — که محل استقرار مدل است.
همانطور که در تحلیل قبلی ما دربارهی زیرساختهای عاملهای هوش مصنوعی اشاره کردیم، درک این تفکیک برای بهینهسازی هزینه حیاتی است. برای تولید هر تککلمه از پاسخ، GPU باید تمام مجموعه وزنهای مدل را از VRAM به هستهها منتقل کند، محاسبه را انجام دهد و این چرخه را برای کلمه بعدی تکرار کند. این مکانیزم استریم مداوم، دقیقاً همان دلیلی است که پاسخهای مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — بهصورت تایپشده و در لحظه ظاهر میشوند، نه بهصورت یکباره.
تلهٔ زیرساختی AWS
به گزارش بررسیهای فنی، هنگام رزرو نمونهها در AWS EC2، کنسول قیمتگذاری اغلب رم سیستم را بهگونهای نمایش میدهد که توسعهدهندگان را گمراه میکند. برای مثال، یک نمونه g6.4xlarge دارای ۶۴ گیگابایت حافظه است، اما این رم معمولی سیستم است و در فرآیند استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — تقریباً هیچ نقشی ندارد.
عامل محدودکننده واقعی، VRAM کارت گرافیک است:
- g4dn (T4): ۱۶ گیگابایت VRAM
- g5 (A10G): ۲۴ گیگابایت VRAM
- g6 (L4): ۲۴ گیگابایت VRAM
- g6e (L40S): ۴۸ گیگابایت VRAM
این بدان معناست که اگر مدل شما حجمی بیشتر از VRAM کارت داشته باشد، فارغ از اینکه سرور شما ۱ ترابایت رم سیستم داشته باشد، مدل اصلاً بارگذاری نخواهد شد. صفحه قیمتگذاری AWS ستونی برای GPU ندارد و کاربر را مجبور میکند برای یافتن ظرفیت واقعی حافظه، صفحات مستندات هر نمونه را بهصورت جداگانه بررسی کند.
برای یک متخصص، این موضوع تمرکز را از مشخصات کلی سرور به سقف VRAM منتقل میکند. اگر بودجه پروژهای را میبندید، VRAM تنها متغیری است که تعیین میکند آیا مدل شما روی یک نمونه خاص قابل اجراست یا خیر.
گام بعدی شما
- لیست نمونههای فعلی خود را بررسی کنید تا متوجه شوید آیا برای رم سیستم هزینه اضافی میپردازید در حالی که توسط VRAM محدود شدهاید.
- در هنگام انتخاب مدل، ابتدا حجم وزنها را با دقت (Precision) مورد نظر محاسبه کنید و سپس کارت گرافیک متناسب با آن را انتخاب کنید.
- برای کاهش نیاز به VRAM، تکنیکهای کوانتش (Quantization) را بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ برای درک تفاوتهای معماری حافظه در نسل جدید، به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو