اگر امروز برای استقرار مدلهای زبانی هزینه میکنید، احتمالاً بخش بزرگی از بودجه شما صرف منابعی میشود که در زمانهای خلوت بیکارند و در زمان پیک، پاسخگو نیستند. مشکل اینجاست که معیارهای سنتی مقیاسدهی، در دنیای مدلهای زبانی دیگر کار نمیکنند.
طبق گزارش منتشر شده در ۲۲ سپتامبر ۲۰۲۶ در وبسایت dev.to، مقیاسدهی خودکار (Autoscaling) — که شبیه به اضافه کردن پیشخدمت به رستوران بر اساس تعداد مشتریان در صف است، نه بر اساس میزان خستگی آشپز — در مدلهای زبانی باید از معیارهای CPU فاصله بگیرد. در واقع، استفاده از Horizontal Pod Autoscalers سنتی باعث جهشهای فاجعهبار در تأخیر میشود، زیرا این ابزارها گلوگاههای پهنایباند حافظه در مرحله رمزگشایی را نادیده میگیرند.
همانطور که در تحلیل قبلی ما دربارهی ماهیت «بیگانه» هوش مصنوعی اشاره کردیم، مدلهای زبانی برخلاف برنامههای وب معمولی، حالتمند (Stateful) هستند. استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — به دو مرحله تقسیم میشود: پیشپُرکردن (Prefill) که محاسبات سنگینی دارد و رمزگشایی (Decoding) که محدود به حافظه است. به همین دلیل، درصد استفاده از GPU معیار گمراهکنندهای برای مقیاسدهی است.
برای حفظ کیفیت خدمات، توسعهدهندگان باید معیارهای سفارشی زیر را از طریق Prometheus و KEDA پیادهسازی کنند:
- عمق صف (Queue Depth): تعداد درخواستهای منتظر؛ پاکترین سیگنال برای افزایش تعداد نسخههای مدل.
- زمان تا نخستین توکن (TTFT): معیار اصلی برای سنجش احساس کاربر از کندی سیستم.
- زمان هر توکن خروجی (TPOT): معیاری برای کیفیت استریم در مرحله رمزگشایی.
- بهرهوری KV-cache: حیاتی برای جلوگیری از کرشهای ناشی از کمبود حافظه در درخواستهای با متن طولانی.
به نقل از مستندات فنی مذکور، «راهاندازی سرد» (Cold Start) همچنان یک نقطه شکست است؛ چراکه بارگذاری یک مدل ۷۰ میلیارد پارامتری از حافظه شبکه ممکن است چندین دقیقه زمان ببرد. راهکار پیشنهادی، استفاده از حافظه کش محلی NVMe یا نگه داشتن حداقل یک نسخه فعال برای پاسخگویی فوری است.
برای کسانی که از میزبانی شخصی (Self-hosting) دوری میکنند، پلتفرم Oxlo.ai جایگزینی مدیریتشده ارائه میدهد که راهاندازی سرد را حذف کرده است. این رویکرد در مقابل چالشهای مالیاتی و سختافزاری قرار دارد که در تحلیل ما پیرامون نقطهی سربهسر هزینهی میزبانی شخصی Llama به تفصیل بررسی شده است. نکته مهمتر، جایگزینی صورتحساب توکنمحور با قیمتگذاری ثابت بر اساس درخواست است. این تغییر باعث میشود هزینه زیرساخت از طول پرامپت جدا شود؛ موضوعی که برای حلقههای عاملمحور (Agentic) که ممکن است پرامپتهایی با ۱۰۰ هزار توکن داشته باشند، حیاتی است.
این چرخش از اقتصاد توکنشماری به اقتصاد درخواستمحور، ریاضیات برنامهریزی ظرفیت را تغییر میدهد و اجازه میدهد مقیاسدهی بر اساس تقاضای واقعی کاربر باشد، نه طول پیشبینیناپذیر پرامپتهای تولید بازیابیافزا (RAG) — که شبیه دانشآموزی است که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد.
با تغییر ماشه مقیاسدهی از «استفاده GPU > ۸۰٪» به «عمق صف > حد آستانه»، تیمها میتوانند بدون ریسک فروپاشی سیستم در زمان پیک، از تخصیص بیش از حد خوشههای گرانقیمت H100 در ساعات خلوت جلوگیری کنند.
گام بعدی شما
- بررسی خروجیهای Prometheus برای اطمینان از رصد دقیق KV-cache و عمق صف.
- جایگزینی معیارهای CPU/GPU با معیارهای مبتنی بر درخواست در تنظیمات KEDA.
- ارزیابی مدلهای قیمتگذاری درخواستمحور برای کاهش هزینههای عملیاتی در پروژههای عاملمحور.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو