اگر قصد دارید یک مدل زبانی را از محیط آزمایشگاه به تولید صنعتی ببرید، احتمالاً با یک کابوس مالی روبرو هستید. طبق اعلام Cedana در ۶ اکتبر ۲۰۲۶، برای سرویسدهی به یک تریلیون توکن در ماه با مدل Llama 3.3 70B، شما به ۳۶۷ واحد GPU (واحد پردازش گرافیکی) مدل H100 نیاز دارید.
این عدد بر اساس نرخ بهرهوری ۵۰٪ و ترکیب خاصی از توکنهای ورودی و خروجی محاسبه شده است. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، فاصله میان یک نمونهی اولیه (Prototype) و یک سیستم عملیاتی، در واقع همان فاصله میان «امکانپذیری» و «سودآوری» است. در همین راستا، بررسی چهار تلهی عملیاتی که هزینههای مدلهای زبانی را به شدت افزایش داد نشان میدهد که خطاهای کوچک در تخمینها چگونه منجر به جهش صورتحسابها میشود.
بسیاری از سازمانها در تخمین نیازهای محاسباتی خود دچار خطا میشوند و در توازن میان تأخیر (Latency) و هزینههای سرمایهای کلان برای خوشههای GPU شکست میخورند. ابزار جدید Cedana تلاش میکند این فرآیند را استاندارد کند و ریاضیاتِ تبدیل حجم ماهانه به ظرفیت ثانیهای را شفاف سازد. این چالشها در محیطهای رقابتی شدیدتر است، چرا که رقابت آزاد در دسترسی به GPU میتواند تأخیر استنتاج را تا ۱۲ برابر افزایش دهد.
منطق محاسباتی
بر اساس مستندات این ابزار، عدد ۳۶۷ پردازنده از طریق زنجیرهای از عملیات به دست آمده است:
- حجم: یک تریلیون توکن در ۳۰ روز، تقریباً برابر با ۳۸۵,۸۰۲ توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — در ثانیه است. برای درک بهتر این فرآیند، میتوان به مکانیزمهای جدید کشینگ برای رفع گلوگاههای پردازشی اشاره کرد که سرعت پردازش توکنها را بهینه میکنند.
- ترکیب: با تعدیل ترکیب توکنها، مقدار ۱۸۳,۲۵۶ توکنِ معادلِ خروجی در ثانیه به دست میآید.
- ظرفیت: در بهرهوری ۵۰٪، سیستم به ظرفیت نصبشدهای معادل ۳۶۶,۵۱۲ توکن در ثانیه نیاز دارد.
- سختافزار: تقسیم این عدد بر سرعت پایه H100 (یعنی ۱,۰۰۰ توکن در ثانیه)، تعداد نهایی GPUها را مشخص میکند.
حساسیتها و محدودیتها
سرعت سختافزار متغیرترین متغیر این معادله است. به گزارش Cedana، اگر سرعت H100 به ۴۵۰ توکن در ثانیه کاهش یابد، نیاز سختافزاری به ۸۱۴ پردازنده جهش میکند. در مقابل، افزایش بهرهوری به ۸۰٪، تعداد پردازندههای مورد نیاز را به ۲۲۹ عدد میرساند.
همچنین این ابزار اشاره میکند که در مدلهای ترکیب خبرهها (Mixture of Experts)، پردازنده B200 به دلیل پشتیبانی از FP4 میتواند ۴ تا ۲۱ برابر سریعتر از H100 عمل کند.
این یعنی صورتحساب ابری شما بیش از آنکه به اندازه مدل وابسته باشد، به انتخابهای عملیاتی شما مثل نرخ بهرهوری و اهداف تأخیر حساس است. یک افت کوچک در کارایی میتواند هزینههای سختافزاری شما را تقریباً دو برابر کند.
گام بعدی شما
- پیش از خرید سختافزار، مدل خاص خود را روی استک (Stack) شخصیتان اندازهگیری کنید.
- نرخ بهرهوری (Utilization) را به جای اعداد پیشفرض، بر اساس ترافیک واقعی تخمین بزنید.
- اگر از مدلهای MoE استفاده میکنید، تفاوت هزینه بین H100 و B200 را محاسبه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو