یک عدد تک در جدول قیمتگذاری، بیشتر شبیه به یک شایعه است تا یک بودجهی واقعی. اکثر توسعهدهندگان به لیستهای رتبهبندی شدهی «ارزانترین APIهای LLM» تکیه میکنند، اما این جداول اغلب ظرف دو هفته منقضی میشوند؛ چراکه ارائهدهندگان قیمتها را بهطور خاموش و بدون ثبت در تغییرات (changelog) یا اعلام رسمی بهروز میکنند.
با تکیه بر پوشش قبلی ما دربارهی اینکه توسعهدهندگان چگونه احتمالات خاص را از مدلهای زبانی استخراج میکنند، اکنون تمرکز بر هزینه واقعی اجرای این استنتاجها در مقیاس صنعتی است. برای یک توسعهدهنده عملگرا، کارت قیمت یک مقدار استاتیک و ثابت نیست، بلکه متغیری است که کاملاً به شکل ترافیک کاری (workload) بستگی دارد.
به نقل از راهنمایی که در ۲۳ سپتامبر ۲۰۲۶ در dev.to منتشر شد، یک رکورد قیمتی صادقانه نیازمند چهار فیلد است: نام مدل، قیمت، لینک مستقیم منبع و تاریخ مشاهده. بدون یک لینک مستقیم به صفحه قیمتهای خودِ سازنده — و نه یک پست وبلاگی دربارهی آن صفحه — هر عددی صرفاً یک ادعاست.
متغیرهای پنهان در هزینه
کارتهای قیمت معمولاً سه هزینه مجزا را پنهان میکنند که صورتحساب نهایی را بهشدت تغییر میدهند:
- ورودی در برابر خروجی: توکنهای خروجی تقریباً همیشه گرانتر از توکنهای ورودی هستند و اغلب چندین برابر قیمت دارند. مدلی که برای خلاصهسازی یا استخراج داده (ورودی طولانی، خروجی کوتاه) ارزان است، ممکن است برای تولیدات عاملمحور (Agentic) — که شامل پرامپتهای کوتاه، پاسخهای طولانی و چندین دور گفتگو است — گرانترین گزینه باشد. در همین راستا، برخی مدلهای بهینه مانند DeepSeek V4 Flash توانستهاند هزینههای استنتاج را بهطور چشمگیری کاهش دهند.
- ورودیهای کششده: بسیاری از ارائهدهندگان نرخهای تخفیفخوردهای برای توکنهای کششده (Cached Tokens) ارائه میدهند که میتواند هزینهها را برای پرامپتهای تکراری بهطور قابلتوجهی کاهش دهد. جدولی که برای هر مدل فقط یک ستون قیمت دارد، بهطور خاموش یکی از این سه قیمت را انتخاب کرده و امیدوار است ترافیک شما با آن همخوانی داشته باشد.
- تفاوت در توکنسازی: توکنسازی (Tokenization) — شبیه به بریدن یک کیک طولانی به تکههای کوچک برای بلعیدن راحتتر توسط مدل — یک استاندارد جهانی نیست. هر سازنده متن را متفاوت میبرد. در حالی که این تفاوت برای متون انگلیسی کم است، اما در کدها، فایلهای JSON، زبانهای غیرلاتین یا متونی با علائم نگارشی زیاد، تفاوت قیمت بهشدت بالا میرود.
تلهی دادههای چندوجهی
ورودیهای چندوجهی (Multimodal) — یعنی مدلهایی که مثل ما با چند حس دنیا را میخوانند و متن، عکس و صدا را میفهمند — جایی است که مقایسهها کاملاً شکست میخورند. ارائهدهندگان این داراییها را بر اساس نرخهای خاص خود که به رزولوشن، کاشیبندی (tiling) و گاهی یک پرچم «جزئیات» (detail flag) در درخواست بستگی دارد، به توکن تبدیل میکنند.
ممکن است دو شرکت قیمت یکسانی برای هر میلیون توکن اعلام کنند، اما برای یک عکس مشابه، مبالغ کاملاً متفاوتی را صورتحساب کنند. به همین دلیل، تنها مقایسه صادقانه، مقایسه تجربی است.
برای به دست آوردن یک عدد صادقانه، نویسنده پیشنهاد میکند یک آزمایش تجربی ۱۵ دقیقهای انجام دهید: ۱۰ ورودی واقعی را به هر مدل کاندید بفرستید و فیلد Usage (استفاده) را در پاسخ بخوانید. این روش از هر جدول منتشر شدهای دقیقتر است.
محاسبه ترافیک واقعی
بهجای بنچمارکها، توسعهدهندگان باید از لاگهای خود برای محاسبه هزینه استفاده کنند. با استخراج درخواستهای یک روز کاری و محاسبه میانه (median) توکنهای ورودی و خروجی، میتوانید هزینه واقعی هر فراخوانی را تعیین کنید.
این کار با یک تابع ساده پایتون که نسبت کششده و قیمت خاص توکنهای کش را لحاظ میکند، ممکن است: billed_in = tok_in * ((1 - cached_ratio) * p_in + cached_ratio * p_cached).
این ریاضیات سادهای است که بحثهایی را فیصله میدهد که جداول مقایسهای از پس آن برنمیآیند. رتبهبندی تولید شده توسط ترافیک خودتان تنها رتبهبندی است که اهمیت دارد؛ هر رتبهبندی دیگری صرفاً ترافیک کاری نویسنده آن جدول است که نام شما روی آن گذاشته شده است. برای کاهش بیشتر این هزینهها، برخی توسعهدهندگان از استراتژیهای جایگزینی فراخوانیهای مستقیم با درگاههای API استفاده میکنند تا کنترل بیشتری بر بودجه خود داشته باشند.
نکات ریز در حاشیه
ادعاهایی مثل «زیر یک دلار» یا تیترهای مربوط به پنجرههای متنی میلیونی، معمولاً فقط در شرایط خاصی صادقاند. این شرایط اغلب شامل موارد زیر است:
- سطوح قیمتی (Tiers) خاص
- استفاده از نقاط انتهایی دستهای (Batch Endpoint)
- فرض بر وجود ورودیهای کششده
- بازه زمانی تخفیفی محدود
در واقع، قیمت واقعی در همین «نکات ریز» نهفته است و معمولاً اولین چیزی است که در جداول ویروسی شبکههای اجتماعی حذف میشود. رایجترین الگو، ارائه عدد غلط نیست، بلکه ارائه عدد درست با شرایطی است که تقریباً هیچکس واجد آن نیست.
توقف اعتماد به لیستهای رتبهبندی و شروع اندازهگیری حجم دادههای (payload) واقعی خود را آغاز کنید. تنها راه برای اینکه خودتان را فریب ندهید این است که با هر قیمت منتشر شده به عنوان نقطه شروع برای یک آزمایش برخورد کنید، نه به عنوان یک یافته نهایی.
گام بعدی شما
- توقف اعتماد به لیستهای رتبهبندی و شروع اندازهگیری حجم دادههای (payload) واقعی خود.
- اجرای تست ۱۵ دقیقهای با ۱۰ نمونه ورودی واقعی برای استخراج هزینه واقعی از API.
- پیادهسازی تابع محاسبه هزینه بر اساس لاگهای روزانه برای تخمین بودجه ماهانه.
اما داستان سختافزاری این هزینهها حتی پیچیدهتر است — به تحلیل ما دربارهی بهینهسازیهای حافظه در تراشههای جدید مراجعه کنید.




گفتگو