اگر امروز برای ابزارهای AI کدنویسی بودجهبندی میکنید، احتمالاً با شوکی مشابه اوبر مواجه خواهید شد. بودجه سالانه این شرکت که باید برای ۱۲ ماه کافی میبود، تنها در چهار ماه اول سال ۲۰۲۶ به طور کامل تخلیه شد.
طبق گزارشهای داخلی، اوبر (Uber) پس از فراهم کردن دسترسی مهندسان به Claude Code در اواخر سال ۲۰۲۵، متوجه شد که هزینهها با سرعتی غیرقابلکنترل رشد میکنند. این شرکت با یک بحران مالی ناگهانی روبرو شد زیرا مصرف توکنها بسیار فراتر از پیشبینیهای اولیه بود. این اتفاق در ادامه گزارشاتی رخ داد که نشان میداد اوبر چگونه بودجه سالانه هوش مصنوعی خود را در مدت کوتاهی تمام کرد. برای جلوگیری از این وضعیت و متوقف کردن این ریزش مالی، شرکت مجبور شد سقف هزینهای سختگیرانه — ۱,۵۰۰ دلار ماهانه برای هر کارمند به ازای هر ابزار — وضع کند.
این شوک مالی نشاندهنده تغییری بنیادین در نحوه پرداخت شرکتها برای نرمافزار است. برای دههها، مدیران مالی (CFO) از یک فرمول ساده استفاده میکردند: هزینه با تعداد نفرات رشد میکند. اگر ۱۰ نفر استخدام میشدند، ۱۰ لایسنس با قیمت ثابت خریداری میشد. این مدل پیشبینیپذیر بود و برنامهریزی برای رشد شرکت یا خرید پلتفرمهای جدید را آسان میکرد. اما توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — این مدل را به کلی درهم شکست.
برخلاف مدلهای سنتی SaaS، هزینه توکنها با میزان استفاده رشد میکند، نه تعداد کاربر یا صندلی. این موضوع در مورد عاملهای هوش مصنوعی (AI Agents) بسیار متغیر و بیثبات است. یک عامل فقط تایپ نمیکند؛ بلکه برای درک یک کد یا رفع یک باگ، هزاران توکن از دادههای زمینه (Background Context) را با هر درخواست پردازش میکند. علاوه بر این، بسیاری از مدلها برای «فکر کردن» گامبهگام قبل از پاسخ دادن، هزاران توکن نامرئی و پنهان تولید میکنند که هزینه هر درخواست را چندین برابر میکند.
همانطور که در تحلیلهای پیشین ما درباره امنیت مدلهای بازمتن اشاره کردیم، مدیریت لایههای زیرساختی در مقیاس سازمانی همیشه با چالشهای پیشبینیناپذیر همراه است.
ابعاد بحران بودجه
در اوبر، محاسبات تکاندهنده است. اگر یک مهندس اجازه داشته باشد از دو ابزار عاملمحور مثل Claude و Cursor همزمان استفاده کند، سقف ماهانه او به ۳,۰۰۰ دلار میرسد. این یعنی سالانه ۳۶,۰۰۰ دلار هزینه برای هر نفر. برای نیروی کار ۴,۰۰۰ نفره اوبر، این رقم به پتانسیل ۱۴۴ میلیون دلار هزینه سالانه فقط برای مصرف AI تبدیل میشود.
متا (Meta) با ریسکی حتی بزرگتر روبروست. یک یادداشت داخلی در این شرکت هشدار داده است که هزینههای توکن در سال ۲۰۲۶ در مسیر رسیدن به میلیاردها دلار است. این انفجار زمانی رخ میدهد که فشار سازمانی برای سوق دادن مهندسان به استفاده از Claude با مقیاس عظیم یک سازمان جهانی برخورد میکند. در همین راستا، متا برای مقابله با این هزینهها، معیار ارزیابی مهندسان خود را از میزان مصرف توکن به کیفیت کد تغییر داد. وقتی عاملها در این مقیاس به یک کدبیس متصل میشوند، مصرف توکنها دیگر فقط رشد نمیکند، بلکه منفجر میشود.
دادههای شاخص AI شرکت Ramp که پرداختهای واقعی تامینکنندگان را در بیش از ۷۰,۰۰۰ کسبوکار رصد میکند، شکافی عمیق را در هزینهها نشان میدهد:
- ۱٪ برتر شرکتهای پذیرنده AI، اکنون ماهانه حدود ۷,۵۰۰ دلار برای هر کارمند هزینه میکنند.
- این هزینه با نرخ ۱۴.۱٪ در هر ماه در حال رشد است.
- مدیران استارتاپ Mercor (که در زمینه استخدام AI فعال است) گزارش دادهاند که در برخی شرکتها، هزینه توکنها به حقوق واقعی کارمندان نزدیک شده یا حتی از آن فراتر رفته است.
این یک دسته هزینه کاملاً جدید است که تا دو سال پیش در هیچ ترازنامهای (P&L) وجود نداشت. برای اکثر مدیران مالی، این یک خطای کوچک یا مبلغی نیست که توسط صندوقهای نوآوری جذب شود. بلکه میلیونها دلار هزینه جدید است که باعث ایجاد تضاد واقعی بین استخدام نیروی انسانی، سایر سرمایهگذاریهای فناوری یا بودجههای اختیاری میشود.
سه سطح ریسک مالی
تیمهای مالی اکنون با سه پروفایل ریسک متفاوت دستوپنجه نرم میکنند و احتمالاً در اکثر سازمانها، تنها سطح اول تحت کنترل است:
- ابزارهای کاربر تجاری: کاربرانی در بخشهای فروش، بازاریابی و عملیات عمدتاً از ابزارهایی استفاده میکنند که قیمتگذاری آنها بر اساس صندلی (Per Seat) است؛ معمولاً ۲۰ تا ۳۰ دلار ثابت برای هر کاربر در ماه. این مدل پیشبینیپذیر است و دقیقاً مانند هر ردیف هزینه SaaS در بیست سال گذشته رفتار میکند.
- ابزارهای کدنویسی عاملمحور: این دسته به تازگی از قیمت ثابت به قیمتگذاری متری (Metered Pricing) تغییر کردهاند. برای مثال، GitHub Copilot در ژوئن ۲۰۲۶ به صورت توکنمحور شد. این تغییر مدل پرداخت باعث شد هزینههای برخی توسعهدهندگان به دلیل مدل مصرفی به شدت افزایش یابد و در برخی موارد به ۷۵۰ دلار برسد. توسعهدهندگان پیشبینی میکنند که صورتحسابها از ۲۹ دلار به ۷۵۰ دلار در ماه، و در جلسات سنگین عاملمحور، از ۵۰ دلار به ۳,۰۰۰ دلار در ماه برسد. اوبر یک استثنا نیست، بلکه نگاهی زودهنگام به مسیر حرکت کل این دسته از ابزارهاست.
- عاملهای خودکار: خطرناکترین سطح است چون مفهومی به نام «صندلی» یا کاربر ندارد. این عاملها بدون نظارت اجرا میشوند، زیر-عاملهایی (Sub-agents) میسازند و در صورت شکست، دوباره تلاش میکنند. آنها در تمام مدت توکن مصرف میکنند، چه خروجی مفیدی تولید کنند و چه نکنند. این لایه کمترین دادههای هزینهای و کمترین سوابق بودجهبندی را دارد.
پر کردن شکاف دیدبانی
بسیاری از شرکتها لایهای بین کاربر یا عامل و ارائهدهنده مدل ندارند. سقفهای هزینهای مانند آنچه در اوبر اعمال شد، راهکارهای سخت و پسرویدادی (After-the-fact) هستند. به همین دلیل، دستهای جدید به نام «ارکستراسیون عامل» یا «درگاههای عامل» (Agent Gateways) در حال ظهور است تا به جای غافلگیریهای ماهانه، یک شمارنده لحظهای ارائه دهد.
این ابزارها به سه لایه متمایز تقسیم میشوند:
- درگاههای کنترل هزینه: اینها بین اپلیکیشنها و ارائهدهندگان مدل قرار میگیرند تا سقف هزینه تیمی، کش کردن پاسخها (Response Caching) و مسیریابی خودکار به مدلهای ارزانتر برای کارهای ساده را اضافه کنند.
- ارکستراسیون عامل: این لایه بر هماهنگی چندین عامل که با هم کار میکنند تمرکز دارد و قابلیت دیدن هزینهها را به جای اضافه کردن دستی، در ساختار خود جای داده است.
- لایههای مالی (FinOps): این لایهها با هزینههای AI همانگونه برخورد میکنند که تیمهای FinOps با هزینههای ابری برخورد میکنند؛ یعنی هزینهها بر اساس تیم و ویژگی تفکیک شده، بودجهبندی شده و ماهانه بررسی میشوند.
برخی شرکتها برای کاهش هزینهها به یک معماری ترکیبی روی میآورند تا وابستگی به مدلهای زبانی بزرگ (LLM) را کاهش دهند. با استفاده از مدلهای زبانی کوچک (SLM) که روی تکالیف محدود سازمانی آموزش دیدهاند — مانند سیاستهای داخلی، خدمات مشتریان، پردازش اسناد وام یا تجزیه و تحلیل manifests حمل و نقل — شرکتها میتوانند از «مالیات مدلهای پیشرو» در امان بمانند.
بر اساس یک مقایسه مدلهای LLM سازمانی در سال ۲۰۲۶، اقتصاد این کار بسیار جذاب است. برای یک میلیون گفتگو در ماه:
- هزینه مدلهای پیشرو (Frontier LLMs) میزبانی شده بین ۱۵,۰۰۰ تا ۷۵,۰۰۰ دلار در ماه است.
- یک SLM تنظیمشده (Fine-tuned) که در محیط داخلی مستقر شده، تنها ۱۵۰ تا ۸۰۰ دلار برای همان حجم از گفتگو هزینه دارد.
گولدمان ساکس (Goldman Sachs) این موضوع را در مقیاس بزرگ از طریق یک درگاه مدل متمرکز مدیریت میکند. این سیستم هر درخواست را بر اساس نوع تکلیف دستهبندی کرده و آن را به بهصرفهترین مدل برای آن کار میفرستد؛ طیفی از مدلهای متنباز سبک تا مدلهای پیشرو، همگی در محیط امنیتی خود شرکت.
این وضعیت شبیه روزهای اول پذیرش رایانش ابری است؛ جایی که هزینهها در موج اول منفجر شدند و سپس FinOps به عنوان یک دیسیپلین شکل گرفت. ابزارهای امروز توسط مهندسان برای افزایش بهرهوری ساخته شدهاند، اما لایهای که به سوال مدیر مالی پاسخ دهد — اینکه کدام تیم، برای چه کاربردی و از کدام بودجه هزینه میکند و چه مورد تجاری (Business Use Case) این هزینه را توجیه میکند — هنوز جای خالیاش حس میشود.
اگر بزرگترین شرکتهای فناوری جهان از این هزینهها غافلگیر شدند، هر سازمان دیگری در معرض ریسک است. مدیریت هزینه AI دیگر یک پروژه جانبی برای مهندسان نیست، بلکه به یک الزام اصلی مالی تبدیل شده است. اوبر و متا پیش از این نشان دادهاند که وقتی هزینهها را به جای پیشبینی، پس از وقوع مدیریت کنید، چه اتفاقی میافتد.
گام بعدی شما
- اگر از ابزارهای Agentic استفاده میکنید، فوراً سقف مصرف (Usage Limit) را در پنل API فعال کنید.
- برای کارهای تکراری و محدود، جایگزینی مدلهای پیشرو با مدلهای زبانی کوچک (SLM) را بررسی کنید.
- لایهای برای مانیتورینگ لحظهای توکنها بین توسعهدهندگان و API مدلها ایجاد کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو