پرش به محتوای اصلی
پرش به محتوای مقاله

بودجه سالانه کدنویسی اوبر در چهار ماه به دلیل هزینه‌های توکن AI تمام شد

·۳ مهر ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
نمودار افزایش هزینه توکن‌ها و فشار بودجه‌ای بر CFOها در سال ۲۰۲۶
نمودار افزایش هزینه توکن‌ها و فشار بودجه‌ای بر CFOها در سال ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای داده‌های واقعی از اوبر و متا درباره تبدیل شدن هزینه توکن‌ها به رقیبی برای حقوق کارکنان — این اولین بار است که می‌بینیم هزینه استنتاج در مقیاس سازمانی، بودجه‌های سالانه را در چند ماه می‌بلعد.

اگر امروز برای ابزارهای AI کدنویسی بودجه‌بندی می‌کنید، احتمالاً با شوکی مشابه اوبر مواجه خواهید شد. بودجه سالانه این شرکت که باید برای ۱۲ ماه کافی می‌بود، تنها در چهار ماه اول سال ۲۰۲۶ به طور کامل تخلیه شد.

طبق گزارش‌های داخلی، اوبر (Uber) پس از فراهم کردن دسترسی مهندسان به Claude Code در اواخر سال ۲۰۲۵، متوجه شد که هزینه‌ها با سرعتی غیرقابل‌کنترل رشد می‌کنند. این شرکت با یک بحران مالی ناگهانی روبرو شد زیرا مصرف توکن‌ها بسیار فراتر از پیش‌بینی‌های اولیه بود. این اتفاق در ادامه گزارشاتی رخ داد که نشان می‌داد اوبر چگونه بودجه سالانه هوش مصنوعی خود را در مدت کوتاهی تمام کرد. برای جلوگیری از این وضعیت و متوقف کردن این ریزش مالی، شرکت مجبور شد سقف هزینه‌ای سخت‌گیرانه — ۱,۵۰۰ دلار ماهانه برای هر کارمند به ازای هر ابزار — وضع کند.

این شوک مالی نشان‌دهنده تغییری بنیادین در نحوه پرداخت شرکت‌ها برای نرم‌افزار است. برای دهه‌ها، مدیران مالی (CFO) از یک فرمول ساده استفاده می‌کردند: هزینه با تعداد نفرات رشد می‌کند. اگر ۱۰ نفر استخدام می‌شدند، ۱۰ لایسنس با قیمت ثابت خریداری می‌شد. این مدل پیش‌بینی‌پذیر بود و برنامه‌ریزی برای رشد شرکت یا خرید پلتفرم‌های جدید را آسان می‌کرد. اما توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — این مدل را به کلی درهم شکست.

برخلاف مدل‌های سنتی SaaS، هزینه توکن‌ها با میزان استفاده رشد می‌کند، نه تعداد کاربر یا صندلی. این موضوع در مورد عامل‌های هوش مصنوعی (AI Agents) بسیار متغیر و بی‌ثبات است. یک عامل فقط تایپ نمی‌کند؛ بلکه برای درک یک کد یا رفع یک باگ، هزاران توکن از داده‌های زمینه (Background Context) را با هر درخواست پردازش می‌کند. علاوه بر این، بسیاری از مدل‌ها برای «فکر کردن» گام‌به‌گام قبل از پاسخ دادن، هزاران توکن نامرئی و پنهان تولید می‌کنند که هزینه هر درخواست را چندین برابر می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، مدیریت لایه‌های زیرساختی در مقیاس سازمانی همیشه با چالش‌های پیش‌بینی‌ناپذیر همراه است.

ابعاد بحران بودجه

در اوبر، محاسبات تکان‌دهنده است. اگر یک مهندس اجازه داشته باشد از دو ابزار عامل‌محور مثل Claude و Cursor هم‌زمان استفاده کند، سقف ماهانه او به ۳,۰۰۰ دلار می‌رسد. این یعنی سالانه ۳۶,۰۰۰ دلار هزینه برای هر نفر. برای نیروی کار ۴,۰۰۰ نفره اوبر، این رقم به پتانسیل ۱۴۴ میلیون دلار هزینه سالانه فقط برای مصرف AI تبدیل می‌شود.

متا (Meta) با ریسکی حتی بزرگ‌تر روبروست. یک یادداشت داخلی در این شرکت هشدار داده است که هزینه‌های توکن در سال ۲۰۲۶ در مسیر رسیدن به میلیاردها دلار است. این انفجار زمانی رخ می‌دهد که فشار سازمانی برای سوق دادن مهندسان به استفاده از Claude با مقیاس عظیم یک سازمان جهانی برخورد می‌کند. در همین راستا، متا برای مقابله با این هزینه‌ها، معیار ارزیابی مهندسان خود را از میزان مصرف توکن به کیفیت کد تغییر داد. وقتی عامل‌ها در این مقیاس به یک کدبیس متصل می‌شوند، مصرف توکن‌ها دیگر فقط رشد نمی‌کند، بلکه منفجر می‌شود.

داده‌های شاخص AI شرکت Ramp که پرداخت‌های واقعی تامین‌کنندگان را در بیش از ۷۰,۰۰۰ کسب‌وکار رصد می‌کند، شکافی عمیق را در هزینه‌ها نشان می‌دهد:

  • ۱٪ برتر شرکت‌های پذیرنده AI، اکنون ماهانه حدود ۷,۵۰۰ دلار برای هر کارمند هزینه می‌کنند.
  • این هزینه با نرخ ۱۴.۱٪ در هر ماه در حال رشد است.
  • مدیران استارتاپ Mercor (که در زمینه استخدام AI فعال است) گزارش داده‌اند که در برخی شرکت‌ها، هزینه توکن‌ها به حقوق واقعی کارمندان نزدیک شده یا حتی از آن فراتر رفته است.

این یک دسته هزینه کاملاً جدید است که تا دو سال پیش در هیچ ترازنامه‌ای (P&L) وجود نداشت. برای اکثر مدیران مالی، این یک خطای کوچک یا مبلغی نیست که توسط صندوق‌های نوآوری جذب شود. بلکه میلیون‌ها دلار هزینه جدید است که باعث ایجاد تضاد واقعی بین استخدام نیروی انسانی، سایر سرمایه‌گذاری‌های فناوری یا بودجه‌های اختیاری می‌شود.

سه سطح ریسک مالی

تیم‌های مالی اکنون با سه پروفایل ریسک متفاوت دست‌وپنجه نرم می‌کنند و احتمالاً در اکثر سازمان‌ها، تنها سطح اول تحت کنترل است:

  • ابزارهای کاربر تجاری: کاربرانی در بخش‌های فروش، بازاریابی و عملیات عمدتاً از ابزارهایی استفاده می‌کنند که قیمت‌گذاری آن‌ها بر اساس صندلی (Per Seat) است؛ معمولاً ۲۰ تا ۳۰ دلار ثابت برای هر کاربر در ماه. این مدل پیش‌بینی‌پذیر است و دقیقاً مانند هر ردیف هزینه SaaS در بیست سال گذشته رفتار می‌کند.
  • ابزارهای کدنویسی عامل‌محور: این دسته به تازگی از قیمت ثابت به قیمت‌گذاری متری (Metered Pricing) تغییر کرده‌اند. برای مثال، GitHub Copilot در ژوئن ۲۰۲۶ به صورت توکن‌محور شد. این تغییر مدل پرداخت باعث شد هزینه‌های برخی توسعه‌دهندگان به دلیل مدل مصرفی به شدت افزایش یابد و در برخی موارد به ۷۵۰ دلار برسد. توسعه‌دهندگان پیش‌بینی می‌کنند که صورت‌حساب‌ها از ۲۹ دلار به ۷۵۰ دلار در ماه، و در جلسات سنگین عامل‌محور، از ۵۰ دلار به ۳,۰۰۰ دلار در ماه برسد. اوبر یک استثنا نیست، بلکه نگاهی زودهنگام به مسیر حرکت کل این دسته از ابزارهاست.
  • عامل‌های خودکار: خطرناک‌ترین سطح است چون مفهومی به نام «صندلی» یا کاربر ندارد. این عامل‌ها بدون نظارت اجرا می‌شوند، زیر-عامل‌هایی (Sub-agents) می‌سازند و در صورت شکست، دوباره تلاش می‌کنند. آن‌ها در تمام مدت توکن مصرف می‌کنند، چه خروجی مفیدی تولید کنند و چه نکنند. این لایه کمترین داده‌های هزینه‌ای و کمترین سوابق بودجه‌بندی را دارد.

پر کردن شکاف دیدبانی

بسیاری از شرکت‌ها لایه‌ای بین کاربر یا عامل و ارائه‌دهنده مدل ندارند. سقف‌های هزینه‌ای مانند آنچه در اوبر اعمال شد، راهکارهای سخت و پس‌رویدادی (After-the-fact) هستند. به همین دلیل، دسته‌ای جدید به نام «ارکستراسیون عامل» یا «درگاه‌های عامل» (Agent Gateways) در حال ظهور است تا به جای غافلگیری‌های ماهانه، یک شمارنده لحظه‌ای ارائه دهد.

این ابزارها به سه لایه متمایز تقسیم می‌شوند:

  • درگاه‌های کنترل هزینه: این‌ها بین اپلیکیشن‌ها و ارائه‌دهندگان مدل قرار می‌گیرند تا سقف هزینه تیمی، کش کردن پاسخ‌ها (Response Caching) و مسیریابی خودکار به مدل‌های ارزان‌تر برای کارهای ساده را اضافه کنند.
  • ارکستراسیون عامل: این لایه بر هماهنگی چندین عامل که با هم کار می‌کنند تمرکز دارد و قابلیت دیدن هزینه‌ها را به جای اضافه کردن دستی، در ساختار خود جای داده است.
  • لایه‌های مالی (FinOps): این لایه‌ها با هزینه‌های AI همان‌گونه برخورد می‌کنند که تیم‌های FinOps با هزینه‌های ابری برخورد می‌کنند؛ یعنی هزینه‌ها بر اساس تیم و ویژگی تفکیک شده، بودجه‌بندی شده و ماهانه بررسی می‌شوند.

برخی شرکت‌ها برای کاهش هزینه‌ها به یک معماری ترکیبی روی می‌آورند تا وابستگی به مدل‌های زبانی بزرگ (LLM) را کاهش دهند. با استفاده از مدل‌های زبانی کوچک (SLM) که روی تکالیف محدود سازمانی آموزش دیده‌اند — مانند سیاست‌های داخلی، خدمات مشتریان، پردازش اسناد وام یا تجزیه و تحلیل manifests حمل و نقل — شرکت‌ها می‌توانند از «مالیات مدل‌های پیشرو» در امان بمانند.

بر اساس یک مقایسه مدل‌های LLM سازمانی در سال ۲۰۲۶، اقتصاد این کار بسیار جذاب است. برای یک میلیون گفتگو در ماه:

  • هزینه مدل‌های پیشرو (Frontier LLMs) میزبانی شده بین ۱۵,۰۰۰ تا ۷۵,۰۰۰ دلار در ماه است.
  • یک SLM تنظیم‌شده (Fine-tuned) که در محیط داخلی مستقر شده، تنها ۱۵۰ تا ۸۰۰ دلار برای همان حجم از گفتگو هزینه دارد.

گولدمان ساکس (Goldman Sachs) این موضوع را در مقیاس بزرگ از طریق یک درگاه مدل متمرکز مدیریت می‌کند. این سیستم هر درخواست را بر اساس نوع تکلیف دسته‌بندی کرده و آن را به به‌صرفه‌ترین مدل برای آن کار می‌فرستد؛ طیفی از مدل‌های متن‌باز سبک تا مدل‌های پیشرو، همگی در محیط امنیتی خود شرکت.

این وضعیت شبیه روزهای اول پذیرش رایانش ابری است؛ جایی که هزینه‌ها در موج اول منفجر شدند و سپس FinOps به عنوان یک دیسیپلین شکل گرفت. ابزارهای امروز توسط مهندسان برای افزایش بهره‌وری ساخته شده‌اند، اما لایه‌ای که به سوال مدیر مالی پاسخ دهد — اینکه کدام تیم، برای چه کاربردی و از کدام بودجه هزینه می‌کند و چه مورد تجاری (Business Use Case) این هزینه را توجیه می‌کند — هنوز جای خالی‌اش حس می‌شود.

اگر بزرگ‌ترین شرکت‌های فناوری جهان از این هزینه‌ها غافلگیر شدند، هر سازمان دیگری در معرض ریسک است. مدیریت هزینه AI دیگر یک پروژه جانبی برای مهندسان نیست، بلکه به یک الزام اصلی مالی تبدیل شده است. اوبر و متا پیش از این نشان داده‌اند که وقتی هزینه‌ها را به جای پیش‌بینی، پس از وقوع مدیریت کنید، چه اتفاقی می‌افتد.

گام بعدی شما

  • اگر از ابزارهای Agentic استفاده می‌کنید، فوراً سقف مصرف (Usage Limit) را در پنل API فعال کنید.
  • برای کارهای تکراری و محدود، جایگزینی مدل‌های پیشرو با مدل‌های زبانی کوچک (SLM) را بررسی کنید.
  • لایه‌ای برای مانیتورینگ لحظه‌ای توکن‌ها بین توسعه‌دهندگان و API مدل‌ها ایجاد کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اتفاق نشان می‌دهد که مقیاس‌پذیری عامل‌های AI با یک سد مالی سخت برخورد کرده است. بر اساس تجربه شرکت‌های پیشرو، بدون لایه‌های مدیریت هزینه (FinOps)، بهره‌وری حاصل از AI توسط هزینه‌های استنتاج بلعیده خواهد شد.

تأثیر برای ایران

به‌دلیل هزینه‌های دلاری توکن‌ها و محدودیت‌های پرداخت، توسعه‌دهندگان ایرانی باید از ابتدا بر روی مدل‌های زبانی کوچک (SLM) و میزبانی شخصی (Self-hosting) تمرکز کنند تا با شوک‌های بودجه‌ای مشابه اوبر مواجه نشوند.

·نگاه ما
تحریریه دات‌هوش

انتقال از مدل «پرداخت به ازای کاربر» به «پرداخت به ازای توکن»، در واقع پایان عصر پیش‌بینی‌پذیری در بودجه‌های نرم‌افزاری است. این تغییر باعث می‌شود بهره‌وری AI دیگر یک متغیر فنی نباشد، بلکه به یک متغیر استراتژیک مالی تبدیل شود که مستقیماً با تعداد استخدامات در تضاد است. در واقع، ما در حال ورود به دورانی هستیم که «بهینه‌سازی توکن» به اندازه «بهینه‌سازی کد» برای سازمان‌ها حیاتی خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.