پرش به محتوای اصلی
پرش به محتوای مقاله

مدل پرداخت توکن‌محور: چرا GitHub Copilot اشتراک‌های ثابت را کنار می‌گذارد؟

·۱۹ خرداد ۱۴۰۵۱۰ دقیقه مطالعه۲ بازدید
هوش مصنوعی عاملی و تبدیل توکن‌ها به معیار تجاری
هوش مصنوعی عاملی و تبدیل توکن‌ها به معیار تجاری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین در واحد محاسبه‌ی ارزش؛ گذار از B2C (اشتراک ماهانه) به B2B (پرداخت بر اساس مصرف و نتیجه) برای پوشش هزینه‌های سنگین عامل‌های خودکار.

اگر امروز برای ابزارهای هوش مصنوعی بودجه‌بندی می‌کنید، باید بدانید که مبلغ ثابت ماهانه در حال تبدیل شدن به یک اثر باستانی است. از ۱ ژوئن ۲۰۲۶، گیت‌هاب کوپایلوت (GitHub Copilot) حرکت به سوی مدل مبتنی بر مصرف را با معرفی «اعتبارات هوش مصنوعی گیت‌هاب» آغاز کرد؛ این یعنی توکن دیگر یک نکته فنی در حاشیه نیست، بلکه یک هزینه اصلی کسب‌وکار است.

این چرخش زمانی رخ می‌دهد که هوش مصنوعی از رابط‌های ساده‌ی چت به عامل‌های خودمختار تبدیل می‌شود. در حالی که یک انسان در چت با بات، مقدار پیش‌بینی‌پذیری از داده را مصرف می‌کند، یک عامل که ساعت‌ها برای حل یک مشکل کدنویسی تلاش می‌کند، می‌تواند در یک جلسه میلیون‌ها توکن (Token) — مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — بسوزاند. فشار روی تأمین‌کنندگان شدید است؛ شرکت‌های بزرگ میلیاردها دلار روی مراکز داده و تراشه‌ها سرمایه‌گذاری کرده‌اند و این سرمایه‌ها باید در مقیاسی بازگردند که نرخ‌های ثابت توان پشتیبانی از آن را ندارند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی اقتصاد مدل‌های زبانی اشاره کردیم، توازن بین هزینه پردازش و قیمت فروش همواره چالش‌برانگیز بوده است. اکنون این توازن در مدل‌های اشتراکی به کلی شکسته شده است.

پایان عصر نرخ ثابت

گیت‌هاب سیستم اعتباری جدید خود را برای ویژگی‌هایی هدف قرار داده که در آن‌ها کوپایلوت فراتر از پیشنهاد کد عمل می‌کند؛ به‌ویژه در چت، رابط خط فرمان (CLI) و توابع عامل‌محور. طبق اعلام این شرکت، تکمیل‌های استاندارد برای طرح‌های پولی رایگان می‌مانند، اما جلسات خودمختار بر اساس مصرف واقعی توکن و قیمت‌های API محاسبه می‌شوند. استدلال گیت‌هاب بر یک نابرابری بحرانی است: پیش از این، یک سؤال کوتاه در چت تقریباً با یک جلسه کدنویسی خودمختار که ساعت‌ها طول می‌کشید، یکسان برخورد می‌شد و این مدل اقتصادی دیگر پایدار نیست.

آنتروپیک (Anthropic) نیز خطوط مشابهی را ترسیم می‌کند. ابزارهای عامل‌محور این شرکت مانند کلود کد (Claude Code)، کلود کوورک (Claude Cowork) و عامل‌های مدیریت‌شده، مدل را به یک نیروی کار دیجیتال تبدیل می‌کنند. به گزارش این شرکت، گلوگاه‌های اخیر در کلود کد به دلیل بارهای پیک و رسیدن پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — به یک میلیون توکن بوده است. طرح‌های قدیمی برای چت‌های سنگین طراحی شده بودند، اما نمی‌توانند جریان‌های کاری «همواره فعال» عامل‌ها را پشتیبانی کنند.

شکاف اقتصاد توکنی

الگوهای مصرف در صنایع مختلف به‌شدت متفاوت است و این موضوع بر نحوه احساس صورت‌حساب توکن اثر می‌گذارد. تحلیل‌های عمومی API آنتروپیک نشان می‌دهد که تقریباً نیمی از تمام فراخوانی‌های ابزارهای عامل‌محور مربوط به توسعه نرم‌افزار است؛ اولین حوزه‌ای که از مدل‌های عامل‌محور و ساختارهایی مثل کلود کد بهره برد. در مقابل، خدمات مشتری، فروش، مالی و تجارت الکترونیک هر کدام تنها چند درصد از فراخوانی‌ها را تشکیل می‌دهند و در آن‌ها هنوز چت‌های ساده غالب هستند. با بلوغ جریان‌های کاری عامل‌محور در پژوهش، حقوق و ابزارهای اداری، این فاصله احتمالاً بیشتر خواهد شد.

این وضعیت یک چشم‌انداز قیمت‌گذاری گمراه‌کننده ایجاد می‌کند. مقایسه قیمت ثابت — مثلاً GPT-5.5 با ۳۰ دلار برای هر میلیون توکن خروجی در برابر دیپ‌سیک V4 پرو (DeepSeek V4 Pro) با ۸۷ سنت — هزینه واقعی هر «وظیفه» را نادیده می‌گیرد. این موضوع شبیه به بهره‌وری سوخت در خودرو است؛ قیمت هر لیتر بنزین به تنهایی چیزی درباره هزینه سفر از برلین به مونیخ به شما نمی‌گوید، زیرا باید مسافت و میزان مصرف را هم بدانید.

  • مدل‌های ناکارآمد: یک مدل ارزان اگر به حلقه‌های تکرار بیشتر نیاز داشته باشد، مکرراً شکست بخورد یا نیاز به اصلاحات انسانی گسترده داشته باشد، گران تمام می‌شود. شرکت‌هایی مثل دیپ‌سیک شرط می‌بندند که کاربران یک کار را چهار یا پنج بار اجرا کنند و باز هم ارزان‌تر تمام شود، اما بازکاری‌ها به‌سرعت این مزیت را می‌بلعند.
  • مدل‌های کارآمد: یک مدل گران‌تر زمانی سودآور است که هدف را با تکرارهای کمتر و نظارت انسانی محدودتر به دست آورد.

داده‌های دنیای واقعی از اوپن‌روتر (OpenRouter) نشان می‌دهد که قیمت بالاتر GPT-5.5 قرار بود با پاسخ‌های کوتاه‌تر جبران شود، اما هزینه‌ها بسته به طول ورودی، ۴۹٪ تا ۹۲٪ نسبت به نسل قبلی افزایش یافت. در موارد دیگر، هم قیمت و هم مصرف بالا می‌رود. قیمت توکن جمینای ۳.۵ فلش (Gemini 3.5 Flash) گوگل سه برابر جمینای ۳ فلش شد؛ هم‌زمان ارزیابی Artificial Analysis نشان داد که این مدل در شاخص هوشمندی به گام‌های بیشتری نیاز دارد و در نتیجه گران‌تر از مدل پرچمدار جمینای ۳.۱ پرو است.

رادار مرز ۳: چگونه هوش مصنوعی عامل‌محور، توکن‌ها را به معیار کسب‌وکار تبدیل می‌کند

ظهور بخش‌بندی توکن‌ها

جنسن هوانگ، مدیرعامل انویدیا (Nvidia)، دوران جدیدی را توصیف می‌کند که در آن کامپیوترها دیگر فقط انبارهای داده نیستند، بلکه «کارخانه‌های توکن» هستند. او استدلال می‌کند که توکن‌ها اکنون مانند آیفون‌ها در حال بخش‌بندی هستند: نسخه‌های رایگان، میان‌رده و پرمیوم. توکن‌های باارزش — آن‌هایی که تأخیر کمتری دارند یا دانش تخصصی ارائه می‌دهند — می‌توانند قیمت‌های به‌مراتب بالاتری داشته باشند، زیرا بهره‌وری متخصصان با درآمد بالا مثل مهندسان نرم‌افزار را افزایش می‌دهند.

هوانگ اشاره کرد که انویدیا اخیراً معماری استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی نه دوره آموزش آشپز — استارتاپ گروک (Groq) را لایسنس کرده و آن را در اکوسیستم CUDA ادغام کرده است. به دلیل اینکه مشتریان مختلف پاسخ‌های متفاوتی می‌خواهند و ارزش‌های متفاوتی کسب می‌کنند، قیمت می‌تواند از هزینه خام پردازش فاصله بگیرد. هوانگ معتقد است پرداخت ۱,۰۰۰ دلار برای هر میلیون توکن «غیرممکن نیست، بلکه فقط مسئله زمان است».

این بخش‌بندی در حوزه‌های تخصصی ظاهر شده است:

  • امنیت سایبری: شرکت پالو آلتو نتورکس (Palo Alto Networks) مدل میتوس (Mythos) آنتروپیک را برای اسکن کدهای منبع از نظر آسیب‌پذیری آزمایش کرد. این مدل در سه هفته بیش از دو جین آسیب‌پذیری بحرانی یافت — پنج برابر بیشتر از روش‌های قبلی. با اینکه میلیون‌ها دلار هزینه توکن داشت، این هزینه منطقی است زیرا هزینه یک حمله موفق بسیار بیشتر خواهد بود.
  • بیوتکنولوژی: شرکت بیس‌کمپ ریسرچ (Basecamp Research) در حال گسترش «اطلس تریلیون ژن» از ۱۰ میلیارد به یک تریلیون ژن و نقطه داده برای آموزش مدل‌های توسعه دارو است. در اینجا، ارزش توکن به دسترسی انحصاری به داده‌های بیولوژیکی اختصاصی و پتانسیل تولید محصولات باارزش مثل کاندیداهای دارویی گره خورده است.

خطر «توکن‌ماکسینگ»

با نمایان‌تر شدن هزینه‌ها، یک واکنش مدیریتی خطرناک شکل گرفته است: «توکن‌ماکسینگ» (Tokenmaxxing). این فرض است که مصرف بیشتر توکن به‌طور خودکار به معنای خلق ارزش بیشتر است. چون دستاوردهای بهره‌وری اغلب مبهم هستند (مثلاً «تصمیمات بهتر» یا «پژوهش سریع‌تر»)، مدیران از حجم توکن به عنوان معیاری برای موفقیت استفاده می‌کنند.

این منطق در سیستم‌های عامل‌محور غلط است. عاملی که دو ساعت زمان صرف می‌کند تا یک وظیفه را اشتباه حل کند، توکن‌های بیشتری نسبت به عاملی می‌سوزاند که آن را در پنج دقیقه درست حل می‌کند. بدون حضور انسان در هر مرحله، مصرف توکن «فعالیت» را اندازه می‌گیرد، نه «نتیجه» را. در چت، کاربر پاسخ را فوراً قضاوت می‌کند؛ اما یک عامل ساعت‌ها به‌طور خودمختار اجرا می‌شود و ممکن است در نهایت نتیجه کاملاً دور ریخته شود.

اوبر (Uber) یک درس عبرت است. طبق گزارش فورچون (Fortune)، این شرکت بودجه برنامه‌ریزی‌شده خود برای کدنویسی هوش مصنوعی در سال ۲۰۲۶ را تنها در چهار ماه تمام کرد. اندرو مک‌دونالد، مدیر عملیات اوبر، این سؤال را مطرح کرد که آیا افزایش استفاده از کلود کد واقعاً به ویژگی‌های بهتر برای مصرف‌کننده منجر شده است یا خیر. این موضوع شکافی را نشان می‌دهد که در آن هزینه‌های توکن تا سنت محاسبه می‌شوند، اما تأثیر نهایی بر سود شرکت همچنان یک سؤال باز است.

مشکل «خروجی تاریک»

در سطح کلان، این شکاف اندازه‌گیری چیزی را ایجاد می‌کند که سمی‌آنالیسیس (SemiAnalysis) آن را «خروجی تاریک» (Dark Output) می‌نامد. هوش مصنوعی ممکن است کارهای دارای ارزش اقتصادی انجام دهد که در آمارهای سنتی ناپدید شوند. وقتی وظایفی که قبلاً به عنوان ساعات مشاوره خارجی یا خدمات حقوقی صورت‌حساب می‌شدند به جریان‌های کاری داخلی هوش مصنوعی منتقل می‌شوند، هزینه‌های ابری قابل اندازه‌گیری می‌مانند، اما ارزش کار دیگر به عنوان یک تراکنش در GDP ظاهر نمی‌شود.

از آنجا که بخش خدمات فاقد یک واحد کمی قابل شمارش است (برخلاف ماشین یا پیچ)، سازمان‌های آماری به درآمد و قیمت‌های لیست تکیه می‌کنند. اگر صورت‌حساب یک شرکت حقوقی حذف شود چون هوش مصنوعی کار را داخلی انجام داده، آمارها این را به عنوان کاهش خروجی می‌خوانند، نه افزایش بهره‌وری.

اجرای چارچوب‌بندی وظایف

برای جلوگیری از انفجار بودجه، شرکت‌ها باید از «پرامپت‌نویسی» به سمت «چارچوب‌بندی وظایف» (Task Framing) حرکت کنند. در چت، یک پرامپت بد ارزان شکست می‌خورد. در هوش مصنوعی عامل‌محور، یک اجرای شکست‌خورده بعد از دو ساعت، یعنی از دست رفتن کامل توکن‌ها. این نیازمند چارچوبی شبیه به مدیریت فریلنسرهاست: ارائه موضوع، طول، هدف، ضرب‌الاجل و دستمزد.

چارچوب‌بندی مؤثر شامل موارد زیر است:

  • تعریف محدوده: دقیقاً چه چیزی باید حل شود؟ کدام داده‌ها و ابزارها مجاز هستند؟
  • تعیین محدودیت‌ها: یک بودجه حداکثری برای توکن و نقطه‌ای که عامل باید عملیات را متوقف کند، تعیین کنید.
  • ایجاد قوانین مسیریابی: از یک مدل استاندارد ارزان برای کارهای روتین استفاده کنید و فقط برای تحلیل‌های بحرانی به مدل پرمیوم ارجاع دهید. مثلاً: «این درخواست تغییر کد را با مدل استاندارد بررسی کن؛ اگر تغییرات مربوط به امنیت دیده شد، فقط همان بخش‌ها را به مدل گران‌قیمت بفرست».
  • تعیین شرایط توقف: محدودیت‌هایی برای متن ورودی (مثلاً ۲۰۰,۰۰۰ توکن) و هزینه تجمعی قبل از فعال کردن بررسی انسانی تعیین کنید.

الگوهای تشخیصی در عملیات

وقتی این چارچوب‌ها مستقر شوند، مصرف توکن به جای یک هدف، به یک سیگنال تشخیصی تبدیل می‌شود. چهار الگو ظاهر می‌شوند:

  • مصرف بالا / نتیجه کاربردی: کار انجام شده اما ناکارآمد. این معمولاً نشان‌دهنده مسیریابی ضعیف است، مثل استفاده از یک مدل پیشرو برای یک کار ساده.
  • مصرف بالا / نتیجه بد: بالاترین ریسک. این نشان‌دهنده ترکیبی از چارچوب‌بندی نامشخص، کلاس مدل اشتباه یا وظیفه‌ای است که اصلاً توسط یک عامل قابل حل نیست.
  • مصرف پایین / بازکاری زیاد: یک موفقیت فریبنده. صورت‌حساب توکن پایین است، اما هزینه‌های حقوق انسانی بالا می‌رود چون مدل «کم فکر کرده» و نیاز به اصلاحات دستی گسترده دارد.
  • مصرف بدون ارزش قابل انتساب: نسخه فرآیندی خروجی تاریک. هزینه‌های توکن در ترازنامه ظاهر می‌شوند، اما سهم ارزش مشخصی برای کسب‌وکار ندارند.

عنصر انسانی در اقتصاد توکن

اقتصاد توکن صرفاً یک موضوع IT نیست. در حالی که IT می‌تواند داشبوردهایی بسازد و محدودیت بگذارد، نمی‌تواند قضاوت کند که آیا یک گزارش مالی «به اندازه کافی خوب» است یا خیر. این کار نیازمند تخصص دامنه است. اقتصاد توکن به مهارتی تبدیل خواهد شد که در نقش‌های مختلف حرفه‌ای ادغام می‌شود:

  • توسعه‌دهندگان باید هزینه‌ها را در برابر عمق تست هنگام هدایت عامل‌های کدنویسی بسنجند.
  • وکلای باید تصمیم بگیرند کدام بررسی‌های قرارداد خودکار شوند و کجا بررسی انسانی لازم است.
  • تیم‌های بازاریابی باید برای اجرای عامل‌ها در تحلیل کمپین بودجه‌بندی کنند و بازگشت سرمایه (ROI) تکرارهای بیشتر را قضاوت کنند.
  • تحلیلگران مالی باید آستانه پیچیدگی را برای ارجاع گزارش‌ها به مدل‌های قدرتمندتر تعیین کنند.

هم‌زمان، یک لایه هدایت در بخش تدارکات و مالی در حال شکل‌گیری است. اگرچه ساختارهای FinOps دوران ابری نقطه شروع خوبی هستند، اما ناکافی‌اند چون نمی‌توانند کیفیت خروجی را قضاوت کنند.

سناریوهای آینده

در محتمل‌ترین سناریو (Baseline)، اعتبارات مبتنی بر مصرف به استاندارد صنعت در توابع پژوهشی، فروش و حقوقی تبدیل می‌شوند. شرکت‌ها «AI FinOps» را برای مدیریت بودجه‌ها به ازای هر جریان کاری توسعه می‌دهند. در حالی که بخش‌های پرمیوم برای علوم زیستی و امنیت رشد می‌کنند، بحث درباره بهره‌وری واقعی به دلیل دشواری نمایش در ترازنامه‌های سنتی، مبهم باقی خواهد ماند.

اگر عامل‌ها سریع‌تر از حد انتظار پیشرفت کنند (سناریوی Acceleration)، ممکن است شاهد تغییری به سمت قیمت‌گذاری مبتنی بر نتیجه باشیم — پرداخت به ازای هر کاندید دارویی تأیید شده یا هر آسیب‌پذیری ثابت شده. پیش‌بینی جنسن هوانگ درباره توکن‌های ۱,۰۰۰ دلاری زمانی آزمایش می‌شود که شرکت‌های مسلط بر مسیریابی و چارچوب‌بندی، از رقبای خود پیش بگیرند.

در مقابل، سناریوی «کندی» (Slowdown) ممکن است رخ دهد اگر شکست‌های بودجه‌ای مثل مورد اوبر باعث شود مدیران مالی محدودیت‌های سخت‌گیرانه‌ای اعمال کنند. در این حالت، عامل‌های غیرقابل اعتماد و هزینه‌های بالای بازکاری، بازار را دوباره به سمت تأمین‌کنندگان ارزان‌قیمت مثل دیپ‌سیک می‌برد.

در نهایت، توکن به معیار مصرف سوخت در عصر هوش مصنوعی تبدیل شده است. برای اجرای اقتصادی، یک شرکت باید بداند هر سفر چند لیتر می‌سوزاند، کدام سفر به چه سوختی نیاز دارد و اصلاً کدام سفر ارزش رفتن دارد. شرکت‌های برنده کسانی خواهند بود که به این سؤال پاسخ دهند: ما کدام کار را با کدام توکن‌ها می‌خریم و از کجا بدانیم که ارزشش را داشته است؟

گام بعدی شما

  • بودجه‌های AI خود را از «هزینه ابزار» به «هزینه وظیفه» تغییر دهید و برای هر جریان کاری سقف توکن تعیین کنید.
  • استراتژی مسیریابی (Routing) را پیاده کنید: کارهای روتین را به مدل‌های ارزان (مثل Gemini Flash) و تحلیل‌های بحرانی را به مدل‌های پرمیوم بسپارید.
  • معیاری برای «ارزش خروجی» تعریف کنید تا از تله «توکن‌ماکسینگ» و مصرف بی‌هدف توکن‌ها رها شوید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و نقش آن‌ها در کاهش هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر، مدل مالی لایه‌ی کاربرد AI را دگرگون می‌کند و شرکت‌ها را مجبور می‌کند مدیریت هزینه‌ی محاسباتی را به بخشی از استراتژی عملیاتی خود تبدیل کنند. این روند بر اساس اعتبار مدل‌های اقتصادی است که در آن هزینه پردازش باید با ارزش تجاری خروجی هم‌راستا باشد.

تأثیر برای ایران

به‌دلیل استفاده‌ی گسترده برنامه‌نویسان ایرانی از واسطه‌های API، این تغییر مدل پرداخت باعث نوسان شدید در هزینه‌های جاری پروژه‌ها می‌شود و نیاز به بهینه‌سازی مصرف توکن را برای استارت‌آپ‌های داخلی حیاتی می‌کند.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که صنعت در حال حرکت از «دوران دسترسی» به «دوران نتیجه» است. وقتی واحد محاسبه از «ماه» به «توکن» و سپس به «خروجی تایید شده» تغییر کند، مدل‌های زبانی بزرگ از یک ابزار نرم‌افزاری به یک نیروی کار با نرخ ساعتی تبدیل می‌شوند. این یعنی ارزش مدل‌ها دیگر با ویژگی‌هایشان، بلکه با نرخ بازگشت سرمایه (ROI) واقعی در هر تسک سنجیده خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.