پرش به محتوای اصلی
پرش به محتوای مقاله

توکن‌های استدلال GPT-5.6 هزینه‌های API را تا ۴ برابر افزایش می‌دهند

·۲۵ مرداد ۱۴۰۵۳ دقیقه مطالعه۴ بازدید
راهنما
GPT-5.6 استدلال را در همه سطوح قرار می‌دهد. برآوردگر هزینه شما آماده نیست.
GPT-5.6 استدلال را در همه سطوح قرار می‌دهد. برآوردگر هزینه شما آماده نیست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین در نحوه صورت‌حساب OpenAI؛ توکن‌های تفکر داخلی که قبلاً نادیده گرفته می‌شدند یا در مدل‌های خاص بودند، اکنون در تمام لایه‌های تولیدی به عنوان هزینه خروجی محاسبه می‌شوند.

اگر امروز بودجه‌ای برای توکن‌های خروجی مدل‌های OpenAI در نظر گرفته‌اید، احتمالاً با فاکتوری مواجه می‌شوید که ۴ برابر بیشتر از پیش‌بینی شماست. این افزایش هزینه به‌دلیل توکن‌های استدلالی است که در پس‌زمینه تولید می‌شوند اما هرگز به کاربر نمایش داده نمی‌شوند. در واقع، درخواستی به GPT-5.6 که تنها ۲۰۰ توکن مرئی برمی‌گرداند، اگر مدل ۶۰۰ توکن استدلال داخلی تولید کند، می‌تواند چهار برابر بیشتر از حد انتظار هزینه داشته باشد. این اختلاف صورت‌حساب به این دلیل است که OpenAI توکن‌های استدلال را به عنوان توکن‌های خروجی محاسبه می‌کند، حتی اگر این توکن‌ها هرگز در پاسخ نهایی ارسالی به کاربر ظاهر نشوند.

این تغییر یعنی استدلال (Reasoning) — شبیه شطرنج‌بازی که قبل از هر حرکت، چندین مسیر را در ذهن بررسی می‌کند — دیگر یک قابلیت خاص نیست، بلکه استاندارد تمام نسخه‌های تولیدی است. همان‌طور که در تحلیل قبلی ما درباره‌ی نوسانات مصرف در مدل GPT-5.6 Luna اشاره کردیم، اکنون OpenAI استدلال را در سراسر خانواده تولیدی خود پیاده کرده است. مدل‌های Sol، Terra و Luna همگی پیش از پاسخ دادن، استدلال می‌کنند. برای توسعه‌دهندگان، این یعنی روش‌های سنتی تخمین هزینه بر اساس طول پاسخ مورد انتظار، به‌طور کلی از کار افتاده است. این چالش در واقع تکرار تجربه تلخی است که بسیاری از کاربران با تله‌های توکن‌های پنهان در صورت‌حساب‌های API مواجه شدند که هزینه‌ها را تا ۶ برابر افزایش داد.

زمینه توکن‌های نامرئی

تصور کنید یک درخواست ساده برای فرمت‌بندی متن و یک مسئله پیچیده معماری را مقایسه کنید؛ هر دو ممکن است پاسخی در حد یک پاراگراف داشته باشند، اما دومی بودجه شما را با سرعت بسیار بیشتری می‌بلعد. دلیلش این است که مدل در حالی که پاسخی کوتاه برمی‌گرداند، درونیاتش توکن‌های بسیار بیشتری مصرف می‌کند. تخمین‌گر شما فقط خروجی مرئی را می‌بیند، اما فاکتور نهایی همه چیز را محاسبه می‌کند.

به نقل از گزارشی که در ۱۶ اوت ۲۰۲۶ در وب‌سایت dev.to منتشر شد، اثر مالی این موضوع کاملاً ملموس است. با نرخ ۳۰ دلار به‌ازای هر میلیون توکن خروجی، پاسخی با ۲۰۰ توکن مرئی و ۶۰۰ توکن استدلالی، ۰.۰۲۴ دلار هزینه دارد، در حالی که یک تخمین‌گر ساده و ناپخته تنها ۰.۰۰۶ دلار را پیش‌بینی می‌کند. ریاضیات اشتباه نیست؛ بلکه تخمین‌گر دارد متغیر غلطی را اندازه می‌گیرد. این ناهماهنگی نشان می‌دهد که چرا مدل قیمت‌گذاری مبتنی بر توکن می‌تواند برای بودجه‌بندی دقیق پروژه‌های هوش مصنوعی گمراه‌کننده باشد.

GPT-5.6 استدلال را در همه سطوح قرار می‌دهد. برآوردگر هزینه شما آماده نیست.

چرا تخمین‌های نقطه‌ای شکست می‌خورند

بیشتر سیستم‌های حفاظتی هزینه پیش از فراخوانی (Pre-call cost guards)، بر اساس یک فرمول ساده عمل می‌کنند: const estimatedCost = (inputTokens / 1_000_000) * inputPrice + (expectedOutputTokens / 1_000_000) * outputPrice;. این روش برای مدل‌های استدلالی (Reasoning Models) شکست می‌خورد چون طول خروجی مرئی دیگر معیار مناسبی برای توکن‌های صورت‌حساب نیست.

طبق گزارش مذکور، توسعه‌دهندگان باید از تخمین‌های تک‌عددی (Point Estimates) فاصله بگیرند و از الگوی «رزرو بودجه» استفاده کنند:

  • تخمین بازه‌ای: به‌جای یک عدد واحد، از یک thinkingMultiplierRange (مثلاً یک بازه عددی مانند [number, number]) در رابط ModelPricing خود استفاده کنید تا سقف هزینه احتمالی را پیش از فراخوانی تعیین کنید.
  • رزرو و مسدودسازی: پرسش را از «این فراخوانی چقدر هزینه دارد؟» به «سقف هزینه احتمالی چقدر است و آیا جلسه کاربر بودجه‌اش را می‌رساند؟» تغییر دهید. اگر سقف هزینه در بدترین حالت از بودجه باقی‌مانده جلسه بیشتر بود، درخواست را مسدود کنید.
  • تطبیق نهایی: پس از پاسخ ارائه‌دهنده، میزان واقعی توکن‌های مصرف شده را بخوانید، رزرو را آزاد کنید و هزینه واقعی را ثبت نمایید. این کار چرخه مالی را می‌بندد.

این رویکرد اجازه می‌دهد سیستم به‌مرور کالیبره شود. در حالی که یک ضریب کلی نقطه شروع است، داده‌های عملیاتی می‌توانند در نهایت این بازه را دقیق‌تر کنند؛ برای مثال، تبدیل یک تخمین مبهم «۰.۵ تا ۴ برابر» به یک بازه خاص برای هر نوع workload مانند «۱.۲ تا ۱.۸ برابر» بر اساس نسبت مشاهده شده بین توکن‌های استدلال و خروجی مرئی.

متغیرهای پیچیده

سیستم‌های حافظه موقت (Caching) اثر معکوس دارند و هزینه را کاهش می‌دهند. یک حفاظ ساده در هر دو جهت شکست می‌خورد: یا در زمان استدلال بودجه کمی رزرو کرده و بیش از حد هزینه می‌کنید، یا در زمان استفاده از کش، بودجه زیادی رزرو کرده و درخواست‌ها را بی‌دلیل مسدود می‌کنید. راه حل، مدل‌سازی دقیق مکانیسم صورت‌حساب واقعی ارائه‌دهنده است، نه جمع ساده ورودی و خروجی.

این تغییر یک مشکل معماری عمیق‌تر را آشکار می‌کند: تعداد توکن‌ها دیگر معیار کافی برای هزینه نیست. حفاظ‌های مدرن تولیدی اکنون باید موارد زیر را محاسبه کنند:

  • سطوح قیمت‌گذاری خاص هر مدل
  • تخفیف‌های ورودی کش‌شده
  • بازه توکن‌های خروجی استدلالی
  • تلاش‌های مجدد (Retries) و شکست‌های جزئی
  • بودجه‌های سطح جلسه برای چندین عامل (Agent)

جالب است که این مشکل مختص OpenAI نیست. تست‌های مستقل در ۱۴ اوت ۲۰۲۶ نشان داد که مدل DeepSeek-V4-Pro نیز به‌صورت پیش‌فرض از استدلال استفاده می‌کند و پیش‌بینی هزینه را برای کسانی که از مجموعه‌ای از مدل‌های مختلف (Multi-model stacks) استفاده می‌کنند، دشوارتر کرده است. این پیچیدگی‌ها تایید می‌کند که بسیاری از هزینه‌های بالا، بیش از آنکه به بهینگی مدل مربوط باشد، ناشی از ناکارآمدی پلتفرم‌ها در مدیریت منابع GPU است.

برای کیف پول توسعه‌دهندگان، این یعنی بخش «نامرئی» تفکر هوش مصنوعی، اکنون گران‌ترین بخش فاکتور است. هدف دیگر پیش‌بینی دقیق هزینه نیست، بلکه اطمینان از این است که بودجه جلسه، سقف هزینه را پوشش می‌دهد.

منتظر به‌روزرسانی‌های آتی API باشید که ممکن است راهنمایی‌های هزینه پیش از اجرا (Pre-execution cost hints) یا کنترل‌های دقیق‌تری برای توکن‌های استدلال ارائه دهند تا این شوک‌های بودجه‌ای کاهش یابد.

گام بعدی شما

  • رابط‌های قیمت‌گذاری (ModelPricing) خود را از مقادیر ثابت به بازه‌های ضریب (Multiplier Range) تغییر دهید.
  • مکانیسم رزرو بودجه پیش از فراخوانی API را برای جلوگیری از شوک‌های مالی پیاده‌سازی کنید.
  • مصرف توکن‌های استدلالی را به‌تفکیک از توکن‌های خروجی در دیتابیس خود ثبت کنید تا الگوی مصرف هر مدل را بشناسید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر بر اساس تجربه عملی توسعه‌دهندگان، مدل‌های اقتصادی بسیاری از استارتاپ‌های AI را به دلیل هزینه‌های پیش‌بینی‌نشده به خطر می‌اندازد. اعتبار این ادعا با گزارش‌های مالی منتشر شده در اوت ۲۰۲۶ تأیید شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی مواجه‌اند، این عدم پیش‌بینی‌پذیری هزینه می‌تواند منجر به اتمام سریع اعتبار حساب‌های API شود. استفاده از مدل‌های جایگزین با هزینه ثابت یا مدیریت سخت‌گیرانه سقف بودجه ضروری است.

·نگاه ما
تحریریه دات‌هوش

تغییر مدل صورت‌حساب از «خروجی مرئی» به «تلاش محاسباتی» نشان می‌دهد که توکن‌ها در حال تبدیل شدن از واحد اندازه متن به واحد اندازه انرژی و زمان پردازش هستند. این یعنی توسعه‌دهندگان باید از تفکر «تولید محتوا» به تفکر «اجرای پردازش» تغییر مسیر دهند و سیستم‌های مدیریت بودجه خود را شبیه به مدیریت منابع سروری بازنویسی کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.