اگر امروز برای اجرای عاملهای کدنویس هزینه میپردازید، صورتحساب شما برای توکنهای تکراری از ماه آینده نصف میشود. این تغییر در مدل GPT-6.1 Sol، بازی را از رقابت بر سر «هوش مطلق» به رقابت بر سر «هزینه هر اصلاحیه پذیرفتهشده» تغییر میدهد.
انتخاب بین GPT-6.1 Sol و GPT-6 Astra دیگر به این نیست که کدام مدل باهوشتر است، بلکه به این برمیگردد که آیا نرخ موفقیت یک مدل، قیمت بالای توکنهایش را توجیه میکند یا خیر. این یک چارچوب انتخاب بر اساس سازگاری و هزینه تکمیل تسک است، نه ادعایی بر اساس یک بنچمارک ساده سه مدلی. همانطور که در تحلیل قبلی ما دربارهی کاهش قیمتهای ورودی کششده اشاره کردیم، صنعت به سمت عاملهای مبتنی بر پاسخ (Responses-based) حرکت میکند. در این محیط، هدف کم کردن هزینه کل یک تسک است — یعنی مجموع هزینه تلاشهای موفق و شکستخورده و تکرارها — نه فقط نگاه کردن به قیمت هر میلیون توکن. مفیدترین مقایسه این است که آیا عامل شما سازگار میماند، هزینه نهایی تسک چقدر است و آیا اصلاحیه حاصله از تستهای پذیرش شما عبور میکند یا خیر. این رویکرد در واقع تکامل همان بحثهایی است که در مقایسه مدلهای کدنویسی از نظر مقرونبهصرفه بودن به آن پرداختیم.
تصور کنید عامل شما مثل یک برنامهنویس تازهکار است؛ شما نمیخواهید برای هر خط کد ساده، حقوق یک معمار ارشد (نرخ Astra) پرداخت کنید، اما نمیتوانید برنامهنویسی را تحمل کنید که ۱۰ بار در تستها شکست میخورد. استراتژی جدید، ایجاد یک مسیر ارتقای تأییدشده است: با مدل ارزان شروع کنید و فقط وقتی تسک واقعاً دشوار شد، به مدل گران بروید.
کالبدشکافی قیمتها
به نقل از مستندات بررسیشده در ۳۰ سپتامبر ۲۰۲۶، تفاوت قیمتی این مدلها بسیار شدید است. اگرچه OpenAI مدل Sol جدید را برای کارهای پیچیده کدنویسی، استفاده از کامپیوتر و کارهای حرفهای نزدیک به Astra قرار داده است، اما برنده مطلقی برای نوشتن، بررسی مخازن کد (Repository Review) یا دیباگهای دشوار تعیین نکرده است.
جزئیات قیمتها به شرح زیر است:
- GPT-6 Sol (قدیمی): شناسه API مدل
gpt-6-solاست. نرخ ورودی/خروجی ۲/۱۰ دلار به ازای هر میلیون توکن است؛ ورودی کششده ۰.۲۰ دلار و نوشتن کش ۲.۵۰ دلار است. پنجره متن (Context) و حداکثر خروجی برابر با ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است. - GPT-6.1 Sol: شناسه API مدل
gpt-6.1-solاست. نرخ ورودی/خروجی همان ۲/۱۰ دلار باقی مانده است؛ اما نرخ ورودی کششده به نصف کاهش یافته و به ۰.۱۰ دلار رسیده است؛ نوشتن کش ۲.۵۰ دلار است. پنجره متن و حداکثر خروجی ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است. - GPT-6 Astra: شناسه API مدل
gpt-6-astraاست. نرخ ورودی/خروجی ۱۰/۵۰ دلار است؛ ورودی کششده ۱.۰۰ دلار و نوشتن کش ۱۲.۵۰ دلار است. پنجره متن و حداکثر خروجی ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است.

در حالی که نرخهای استاندارد ورودی و خروجی برای سری Sol بدون تغییر مانده است، کاهش ۵۰ درصدی نرخ خواندن کش، تأثیر قابلتوجهی روی بارهای کاری با متن طولانی دارد. با این حال، اگر هیچ خوانشی از کش صورت نگیرد، نرخهای توکن ذکر شده صورتحساب یکسانی ایجاد میکنند. همچنین باید توجه داشت که اگر نحوه استدلال تغییر کند یا مدل پاسخهای طولانیتری بنویسد، نرخهای برابر به معنای هزینه برابر نخواهد بود.
برای یک بار کاری معمولی با متن کوتاه — شامل ۱۰۰,۰۰۰ توکن بدون کش، ۹۰۰,۰۰۰ خوانش از کش و ۵۰,۰۰۰ توکن خروجی — هزینهها به این شکل محاسبه میشود:
- GPT-6 Sol: مبلغ ۰.۲۰۰ دلار (بدون کش) + ۰.۱۸۰ دلار (کش) + ۰.۵۰۰ دلار (خروجی) = ۰.۸۸۰ دلار
- GPT-6.1 Sol: مبلغ ۰.۲۰۰ دلار (بدون کش) + ۰.۰۹۰ دلار (کش) + ۰.۵۰۰ دلار (خروجی) = ۰.۷۹۰ دلار
- GPT-6 Astra: مبلغ ۱.۰۰۰ دلار (بدون کش) + ۰.۹۰۰ دلار (کش) + ۲.۵۰۰ دلار (خروجی) = ۴.۴۰۰ دلار
در این سناریو، مدل GPT-6.1 Sol تقریباً ۱۰.۲٪ ارزانتر از Sol قدیمی و حدود ۸۲٪ ارزانتر از Astra است. البته هیچکدام از این درصدها پیشبینیکننده صرفهجویی در سطح تسک نیستند، زیرا ممکن است مدلها مقادیر متفاوتی از استدلال مصرف کنند یا به تعداد دفعات متفاوتی برای موفقیت نیاز داشته باشند.
مرز مهاجرت فنی
سوییچ به مدل جدید فقط یک تغییر نام ساده نیست. GPT-6.1 Sol و Astra برای فراخوانی ابزار (Tool Call) به نقطه اتصال (Endpoint) جدید Responses نیاز دارند و دیگر از استدلال «none» پشتیبانی نمیکنند.
بر اساس مستندات، اگر یکپارچگی فعلی شما از API Chat Completions با استدلال غیرفعال استفاده میکند، جایگزینی مستقیم مدل باعث شکست عامل شما میشود. برای مثال، درخواستی که از model: "gpt-6-sol" به همراه reasoning_effort: "none" و فراخوانی ابزارها از طریق Chat Completions استفاده میکند، در نسخه 6.1 Sol پشتیبانی نمیشود.
یک درخواست مهاجرتیافته اکنون باید از ساختار ابزار Responses و یک سطح استدلال پشتیبانیشده، مانند 'low'، استفاده کند. یک درخواست صحیح مهاجرتیافته به این شکل خواهد بود:
{ model: "gpt-6.1-sol", reasoning: {"effort": "low"}, input: "Run the tests and explain the first failure. Do not edit files yet.", tools: [ { type: "function", name: "run_tests", ... strict: true } ] }
این درخواستها باید به نقطه اتصال /v1/responses ارسال شوند. برنامه شما باید خروجی تایپشده را بررسی کرده، یک تابع مجاز را اجرا کند و function_call_output را با call_id متناظر بازگرداند. توجه داشته باشید که یک اسکیمای نامگذاری شده مانند run_tests به تنهایی نمیتواند تستهای شما را اجرا کند؛ شما باید کل مسیر رفت و برگشت از درخواست ابزار تا پاسخ نهایی را تأیید کنید.
ارزیابی موفقیت
برای اینکه بفهمید کدام مدل واقعاً پول شما را ذخیره میکند، توسعهدهندگان باید از یک آزمایش کنترلشده با یک تست شکستخورده شناختهشده استفاده کنند. یک مورد تست پیشنهادی، تابعی برای تکهتکه کردن (chunk) است که از range(0, len(items) - size, size) استفاده میکند؛ این تابع تکه نهایی را گم میکند و زمانی که طول ورودی برابر با اندازه تکه باشد، شکست میخورد. از هر مدل بخواهید بدون تغییر دادن تستها، مشکل را تشخیص داده و آن را برطرف کند.
برای اطمینان از مقایسه عادلانه، کامیت مخزن، دسترسیهای ابزار، پرامپت، مجموعه تست، سقف تعداد نوبتها (turn cap) و بودجه خروجی را یکسان نگه دارید. به جای اینکه پیشفرض هر مدل را معادل بدانید، میزان تلاش برای استدلال (reasoning effort) را ثبت کنید. هنگام اجرای این بنچمارک، باید بیش از پاسخ نهایی را ثبت کنید:
- هزینه کل: هزینه تمام تلاشها، شامل اصلاحات شکستخورده و تکرارها. هزینه را از روی درصد مصرف اشتراک ChatGPT یا Codex استنباط نکنید.
- تعداد تکرار: تعداد فراخوانیهای ابزار و تکرارهای لازم برای موفقیت. یک فراخوانی ارزانتر ممکن است برای موفقیت به تکرارهای بیشتری نیاز داشته باشد.
- تأخیر: زمان کل تا تکمیل تسک، نه فقط زمان اولین پاسخ. یک پاسخ سریع همیشه به معنای تکمیل سریع تسک نیست.
- معیارهای مصرف: ردیابی دقیق توکنهای بدون کش، کششده، نوشتن و خروجی. طول پاسخ قابل مشاهده اغلب استدلالها و ورودیهای تکراری را پنهان میکند.
- نتیجه: آیا نتیجه یک اصلاحیه پذیرفتهشده بود و هزینه کل به ازای هر نتیجه مفید چقدر بود؟
جریمههای متن طولانی
یک پرتگاه بودجه برای مخازن بزرگ وجود دارد. هر سه مدل وقتی ورودی از ۲۷۲ هزار توکن بیشتر شود، نرخهای بالاتری اعمال میکنند. در این نقطه، نرخ ورودی و کش دو برابر و نرخ خروجی ۱.۵ برابر میشود.
این بدان معناست که ارسال یک مخزن ۱ میلیون توکنی، یک تصمیم مالی کاملاً متفاوت از استفاده از یک بستر کاری ۱۰۰ هزار توکنی است. داشتن پنجره حداکثری بزرگتر، دلیلی برای گنجاندن تمام فایلها نیست. توسعهدهندگان تشویق میشوند که به جای تکیه بر حداکثر اندازه پنجره، محتوای متن خود را گلچین و مدیریت کنند.
چه زمانی به Astra ارتقا دهیم؟
مدل GPT-6 Astra باید فقط برای دسته خاصی از کارهای دشوار رزرو شود. ابتدا 6.1 Sol را برای عاملهای جدید مبتنی بر Responses یا جریانهای کاری Sol موجود که از استدلالهای پشتیبانیشده استفاده میکنند، تست کنید. Sol قدیمی را تنها در زمان مهاجرت نگه دارید، در صورتی که عامل تولیدی شما به استدلال 'none' یا فراخوانی ابزار در Chat Completions وابسته است.
ارتقا به Astra تنها زمانی باید رخ دهد که تحلیل شکستهای نماینده نشان دهد Sol با وجود دسترسی به متن لازم و ابزارهای فعال، نمیتواند نتیجه درستی تولید کند. هنگام ارتقا، به جای بازپخش یک ترنسکریپت عظیم، یک خلاصه فشرده، رویکردهای شکستخورده و شواهد تست را ارائه دهید.
برای جلوگیری از تخلیه بودجه، مسیرهای ارتقا باید سقف تعداد نوبتها و سقف هزینه سختگیرانهای داشته باشند. برای یک قانون بودجه ساده، هزینه کل تقسیم بر تسکهای پذیرفتهشده را در یک مجموعه تست یکسان مقایسه کنید. در این تله نیفتید که یک تسک را صرفاً به دلیل اینکه توضیح Astra پیچیدهتر و پیشرفتهتر به نظر میرسد، «ارزشمند» اعلام کنید.
سوالات متداول و ملاحظات نهایی
- آیا 6.1 Sol نصف قیمت است؟ خیر، فقط نرخ خواندن کش نصف شده است. سایر نرخهای استاندارد توکن بدون تغییر هستند.
- آیا Astra همیشه ۵ برابر گرانتر است؟ نرخهای ورودی معمولی، خروجی و نوشتن کش آن ۵ برابر Sol جدید است؛ اما خوانشهای کششده ۱۰ برابر است. هزینه کل تسک به رفتار مدل بستگی دارد.
- از کدام تنظیم استدلال استفاده کنیم؟ تلاشهای پشتیبانیشده موجود را حفظ کنید. هنگام جایگزینی 'none' یا 'minimal'، گزینه 'low' را ارزیابی کنید.
- آیا تمام تسکهای شکستخورده Sol باید به Astra بروند؟ خیر. ابتدا کمبود متن، ابزارهای خراب یا معیارهای پذیرش مبهم را برطرف کنید.
اگر از BeatAPI استفاده میکنید، مدلهای 6.1 Sol، Sol قدیمی و Astra را به صورت جداگانه بررسی کنید تا دفتر حسابات خود را بازنویسی کنید. به یاد داشته باشید که لایههای سرویس مستقیم OpenAI و کنترلهای اقامتی (residency controls) توسط فرمت درخواست سازگار یک درگاه (gateway) تضمین نمیشوند.
گام بعدی شما
- اگر از مدلهای Sol استفاده میکنید، سریعاً API خود را به
/v1/responsesمنتقل کنید تا قابلیت فراخوانی ابزارها قطع نشود. - یک بنچمارک داخلی با تسکهای شکستخورده بسازید تا نقطه بهینه بین Sol و Astra را برای بیزنس خود پیدا کنید.
- حجم متنی ارسالی را زیر ۲۷۲ هزار توکن نگه دارید تا با جریمه دوبرابر شدن قیمتها مواجه نشوید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو