اگر حجم زیادی از دادههای تکراری را به مدلهای زبانی میفرستید، صورتحساب شما همین امروز نصف شد. طبق مستندات فنی منتشرشده در ۳۰ سپتامبر ۲۰۲۶، هزینه توکنهای ورودی کششده در مدل GPT-6.1 Sol به ۰.۱۰ دلار بهازای هر میلیون توکن کاهش یافته است.
این اقدام استراتژیک OpenAI برای کاهش هزینههای عملیاتی در بارهای کاری با زمینه (Context) بزرگ و تکراری است. همانطور که در تحلیل قبلی ما دربارهی نقش ChatGPT بهعنوان یک فروشگاه اپلیکیشن برای میلیاردها کاربر اشاره کردیم، این شرکت اکنون روی زیرساختهای تجربه توسعهدهنده تمرکز کرده است. برای اکثر مهندسان، این تغییر شبیه جابهجایی از یک ابزار عمومی به یک ابزار دقیق است که در آن دقیقاً برای «زمان تفکر» مدل هزینه میپردازند.
جزئیات انتشار و زمینه
OpenAI مدل GPT-6.1 Sol را بهطور رسمی در جریان رویداد DevDay در ۲۹ سپتامبر ۲۰۲۶ معرفی کرد. این مدل بهعنوان نسخه جدیدتر خانواده Sol جایگزین مدل قبلی شده و اکنون تمامی ارجاعات صفحه GPT-6 Sol به نسخه ۶.۱ هدایت میشوند.
تمرکز اصلی این نسخه بر بهینهسازی تعادل میان تلاش برای استدلال، تأخیر و هزینه است. اگرچه معماری هسته مشابه نسل قبل است، اما پیادهسازی API تغییر کرده تا برای وظایف پیچیده، اولویت را از نقطه اتصال قدیمی Chat Completions به Responses API منتقل کند.
راهنمای مهاجرت فنی
توسعهدهندگانی که از gpt-6-sol به gpt-6.1-sol مهاجرت میکنند، باید چهار تغییر اصلی در کد خود اعمال کنند: بهروزرسانی شناسه مدل، نگاشت سطوح تلاش (Effort)، حذف پارامترهای نمونهگیری و انتقال فراخوانیهای ابزار. در این مسیر، رعایت استانداردهای سختگیرانه در استقرار کد حیاتی است؛ بهویژه با توجه به چهار قانون کلیدی برای جلوگیری از ورود کدهای معیوب هوش مصنوعی به محیط تولید که میتواند پایداری سیستمهای شما را تضمین کند.
برای تسهیل بازگشت سریع به نسخه قبلی در صورت بروز خطا، توصیه میشود شناسه مدل را در یک متغیر محیطی تعریف کنید: export OPENAI_MODEL_ID="gpt-6.1-sol". این کار اجازه میدهد در طول فاز ارزیابی، بهسرعت بین نسخهها جابهجا شوید.
مقایسه مشخصات فنی
بر اساس مستندات فنی، اکثر پارامترها در نسخه جدید ثابت ماندهاند اما برخی آستانهها و قابلیتها تغییر کردهاند:
- پنجره زمینه (Context Window) — مثل میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — در هر دو مدل ۱,۰۵۰,۰۰۰ توکن است. حداکثر ورودی ۹۲۲,۰۰۰ توکن و حداکثر خروجی ۱۲۸,۰۰۰ توکن است.
- محدودیت نرخ (Rate Limits): محدودیتها در تمامی سطوح (Tiers) بدون تغییر ماندهاند. در سطح Tier 1 مقدار ۵۰۰ RPM / ۵۰۰K TPM و در Tier 5 مقدار ۱۵,۰۰۰ RPM / ۴۰M TPM است.
- تاریخ قطع دانش: تاریخ قطع دادهها از ۲۰ آوریل ۲۰۲۶ به ۳۰ آوریل ۲۰۲۶ تغییر یافته است. این موضوع ایجاب میکند که برای هر اپلیکیشنی که به تاریخهای حساس وابسته است، ارزیابیها مجدداً اجرا شوند.
- قیمتگذاری: ورودی/خروجی استاندارد روی ۲/۱۰ دلار بهازای هر میلیون توکن باقی مانده و هزینه نوشتن کش (Cache Write) روی ۲.۵۰ دلار ثابت است.
تغییرات API و پیادهسازی
برای استفاده از مدل جدید، درخواستهای POST باید به نقطه اتصال https://api.openai.com/v1/responses ارسال شوند و شناسه مدل gpt-6.1-sol تعیین گردد. احراز هویت از طریق API Key در هدر Bearer انجام میشود.
مثال درخواست با curl:curl https://api.openai.com/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -d '{ "model": "gpt-6.1-sol", "reasoning":{"effort": "medium"}, "input": "List three ways a webhook retry policy can create duplicate orders. One line each." }'
مثال پیادهسازی با پایتون:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
بحرانیترین تغییر، حذف برخی سطوح تلاش برای استدلال است. GPT-6.1 Sol دیگر از تنظیمات none یا minimal پشتیبانی نمیکند. توسعهدهندگانی که از نسخه قبلی gpt-6-sol مهاجرت میکنند، باید هرگونه درخواست none یا minimal را به سطح low منتقل کنند. عدم انجام این کار منجر به خطاهای HTTP 400 خواهد شد، بهویژه برای کسانی که از سری Astra مهاجرت میکنند.
منطق نگاشت تلاش (Effort Mapping)
برای جلوگیری از توقف سرویس و خطاهای API، یک تابع نرمالسازی برای سطوح تلاش پیاده کنید. اگر باری از قبل از minimal یا none استفاده میکرد، ابتدا آن را به low هدایت کرده و سپس کیفیت و تأخیر را روی یک مجموعه داده نماینده ارزیابی کنید.
function normalizeEffort(effort) {
if (effort === "none" || effort === "minimal") {
return "low";
}
return effort || "medium";
}

سلسلهمراتب جدید استدلال
OpenAI نحوه تأثیر reasoning.effort بر عملکرد و هزینه را بازتعریف کرده است. در صورت عدم تعیین مقدار، سیستم بهطور پیشفرض روی medium قرار میگیرد. این متغیر محرک اصلی هزینه، تأخیر و کیفیت است:
- Low: برای چت، استخراج و طبقهبندی طراحی شده است. این سطح جایگزین بارهای کاری است که قبلاً از
noneاستفاده میکردند. در گفتگوهای علامتگذاریشده، نرخ خطای واقعی از ۱۱.۴٪ به ۷.۷٪ کاهش یافت. - Medium: تنظیم پیشفرض. برای اتوماسیون عاملها و فراخوانی ابزار بهینه شده است. در محک AutomationBench 1.0.6، این سطح ۲.۲ درصد بهتر از Claude Opus 5.5 با تقریباً یکسوم هزینه آن عمل کرد و ۴.۸ درصد بهتر از GPT-6 Sol در پیکربندی مشابه بود.
- High: مخصوص برنامهریزی عمیق و عیبیابی پیچیده است.
- XHigh: برای وظایف طولانیمدت نامتقارن و تصمیمگیری بر اساس شواهد متناقض استفاده میشود. برای خروجیهای نهایی و صیقلخورده توصیه میشود.
- Max: هدفگذاری شده برای وظایف علمی و استفاده از کامپیوتر. در OSWorld 2.0، این سطح ۷ درصد بهتر از GPT-6 Sol با کمتر از نصف هزینه آن بود.
برای کارهای علمی بسیار سخت، همچنان مدل GPT-6 Astra توصیه میشود، زیرا Astra بالاترین امتیاز ۶۸.۱٪ را در مجموعه داده Terminal-Bench Science حفظ کرده است.
جزئیات قیمتگذاری و سطوح سرویس
در حالی که قیمتهای استاندارد ورودی و خروجی روی ۲ و ۱۰ دلار بهازای هر میلیون توکن باقی ماندهاند، دینامیک کش تغییر کرده است. هزینه نوشتن کش روی ۲.۵۰ دلار ثابت است، اما هزینه خواندن از ۰.۲۰ دلار به ۰.۱۰ دلار سقوط کرده است.
چهار سطح سرویس برای مدیریت تأخیر و هزینه ارائه شده است:
- Standard: قیمت پایه (۲ دلار ورودی / ۱۰ دلار خروجی).
- Batch: ۵۰٪ ارزانتر (۱ دلار ورودی / ۵ دلار خروجی)، ایدهآل برای پردازشهای شبانه از طریق Batch API.
- Flex: مشابه قیمت Batch (۱ دلار ورودی / ۵ دلار خروجی) برای بارهای کاری منعطف.
- Fast: دو برابر هزینه ورودی (۴ دلار) و دو برابر هزینه خروجی (۲۰ دلار) برای دسترسی اولویتدار. نام مستعار "priority" نیز برای این سطح پذیرفته میشود. توجه داشته باشید که سطح Fast برای اقامت دادهها در اتحادیه اروپا (EU) در دسترس نیست.
جریمه زمینه بالا (High-Context Surcharge):
هر پرامپتی که از ۲۷۲,۰۰۰ توکن ورودی فراتر رود، باعث افزایش قیمت میشود. برای این درخواستها، هزینههای ورودی و کش دو برابر میشود (مثلاً ورودی استاندارد ۴ دلار، ورودی کششده ۰.۲۰ دلار و نوشتن کش ۵.۰۰ دلار میشود) و هزینه خروجی برای کل درخواست ۱.۵ برابر افزایش مییابد (مثلاً خروجی استاندارد ۱۵ دلار میشود).
مکانیزمهای کشینگ پرامپت
هزینه خواندن کش در GPT-6.1 Sol اکنون ۰.۰۵ برابر قیمت ورودی است، در حالی که در GPT-6 Sol این مقدار ۰.۱ بود. هزینه نوشتن کش برای هر دو مدل ۱.۲۵ برابر قیمت ورودی است.
برای واجد شرایط شدن جهت کشینگ، قوانین زیر اعمال میشود:
- حداقل پیشوند کش باید ۱,۰۲۴ توکن باشد.
- یک پیشوند حداقل ۳۰ دقیقه پس از آخرین نوشتن یا استفاده مجدد، واجد شرایط کشینگ میشود.
مثال مقایسه هزینه:
برای یک پرامپت سیستمی ۵۰,۰۰۰ توکنی که در ۱,۰۰۰ درخواست تکرار میشود:
- یکبار نوشتن کش: ۰.۱۲۵ دلار (در هر دو مدل یکسان).
- ۹۹۹ بار خواندن کش در GPT-6 Sol: ۹.۹۹ دلار.
- ۹۹۹ بار خواندن کش در GPT-6.1 Sol: ۵.۰۰ دلار.
فراخوانی ابزار و Responses API
یکی از تغییرات ساختاری برای توسعهدهندگان، نحوه مدیریت فراخوانی تابع (Function Calling) است. در GPT-6 Sol، این قابلیت در Chat Completions تنها زمانی فعال بود که reasoning_effort روی none باشد. چون نسخه ۶.۱ دیگر none را پشتیبانی نمیکند، تمام گردشکارهای ابزار باید به Responses API منتقل شوند. در پیادهسازی این عاملها، امنیت دادهها اولویت دارد و توصیه میشود از لایه حذف دادههای حساس برای توقف نشت اطلاعات در عاملهای هوش مصنوعی استفاده کنید تا حریم خصوصی کاربران حفظ شود.
در این مسیر، توسعهدهندگان باید پارامترهای نمونهگیری را در صورتی که تلاش (effort) برابر با none نیست، حذف کنند. بهطور مشخص موارد زیر را حذف کنید:
temperature(دما)top_ptop_logprobslogprobs
مثال انتقال بدنه درخواست:
از: { "model": "gpt-6-sol", "reasoning_effort": "none", "temperature": 0, "top_p": 1, "input": "..." }
به: { "model": "gpt-6.1-sol", "reasoning": { "effort": "low" }, "input": "..." }
استراتژی تست و پیادهسازی
OpenAI برای انتقال امن، استفاده از ابزارهایی مانند Apidog را پیشنهاد میکند تا مقایسههای موازی (Side-by-side) اجرا شوند. توسعهدهندگان باید حداقل ۲۵,۰۰۰ توکن را برای مجموع استدلال و خروجی در فاز تست اختصاص دهند تا از پاسخهای incomplete ناشی از محدودیتهای max_output_tokens جلوگیری شود.
چکلیست مدیریت پاسخ:
- تأیید وضعیت
completed؛ در صورتincompleteبررسی دلیل درincomplete_details.reasonبرای مقدارmax_output_tokens. - پاسخ یک آرایه است؛ برای خواندن متن، آیتمی با
type: "message"را بیابید تاoutput_textرا بخوانید، بهجای تکیه بر جایگاه آیتم در آرایه. - توکنهای خروجی (
usage.output_tokens) شامل توکنهای استدلال است؛ برای تفکیک دقیق بهusage.output_tokens_details.reasoning_tokensمراجعه کنید. - برای ردیابی صرفهجوییها،
usage.input_tokens_detailsرا برایcached_tokensوcache_write_tokensمانیتور کنید.
تست رگرسیون در Apidog:
توسعهدهندگان میتوانند محیطی با متغیرهای MODEL_ID و EFFORT ایجاد کنند تا بین gpt-6-sol و gpt-6.1-sol جابهجا شوند. با افزودن تأییدیههای (Assertions) مربوط به HTTP 200، وضعیت completed و خروجی JSON معتبر، تیمها میتوانند مهاجرت را خودکار کنند.
پیکربندی در Apidog
برای راهاندازی یک تست قدرتمند در Apidog، از ساختار درخواست زیر استفاده کنید:
- نقطه اتصال: POST
https://api.openai.com/v1/responses - هدرها:
Authorization: Bearer {{OPENAI_API_KEY}}وContent-Type: application/json - بدنه:
{ "model": "{{MODEL_ID}}", "reasoning": { "effort": "{{EFFORT}}" }, "max_output_tokens": 25000, "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key." }
تأییدیه های لازم (Assertions):
- وضعیت HTTP برابر ۲۰۰ باشد.
$.statusبرابرcompletedباشد.$.output[*].typeشاملmessageباشد.$.usage.output_tokensبزرگتر از ۰ باشد.$.usage.output_tokens_details.reasoning_tokensوجود داشته باشد.- خروجی JSON معتبر باشد و کلیدهای مورد نیاز (مانند
riskوfix) را داشته باشد.
یک اسکریپت پس از پاسخ میتواند هزینه دقیق هر فراخوانی را محاسبه کند:const u = pm.response.json().usage; const d = u.input_tokens_details || {}; const cached = d.cached_tokens || 0; const writes = d.cache_write_tokens || 0; const model = pm.environment.get("MODEL_ID"); const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20; const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate + writes * 2.5 + u.output_tokens * 10) / 1e6; console.log(model, "cost per call $", cost.toFixed(5));
برای ادغام در CI/CD، میتوان از Apidog CLI برای اجرای تستهای سناریو روی هر دو مدل استفاده کرد:apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" --env-var "MODEL_ID=gpt-6-sol" -r cli,junitapidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
پرسشهای متداول و ملاحظات نهایی
آیا GPT-6.1 Sol گرانتر از نسخه قبلی است؟
خیر. هر دو مدل قیمت ۲ دلار ورودی و ۱۰ دلار خروجی بهازای هر میلیون توکن را دارند. در واقع GPT-6.1 Sol برای بارهای کاری با کش زیاد، بهدلیل نرخ ۰.۱۰ دلار برای ورودیهای کششده، ارزانتر است.
در مورد سطح "Ultrafast" چه میگوییم؟
سطح Ultrafast در حال حاضر برای GPT-6 Astra در دسترس است و برای GPT-6.1 Sol با عبارت "coming soon" (بهزودی) علامتگذاری شده است.
آیا میتوان از Chat Completions استفاده کرد؟
بله، اما فقط برای درخواستهایی که از ابزارها (Tools) استفاده نمیکنند. تمام فراخوانیهای ابزار باید از Responses API استفاده کنند.
این چرخش در قیمتگذاری و ساختار API نشان میدهد که OpenAI اولویت را به «محاسبات زمان تست» (Test-time Compute) داده است؛ این ایده که اجازه دادن به مدل برای تفکر بیشتر (با هزینه کنترلشده) ارزشمندتر از افزایش صرفِ اندازه مدل است. برای کاربر نهایی، این یعنی عاملهای قابلاعتمادتر که در توالیهای پیچیده ابزار، کمتر دچار توهم (Hallucination) — یعنی وقتی مدل با اطمینان چیزی میگوید که وجود ندارد — میشوند.
اگر یک استک تولیدی (Production Stack) را مدیریت میکنید، اولین قدم شما باید بازبینی تنظیمات فعلی reasoning_effort و بهروزرسانی نقاط اتصال API به Responses API باشد تا از قطع شدن خط لولههای فراخوانی ابزار جلوگیری شود.
گام بعدی شما
- حسابهای تولیدی خود را برای شناسایی درخواستهایی با
reasoning_effort: noneیاminimalبازبینی و آنها را بهlowتغییر دهید. - تمامی فراخوانیهای تابع (Tool Calls) را از Chat Completions به Responses API منتقل کنید تا از قطع سرویس جلوگیری شود.
- هزینه توکنهای ورودی را با استفاده از
usage.input_tokens_details.cached_tokensدر مدل جدید مانیتور کنید تا میزان صرفهجویی را بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو