پرش به محتوای اصلی
پرش به محتوای مقاله

«تغییر در Responses API»؛ شرط جدید OpenAI برای فراخوانی ابزارها

·۸ مهر ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
راهنما
نحوه استفاده از API GPT-6.1 Sol: راهنمای توسعه‌دهندگان برای یکپارچه‌سازی مدل زبانی پیشرفته
نحوه استفاده از API GPT-6.1 Sol: راهنمای توسعه‌دهندگان برای یکپارچه‌سازی مدل زبانی پیشرفته
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۵۰ درصدی هزینه توکن‌های کش‌شده و حذف کامل حالت استدلال 'بدون تلاش' (none)؛ یعنی هر پاسخ اکنون باید حداقل یک لایه تفکر تحلیل‌گر داشته باشد.

اگر امروز برای پردازش حجم عظیمی از داده‌ها در پرامپت‌های تکراری هزینه می‌پردازید، صورت‌حساب شما از این ماه نصف می‌شود. OpenAI با معرفی مدل GPT-6.1 Sol، هزینه توکن‌های ورودی کش‌شده (Cached Input) را از ۰.۲۰ به ۰.۱۰ دلار به‌ازای هر میلیون توکن کاهش داد. طبق راهنمایی که در ۳۰ سپتامبر ۲۰۲۶ منتشر شد، این تغییر نشان‌دهنده فشار OpenAI برای ارزان‌تر کردن پرامپت‌های با بافت طولانی و فرکانس بالا در محیط‌های عملیاتی است. این مدل رسماً در جریان رویداد DevDay در ۲۹ سپتامبر ۲۰۲۶ رونمایی شد.

این به‌روزرسانی در حالی رخ می‌دهد که OpenAI در حال بهینه‌سازی لایه‌های تخصصی مدل‌های خود است. همان‌طور که در تحلیل قبلی ما درباره تبدیل شدن ChatGPT به یک فروشگاه اپلیکیشن برای ۱.۲ میلیارد کاربر اشاره کردیم، تمرکز این شرکت اکنون بر اقتصاد خرد استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دوره آموزش آشپز — در سطح API است. برای توسعه‌دهندگان، این تغییر مثل تبدیل نرخ قبض برق خانگی به نرخ تخفیف‌دار صنعتی برای داده‌هایی است که قبلاً یک‌بار پردازش شده‌اند.

یکپارچه‌سازی API و قیمت‌گذاری

برای دسترسی به این مدل، توسعه‌دهندگان باید درخواست‌های POST خود را به Responses API در آدرس https://api.openai.com/v1/responses با استفاده از شناسه مدل gpt-6.1-sol و یک توکن Bearer ارسال کنند. در حالی که قیمت ورودی و خروجی استاندارد روی ۲ و ۱۰ دلار به‌ازای هر میلیون توکن باقی مانده، هزینه نوشتن در کش (Cache Write) روی ۲.۵۰ دلار به‌ازای هر میلیون توکن ثابت شده است.

به گزارش OpenAI، چهار سطح سرویس برای مدیریت تأخیر و هزینه از طریق پارامتر service_tier تعریف شده است:

  • Standard: تجربه پایه و استاندارد.
  • Batch: ۵۰٪ ارزان‌تر (۱ دلار ورودی / ۵ دلار خروجی) برای کارهای غیرهمزمان یا شبانه از طریق Batch API.
  • Flex: قیمت مشابه Batch (۱ دلار ورودی / ۵ دلار خروجی) برای حجم‌های کاری خاص.
  • Fast: هزینه ورودی دو برابر (۴ دلار) در مقابل اولویت در پردازش و پهنای باند بالاتر. این سطح همچنین عبارت "priority" را به عنوان نام مستعار می‌پذیرد. توجه داشته باشید که سطح Fast در مناطق با اقامت داده‌های UE (اتحادیه اروپا) در دسترس نیست.

نحوه استفاده از API GPT-6.1 Sol: راهنمای کدنویسی با هوش مصنوعی پیشرفته

پرامپت‌هایی که از ۲۷۲,۰۰۰ توکن فراتر روند، با جهش قیمتی مواجه می‌شوند؛ به‌طوری که نرخ ورودی و کش دو برابر و نرخ خروجی ۱.۵ برابر برای کل درخواست افزایش می‌یابد. همچنین حالت «Ultrafast» به‌زودی برای این مدل عرضه خواهد شد، هرچند در حال حاضر برای مدل GPT-6 Astra در دسترس‌تر است.

چرخش در استراتژی تلاش استدلالی

یکی از حیاتی‌ترین تغییرات در GPT-6.1 Sol، حذف تنظیمات none و minimal برای پارامتر reasoning.effort است. توسعه‌دهندگان باید این تنظیمات قدیمی را به low تغییر دهند تا با خطای HTTP 400 مواجه نشوند. تنظیم پیش‌فرض مدل روی medium است.

OpenAI سلسله‌مراتب مشخصی را برای انتخاب سطح تلاش بر اساس نوع وظیفه ارائه داده است:

  • Low: مناسب برای چت، استخراج داده و طبقه‌بندی. نرخ خطاهای واقعی در این سطح از ۱۱.۴٪ در GPT-6 Sol به ۷.۷٪ در این لایه کاهش یافته است (بر اساس گفتگوهایی که قبلاً برای خطاها علامت‌گذاری شده بودند).
  • Medium: تنظیم پیش‌فرض، بهینه برای اتوماسیون عامل‌ها (Agents) و گردش‌کارهای فراخوانی ابزار. این سطح در محک AutomationBench 1.0.6 با یک‌سوم هزینه، ۲.۲ درصد بهتر از Claude Opus 5.5 عمل کرد و ۴.۸ درصد نسبت به GPT-6 Sol بهبود یافت.
  • High: مخصوص دیباگ‌های پیچیده و برنامه‌ریزی عمیق.
  • XHigh: برای خروجی‌های نهایی صیقل‌خورده و اجراهای طولانی غیرهمزمان.
  • Max: طراحی شده برای استفاده از کامپیوتر و علوم سخت. در OSWorld 2.0، این سطح ۷ درصد نسبت به GPT-6 Sol بهبود یافته است. در Terminal-Bench Science 0.1، هزینه هر تسک در این سطح ۵.۴۷ دلار است، در حالی که برای Opus 5.5 مبلغ ۲۳.۲۱ دلار و برای GPT-6 Astra مبلغ ۲۳.۸۰ دلار است.

الزامات مهاجرت کد

برای انتقال از gpt-6-sol به نسخه جدید، چهار تغییر در کد ضروری است تا پایداری سیستم حفظ شده و از شکست API جلوگیری شود:

۱. به‌روزرسانی شناسه مدل: جایگزینی ID در پیکربندی‌ها یا متغیرهای محیطی (مثلاً export MODEL_ID="gpt-6.1-sol") برای امکان بازگشت سریع (Rollback).
۲. نرمال‌سازی تلاش: تمام پارامترهای تلاش none یا minimal باید به low نگاشت شوند. این موضوع حیاتی است زیرا ارسال none به GPT-6 Astra یا GPT-6.1 Sol منجر به خطای HTTP 400 می‌شود.
۳. حذف پارامترهای نمونه‌برداری: اگر سطح تلاش روی none نباشد، پارامترهایی مثل دما (Temperature)، top_p ،top_logprobs و logprobs دیگر پذیرفته نمی‌شوند. برای مثال، یک درخواست حاوی "temperature": 0.2 در کنار "effort": "low" با شکست مواجه خواهد شد.
۴. تغییر مکان فراخوانی ابزار: فراخوانی ابزار از Chat Completions جدا شده است. در حالی که GPT-6 Sol اجازه فراخوانی تابع در Chat Completions را تنها زمانی می‌داد که استدلال غیرفعال بود، GPT-6.1 Sol الزام می‌کند که تمام درخواست‌های مبتنی بر ابزار به Responses API منتقل شوند.

مشخصات فنی و پیاده‌سازی

طبق راهنمای فنی، این مدل پنجره متنی (Context Window) — مثل میز کاری که فقط تعداد مشخصی ورق روی آن جا می‌شود — یک میلیون و ۵۰ هزار توکنی دارد. حداکثر ورودی ۹۲۲,۰۰۰ و حداکثر خروجی ۱۲۸,۰۰۰ توکن است. محدودیت‌های نرخ (Rate Limits) بدون تغییر باقی مانده‌اند: سطح ۱ اجازه ۵۰۰ RPM / 500K TPM و سطح ۵ اجازه ۱۵,۰۰۰ RPM / 40M TPM را می‌دهد.

تاریخ قطع دانش مدل نیز از ۲۰ آوریل ۲۰۲۶ به ۳۰ آوریل ۲۰۲۶ افزایش یافته است. این پنجره ۱۰ روزه ایجاب می‌کند که توسعه‌دهندگان ارزیابی‌هایی را که به تاریخ‌های بسیار اخیر حساس هستند، مجدداً تست کنند.

برای کسانی که به اوج عملکرد علمی نیاز دارند، OpenAI همچنان GPT-6 Astra را توصیه می‌کند که امتیاز ۶۸.۱٪ را در Terminal-Bench Science 0.1 کسب کرده و از سری Sol پیشی گرفته است.

در پیاده‌سازی با cURL، ساختار درخواست به این شکل است:
curl https://api.openai.com/v1/responses -H "Content-Type: application/json" -H "Authorization: Bearer $OPENAI_API_KEY" -d '{ "model": "gpt-6.1-sol", "reasoning": {"effort": "medium"}, "input": "List three ways a webhook retry policy can create duplicate orders. One line each." }'

برای توسعه‌دهندگان پایتون، پیاده‌سازی SDK به این صورت است:

from openai import OpenAI
client = OpenAI()
response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)

هنگام پردازش پاسخ، توسعه‌دهندگان باید این فیلدهای خاص را رصد کنند:

  • Status: باید completed باشد. اگر محدودیت خروجی فعال شود، به incomplete تغییر کرده و incomplete_details.reason روی max_output_tokens تنظیم می‌شود.
  • Output: این یک آرایه است. توسعه‌دهندگان باید به دنبال آیتمی با type: "message" بگردند و output_text را بر اساس نوع بخوانند، نه بر اساس ایندکس آرایه.
  • Usage: مقدار output_tokens شامل توکن‌های استدلالی است. فیلد output_tokens_details.reasoning_tokens تعداد دقیق توکن‌های استدلال را ارائه می‌دهد. همچنین input_tokens_details مقادیر cached_tokens و cache_write_tokens را برای محاسبه هزینه فراهم می‌کند.

OpenAI پیشنهاد می‌کند در طول آزمایشات، حداقل ۲۵,۰۰۰ توکن برای استدلال و خروجی در نظر بگیرید. برای تغییر سطح تلاش در میانه یک گفتگو بدون شکستن کش پرامپت، به جای تغییر reasoning.effort در سطح درخواست، از آیتم ورودی configuration_update استفاده کنید.

تحلیل: هزینه هوشمندی

این به‌روزرسانی نشان‌دهنده یک تغییر استراتژیک در نگاه OpenAI به «استدلال» به عنوان یک کالا است. با کاهش شدید هزینه‌های کش و اجبار به حداقل تلاش استدلالی در سطح low، OpenAI در واقع سطح پایه‌ای از تفکر سیستم ۲ (System 2 thinking) را به استاندارد جدید صنعت تبدیل می‌کند.

برای کیف پول توسعه‌دهنده، تخفیف ۵۰ درصدی کش داستان اصلی است. در سناریویی با یک پرامپت سیستمی ۵۰,۰۰۰ توکنی که در ۱,۰۰۰ درخواست استفاده می‌شود:

  • نوشتن در کش: ۰.۱۲۵ دلار (برای هر دو مدل یکسان).
  • خوانش در GPT-6 Sol: ۹۹۹ خوانش با نرخ ۰.۲۰/1M = ۹.۹۹ دلار.
  • خوانش در GPT-6.1 Sol: ۹۹۹ خوانش با نرخ ۰.۱۰/1M = ۵.۰۰ دلار.

حداقل پیشوندهای قابل کش ۱,۰۲۴ توکن هستند و حداقل ۳۰ دقیقه پس از آخرین استفاده معتبر می‌مانند. این امر باعث می‌شود عامل‌های پیچیده و پرامپت-محور برای مقیاس بالا بسیار کاربردی‌تر شوند.

با این حال، حذف سطح تلاش none نشان می‌دهد که OpenAI از پاسخ‌های «سریع و کم‌هوش» فاصله می‌گیرد. هر تعامل اکنون دارای یک سربار استدلالی حداقلی است که ممکن است تأخیر را برای ساده‌ترین وظایف کمی افزایش دهد، اما قابلیت اطمینان واقعی (Factual Reliability) را بهبود می‌بخشد.

تست و اعتبارسنجی

برای اطمینان از انتقال بدون مشکل، توسعه‌دهندگان باید از ابزارهایی مانند Apidog برای مقایسه‌های موازی استفاده کنند. یک تست پیشنهادی شامل ایجاد محیطی با متغیرهای MODEL_ID و EFFORT و اجرای درخواستی است که یک شیء JSON با کلیدهای risk و fix برای یک سیاست خاص برگرداند.

باید تأییدیه‌هایی (Assertions) برای موارد زیر اضافه شود:

  • وضعیت HTTP 200 و وضعیت completed.
  • وجود message در $.output[*].type.
  • مقدار $.usage.output_tokens بزرگتر از صفر باشد.
  • خروجی JSON معتبر حاوی کلیدهای مورد نیاز برنامه باشد.

برای محاسبه هزینه دقیق هر فراخوانی در Apidog، می‌توان از یک اسکریپت پس‌پردازش استفاده کرد:

const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ( (u.input_tokens - cached - writes) * 2 + cached * cachedRate + writes * 2.5 + u.output_tokens * 10 ) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));

برای یکپارچه‌سازی با CI/CD، می‌توان از Apidog CLI برای اجرای پرامپت‌های عملیاتی روی هر دو مدل با استفاده از پرچم --env-var برای بازنویسی MODEL_ID در هر اجرا استفاده کرد:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" --env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit

این کار اجازه می‌دهد گزارش‌های JUnit توکن‌های استدلالی، توکن‌های خروجی، تأخیر و هزینه هر درخواست را بین هر دو نسخه قبل از انتقال ترافیک عملیاتی مقایسه کنند. اگر در حال نگاشت none به low هستید، یک خط پایه (Baseline) با none روی GPT-6 Sol و یک کاندید با low روی GPT-6.1 Sol اجرا کنید تا تأثیر آن بر کیفیت و سرعت را بسنجید.

گام بعدی شما

  • تمام درخواست‌های API خود را بررسی کنید و مقادیر none در reasoning.effort را به low تغییر دهید.
  • اگر از پرامپت‌های سیستمی طولانی (بالای ۱۰ هزار توکن) استفاده می‌کنید، هزینه ماهانه خود را با نرخ جدید ۰.۱۰ دلار بازبینی کنید.
  • برای کارهای علمی حساس، خروجی‌های GPT-6.1 Sol را با GPT-6 Astra مقایسه کنید تا نقطه بهینه هزینه و دقت را بیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار زیرساختی OpenAI، هزینه عملیاتی عامل‌های هوشمند را به‌شدت کاهش می‌دهد. در نتیجه، استقرار مدل‌های استدلالی در برنامه‌های کاربردی واقعی از نظر اقتصادی توجیه‌پذیرتر می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی برای بهره‌مندی از این کاهش هزینه باید از واسط‌های معتبر یا سرورهای خارج از کشور استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

اجباری کردن حداقل سطح استدلال 'low' نشان می‌دهد OpenAI دیگر به پاسخ‌های «سریع اما سطحی» اهمیتی نمی‌دهد. با ارزان کردن حافظه، شرکت در واقع تفکر سیستم ۲ (تفکر کند و تحلیل‌گر) را به استاندارد پیش‌فرض صنعت تبدیل می‌کند تا نرخ توهم را در مقیاس تجاری کاهش دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.