پرش به محتوای اصلی
پرش به محتوای مقاله

«مهاجرت به API Responses»؛ شرط حفظ قابلیت فراخوانی ابزار در GPT-6.1

·۸ مهر ۱۴۰۵۷ دقیقه مطالعه
راهنما
مقایسه هزینه و مهاجرت بین عوامل کدنویسی GPT-6.1 Sol، GPT-6 Sol و Astra
مقایسه هزینه و مهاجرت بین عوامل کدنویسی GPT-6.1 Sol، GPT-6 Sol و Astra
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۵۰ درصدی هزینه خواندن کش در مدل Sol و اجباری شدن API جدید Responses برای فراخوانی ابزارها؛ این یعنی کاهش هزینه برای بارهای کاری طولانی در ازای تغییر زیرساخت فنی.

اگر امروز برای اجرای عامل‌های کدنویس هزینه می‌پردازید، صورت‌حساب شما برای توکن‌های تکراری از ماه آینده نصف می‌شود. این تغییر در مدل GPT-6.1 Sol، بازی را از رقابت بر سر «هوش مطلق» به رقابت بر سر «هزینه هر اصلاحیه پذیرفته‌شده» تغییر می‌دهد.

انتخاب بین GPT-6.1 Sol و GPT-6 Astra دیگر به این نیست که کدام مدل باهوش‌تر است، بلکه به این برمی‌گردد که آیا نرخ موفقیت یک مدل، قیمت بالای توکن‌هایش را توجیه می‌کند یا خیر. این یک چارچوب انتخاب بر اساس سازگاری و هزینه تکمیل تسک است، نه ادعایی بر اساس یک بنچمارک ساده سه مدلی. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش قیمت‌های ورودی کش‌شده اشاره کردیم، صنعت به سمت عامل‌های مبتنی بر پاسخ (Responses-based) حرکت می‌کند. در این محیط، هدف کم کردن هزینه کل یک تسک است — یعنی مجموع هزینه تلاش‌های موفق و شکست‌خورده و تکرارها — نه فقط نگاه کردن به قیمت هر میلیون توکن. مفیدترین مقایسه این است که آیا عامل شما سازگار می‌ماند، هزینه نهایی تسک چقدر است و آیا اصلاحیه حاصله از تست‌های پذیرش شما عبور می‌کند یا خیر. این رویکرد در واقع تکامل همان بحث‌هایی است که در مقایسه مدل‌های کدنویسی از نظر مقرون‌به‌صرفه بودن به آن پرداختیم.

تصور کنید عامل شما مثل یک برنامه‌نویس تازه‌کار است؛ شما نمی‌خواهید برای هر خط کد ساده، حقوق یک معمار ارشد (نرخ Astra) پرداخت کنید، اما نمی‌توانید برنامه‌نویسی را تحمل کنید که ۱۰ بار در تست‌ها شکست می‌خورد. استراتژی جدید، ایجاد یک مسیر ارتقای تأییدشده است: با مدل ارزان شروع کنید و فقط وقتی تسک واقعاً دشوار شد، به مدل گران بروید.

کالبدشکافی قیمت‌ها

به نقل از مستندات بررسی‌شده در ۳۰ سپتامبر ۲۰۲۶، تفاوت قیمتی این مدل‌ها بسیار شدید است. اگرچه OpenAI مدل Sol جدید را برای کارهای پیچیده کدنویسی، استفاده از کامپیوتر و کارهای حرفه‌ای نزدیک به Astra قرار داده است، اما برنده مطلقی برای نوشتن، بررسی مخازن کد (Repository Review) یا دیباگ‌های دشوار تعیین نکرده است.

جزئیات قیمت‌ها به شرح زیر است:

  • GPT-6 Sol (قدیمی): شناسه API مدل gpt-6-sol است. نرخ ورودی/خروجی ۲/۱۰ دلار به ازای هر میلیون توکن است؛ ورودی کش‌شده ۰.۲۰ دلار و نوشتن کش ۲.۵۰ دلار است. پنجره متن (Context) و حداکثر خروجی برابر با ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است.
  • GPT-6.1 Sol: شناسه API مدل gpt-6.1-sol است. نرخ ورودی/خروجی همان ۲/۱۰ دلار باقی مانده است؛ اما نرخ ورودی کش‌شده به نصف کاهش یافته و به ۰.۱۰ دلار رسیده است؛ نوشتن کش ۲.۵۰ دلار است. پنجره متن و حداکثر خروجی ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است.
  • GPT-6 Astra: شناسه API مدل gpt-6-astra است. نرخ ورودی/خروجی ۱۰/۵۰ دلار است؛ ورودی کش‌شده ۱.۰۰ دلار و نوشتن کش ۱۲.۵۰ دلار است. پنجره متن و حداکثر خروجی ۱,۰۵۰,۰۰۰ / ۱۲۸,۰۰۰ توکن است.

مقایسه هزینه و مهاجرت بین مدل‌های کدنویسی GPT-6.1 Sol، GPT-6 Sol و Astra

در حالی که نرخ‌های استاندارد ورودی و خروجی برای سری Sol بدون تغییر مانده است، کاهش ۵۰ درصدی نرخ خواندن کش، تأثیر قابل‌توجهی روی بارهای کاری با متن طولانی دارد. با این حال، اگر هیچ خوانشی از کش صورت نگیرد، نرخ‌های توکن ذکر شده صورت‌حساب یکسانی ایجاد می‌کنند. همچنین باید توجه داشت که اگر نحوه استدلال تغییر کند یا مدل پاسخ‌های طولانی‌تری بنویسد، نرخ‌های برابر به معنای هزینه برابر نخواهد بود.

برای یک بار کاری معمولی با متن کوتاه — شامل ۱۰۰,۰۰۰ توکن بدون کش، ۹۰۰,۰۰۰ خوانش از کش و ۵۰,۰۰۰ توکن خروجی — هزینه‌ها به این شکل محاسبه می‌شود:

  • GPT-6 Sol: مبلغ ۰.۲۰۰ دلار (بدون کش) + ۰.۱۸۰ دلار (کش) + ۰.۵۰۰ دلار (خروجی) = ۰.۸۸۰ دلار
  • GPT-6.1 Sol: مبلغ ۰.۲۰۰ دلار (بدون کش) + ۰.۰۹۰ دلار (کش) + ۰.۵۰۰ دلار (خروجی) = ۰.۷۹۰ دلار
  • GPT-6 Astra: مبلغ ۱.۰۰۰ دلار (بدون کش) + ۰.۹۰۰ دلار (کش) + ۲.۵۰۰ دلار (خروجی) = ۴.۴۰۰ دلار

در این سناریو، مدل GPT-6.1 Sol تقریباً ۱۰.۲٪ ارزان‌تر از Sol قدیمی و حدود ۸۲٪ ارزان‌تر از Astra است. البته هیچ‌کدام از این درصدها پیش‌بینی‌کننده صرفه‌جویی در سطح تسک نیستند، زیرا ممکن است مدل‌ها مقادیر متفاوتی از استدلال مصرف کنند یا به تعداد دفعات متفاوتی برای موفقیت نیاز داشته باشند.

مرز مهاجرت فنی

سوییچ به مدل جدید فقط یک تغییر نام ساده نیست. GPT-6.1 Sol و Astra برای فراخوانی ابزار (Tool Call) به نقطه اتصال (Endpoint) جدید Responses نیاز دارند و دیگر از استدلال «none» پشتیبانی نمی‌کنند.

بر اساس مستندات، اگر یکپارچگی فعلی شما از API Chat Completions با استدلال غیرفعال استفاده می‌کند، جایگزینی مستقیم مدل باعث شکست عامل شما می‌شود. برای مثال، درخواستی که از model: "gpt-6-sol" به همراه reasoning_effort: "none" و فراخوانی ابزارها از طریق Chat Completions استفاده می‌کند، در نسخه 6.1 Sol پشتیبانی نمی‌شود.

یک درخواست مهاجرت‌یافته اکنون باید از ساختار ابزار Responses و یک سطح استدلال پشتیبانی‌شده، مانند 'low'، استفاده کند. یک درخواست صحیح مهاجرت‌یافته به این شکل خواهد بود:

{ model: "gpt-6.1-sol", reasoning: {"effort": "low"}, input: "Run the tests and explain the first failure. Do not edit files yet.", tools: [ { type: "function", name: "run_tests", ... strict: true } ] }

این درخواست‌ها باید به نقطه اتصال /v1/responses ارسال شوند. برنامه شما باید خروجی تایپ‌شده را بررسی کرده، یک تابع مجاز را اجرا کند و function_call_output را با call_id متناظر بازگرداند. توجه داشته باشید که یک اسکیمای نام‌گذاری شده مانند run_tests به تنهایی نمی‌تواند تست‌های شما را اجرا کند؛ شما باید کل مسیر رفت و برگشت از درخواست ابزار تا پاسخ نهایی را تأیید کنید.

ارزیابی موفقیت

برای اینکه بفهمید کدام مدل واقعاً پول شما را ذخیره می‌کند، توسعه‌دهندگان باید از یک آزمایش کنترل‌شده با یک تست شکست‌خورده شناخته‌شده استفاده کنند. یک مورد تست پیشنهادی، تابعی برای تکه‌تکه کردن (chunk) است که از range(0, len(items) - size, size) استفاده می‌کند؛ این تابع تکه نهایی را گم می‌کند و زمانی که طول ورودی برابر با اندازه تکه باشد، شکست می‌خورد. از هر مدل بخواهید بدون تغییر دادن تست‌ها، مشکل را تشخیص داده و آن را برطرف کند.

برای اطمینان از مقایسه عادلانه، کامیت مخزن، دسترسی‌های ابزار، پرامپت، مجموعه تست، سقف تعداد نوبت‌ها (turn cap) و بودجه خروجی را یکسان نگه دارید. به جای اینکه پیش‌فرض هر مدل را معادل بدانید، میزان تلاش برای استدلال (reasoning effort) را ثبت کنید. هنگام اجرای این بنچمارک، باید بیش از پاسخ نهایی را ثبت کنید:

  • هزینه کل: هزینه تمام تلاش‌ها، شامل اصلاحات شکست‌خورده و تکرارها. هزینه را از روی درصد مصرف اشتراک ChatGPT یا Codex استنباط نکنید.
  • تعداد تکرار: تعداد فراخوانی‌های ابزار و تکرارهای لازم برای موفقیت. یک فراخوانی ارزان‌تر ممکن است برای موفقیت به تکرارهای بیشتری نیاز داشته باشد.
  • تأخیر: زمان کل تا تکمیل تسک، نه فقط زمان اولین پاسخ. یک پاسخ سریع همیشه به معنای تکمیل سریع تسک نیست.
  • معیارهای مصرف: ردیابی دقیق توکن‌های بدون کش، کش‌شده، نوشتن و خروجی. طول پاسخ قابل مشاهده اغلب استدلال‌ها و ورودی‌های تکراری را پنهان می‌کند.
  • نتیجه: آیا نتیجه یک اصلاحیه پذیرفته‌شده بود و هزینه کل به ازای هر نتیجه مفید چقدر بود؟

جریمه‌های متن طولانی

یک پرتگاه بودجه برای مخازن بزرگ وجود دارد. هر سه مدل وقتی ورودی از ۲۷۲ هزار توکن بیشتر شود، نرخ‌های بالاتری اعمال می‌کنند. در این نقطه، نرخ ورودی و کش دو برابر و نرخ خروجی ۱.۵ برابر می‌شود.

این بدان معناست که ارسال یک مخزن ۱ میلیون توکنی، یک تصمیم مالی کاملاً متفاوت از استفاده از یک بستر کاری ۱۰۰ هزار توکنی است. داشتن پنجره حداکثری بزرگتر، دلیلی برای گنجاندن تمام فایل‌ها نیست. توسعه‌دهندگان تشویق می‌شوند که به جای تکیه بر حداکثر اندازه پنجره، محتوای متن خود را گلچین و مدیریت کنند.

چه زمانی به Astra ارتقا دهیم؟

مدل GPT-6 Astra باید فقط برای دسته خاصی از کارهای دشوار رزرو شود. ابتدا 6.1 Sol را برای عامل‌های جدید مبتنی بر Responses یا جریان‌های کاری Sol موجود که از استدلال‌های پشتیبانی‌شده استفاده می‌کنند، تست کنید. Sol قدیمی را تنها در زمان مهاجرت نگه دارید، در صورتی که عامل تولیدی شما به استدلال 'none' یا فراخوانی ابزار در Chat Completions وابسته است.

ارتقا به Astra تنها زمانی باید رخ دهد که تحلیل شکست‌های نماینده نشان دهد Sol با وجود دسترسی به متن لازم و ابزارهای فعال، نمی‌تواند نتیجه درستی تولید کند. هنگام ارتقا، به جای بازپخش یک ترنسکریپت عظیم، یک خلاصه فشرده، رویکردهای شکست‌خورده و شواهد تست را ارائه دهید.

برای جلوگیری از تخلیه بودجه، مسیرهای ارتقا باید سقف تعداد نوبت‌ها و سقف هزینه سخت‌گیرانه‌ای داشته باشند. برای یک قانون بودجه ساده، هزینه کل تقسیم بر تسک‌های پذیرفته‌شده را در یک مجموعه تست یکسان مقایسه کنید. در این تله نیفتید که یک تسک را صرفاً به دلیل اینکه توضیح Astra پیچیده‌تر و پیشرفته‌تر به نظر می‌رسد، «ارزشمند» اعلام کنید.

سوالات متداول و ملاحظات نهایی

  • آیا 6.1 Sol نصف قیمت است؟ خیر، فقط نرخ خواندن کش نصف شده است. سایر نرخ‌های استاندارد توکن بدون تغییر هستند.
  • آیا Astra همیشه ۵ برابر گران‌تر است؟ نرخ‌های ورودی معمولی، خروجی و نوشتن کش آن ۵ برابر Sol جدید است؛ اما خوانش‌های کش‌شده ۱۰ برابر است. هزینه کل تسک به رفتار مدل بستگی دارد.
  • از کدام تنظیم استدلال استفاده کنیم؟ تلاش‌های پشتیبانی‌شده موجود را حفظ کنید. هنگام جایگزینی 'none' یا 'minimal'، گزینه 'low' را ارزیابی کنید.
  • آیا تمام تسک‌های شکست‌خورده Sol باید به Astra بروند؟ خیر. ابتدا کمبود متن، ابزارهای خراب یا معیارهای پذیرش مبهم را برطرف کنید.

اگر از BeatAPI استفاده می‌کنید، مدل‌های 6.1 Sol، Sol قدیمی و Astra را به صورت جداگانه بررسی کنید تا دفتر حسابات خود را بازنویسی کنید. به یاد داشته باشید که لایه‌های سرویس مستقیم OpenAI و کنترل‌های اقامتی (residency controls) توسط فرمت درخواست سازگار یک درگاه (gateway) تضمین نمی‌شوند.

گام بعدی شما

  • اگر از مدل‌های Sol استفاده می‌کنید، سریعاً API خود را به /v1/responses منتقل کنید تا قابلیت فراخوانی ابزارها قطع نشود.
  • یک بنچمارک داخلی با تسک‌های شکست‌خورده بسازید تا نقطه بهینه بین Sol و Astra را برای بیزنس خود پیدا کنید.
  • حجم متنی ارسالی را زیر ۲۷۲ هزار توکن نگه دارید تا با جریمه دوبرابر شدن قیمت‌ها مواجه نشوید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر بر اساس تجربه عملی توسعه‌دهندگان عامل‌های کدنویس، هزینه عملیاتی سیستم‌های خودکار را به شدت کاهش می‌دهد. اعتبار این مدل‌ها اکنون با «هزینه به ازای نتیجه» سنجیده می‌شود، نه فقط دقت در بنچمارک‌ها.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی که از درگاه‌های واسط استفاده می‌کنند باید هزینه جدید را با نرخ تبدیل این درگاه‌ها بسنجند تا سودآوری عامل‌هایشان حفظ شود.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر کاهش هزینه کش نشان می‌دهد که مدل‌های استدلالی در حال تبدیل شدن به ابزارهای «تکرار شونده» هستند، جایی که هزینه بازخوانی متن‌های طولانی، گلوگاه اصلی اقتصادی است. به نظر ما، استراتژی بهینه‌سازی از «کاهش توکن» به «مدیریت هوشمندانه ارتقای مدل» (Escalation Path) تغییر کرده است؛ یعنی پذیرش این واقعیت که هیچ مدلی برای همه تسک‌ها بهینه نیست و باید لایه‌های قیمتی متفاوتی تعریف کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.