پرش به محتوای اصلی
پرش به محتوای مقاله

۳ سطح جدید در GPT-5.6 برای بهینه‌سازی توازن هزینه و عملکرد

·۱۹ تیر ۱۴۰۵۶ دقیقه مطالعه
خانواده سه‌لایه GPT-5.6 با فراخوانی ابزار برنامه‌نویسی در API پاسخ‌ها
خانواده سه‌لایه GPT-5.6 با فراخوانی ابزار برنامه‌نویسی در API پاسخ‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری سه لایه (Sol/Terra/Luna) برای تفکیک هزینه و دقت و استقرار محیط V8 Runtime ایزوله برای اجرای مستقیم کدها در API، تغییرات بنیادین این نسخه است.

اگر امروز برای توسعه نرم‌افزارهای پیچیده هزینه می‌کنید، مدل جدید OpenAI می‌تواند زمان استنتاج شما را به نصف کاهش دهد. GPT-5.6 Sol اکنون با کسب امتیاز ۸۰ در شاخص عامل‌های کدنویسی (Coding Agent Index) شرکت Artificial Analysis، رتبه نخست را به دست آورد و Claude Fable 5 را با ۲.۸ امتیاز شکست داد.

طبق اعلام OpenAI، مدل Sol این رکورد را در حالی ثبت کرده که کمتر از نیمی از توکن‌های خروجی و زمان رقبای خود را مصرف می‌کند. این دستاورد در راستای تلاشی است که مدل Sol برای کاهش چشمگیر هزینه‌های استنتاج در مقایسه با رقبا به کار گرفته است. این تغییر نشان‌دهنده گذار صنعت از چت‌بات‌های ساده به سمت عامل‌های هوشمند (AI Agents) است که می‌توانند کدها را در محیط‌های امن اجرا کنند. این مدل‌ها شبیه به کارمندانی هستند که فقط پیشنهاد نمی‌دهند، بلکه خودشان دست به اجرای عملیاتی کد می‌زنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش هزینه‌های مدل‌های GPT-5.6 اشاره کردیم، این به‌روزرسانی عمومی اکنون ادغام برنامه‌نویسی عمیق‌تری را ممکن می‌سازد. صنعت در حال حاضر از رابط‌های ساده‌ی چت فاصله گرفته و به سمت عامل‌های خودمختاری حرکت می‌کند که قادر به اجرای کد در محیط‌های ایزوله هستند. این رویکرد بخشی از استراتژی جدید OpenAI است که تمرکز خود را در سری GPT-5.6 از گفتگوهای متنی به سمت اجرای عملیات سوق داده است.

معماری سه لایه

OpenAI نسل GPT-5.6 را در سه سطح وزنی متمایز سازماندهی کرده است تا نیازهای مختلف تجاری را پوشش دهد:

  • Sol: مدل پرچمدار که برای وظایف با استدلال بالا بهینه شده است. قیمت آن ۵ دلار برای هر ۱ میلیون توکن ورودی و ۳۰ دلار برای هر ۱ میلیون توکن خروجی است.
  • Terra: سطح متوازن برای کارهای روزمره که با قیمت ۲.۵۰ دلار برای ورودی و ۱۵ دلار برای هر ۱ میلیون توکن خروجی ارائه می‌شود.
  • Luna: گزینه اقتصادی و بهینه از نظر هزینه با قیمت ۱ دلار برای ورودی و ۶ دلار برای هر ۱ میلیون توکن خروجی.

دسترسی به این مدل‌ها بسته به پلتفرم و نوع اشتراک کاربر متفاوت است. کاربران دارای پلن‌های Plus، Pro، Business و Enterprise می‌توانند مدل Sol را در ChatGPT در سطوح تلاش (Effort) «متوسط» و «بالا» اجرا کنند. همچنین کاربران Pro و Enterprise به پیکربندی خاصی به نام «Sol Pro» دسترسی دارند.

در مقابل، کاربران رایگان (Free) و کاربران پلن Go که از ChatGPT Work و Codex استفاده می‌کنند، محدود به مدل Terra هستند. با این حال، کاربران پولی در این محیط‌ها می‌توانند بین هر سه سطح (Sol, Terra, Luna) انتخاب کرده و میزان «تلاش» (Effort) را برای هر مدل به‌صورت دستی تنظیم کنند. یک تنظیم «حداکثری» (Max) نیز برای تمامی کاربرانی که دسترسی به GPT-5.6 دارند در دسترس است و می‌توان آن را از طریق تنظیمات فعال کرد.

فراخوانی ابزار برنامه‌ریزی شده و حالت Ultra

یکی از کلیدی‌ترین اضافات فنی، «فراخوانی ابزار برنامه‌ریزی شده» (Programmatic Tool Calling) در API پاسخ‌ها است. این سازوکار، کدهای جاوااسکریپت نوشته شده توسط مدل را درون یک محیط V8 Runtime ایزوله اجرا می‌کند. نکته حائز اهمیت این است که این محیط هیچ دسترسی شبکه‌ای ندارد و یک محیط امن (Sandbox) برای اجرای کد فراهم می‌کند تا امنیت سیستم تضمین شود. بر اساس مستندات و گزارش‌های OpenAI، این قابلیت برای برخی مشتریان نام‌برده منجر به کاهش مصرف توکن‌ها بین ۳۸٪ تا ۶۳.۵٪ شده است.

برای کاربرانی که به دقت حتی بالاتری نیاز دارند، تنظیمات «Ultra» اجازه می‌دهد چهار عامل (Agent) به‌ صورت موازی و پیش‌فرض اجرا شوند. این سیستم چندین عامل را هماهنگ می‌کند تا با پذیرش مصرف توکن بیشتر، در عوض امتیازات قوی‌تر و زمان رسیدن به نتیجه سریع‌تری (Time-to-result) به دست آورند. طبق داده‌های OpenAI از تاریخ ۹ جولای ۲۰۲۶، این رویکرد چندعاملی توانست امتیازات Terminal-Bench 2.1 را از ۸۸.۸٪ به ۹۱.۹٪ ارتقا دهد.

این قابلیت Ultra در محیط ChatGPT Work (برای کاربران Pro و Enterprise) و در Codex (برای کاربران Plus و بالاتر) در دسترس است. علاوه بر این، OpenAI اجراهای ۱۶-عاملی را در بنچمارک‌های SEC-Bench Pro و BrowseComp نیز ترسیم و آزمایش کرده است.

کالبدشکافی بنچمارک‌ها

مدل Sol در محیط‌های کدنویسی و گردش کارهای حرفه‌ای برتری واضحی را به نمایش می‌گذارد:

  • Terminal-Bench 2.1: مدل Sol به ۸۸.۸٪ در حالت استاندارد و ۹۱.۹٪ در حالت Ultra رسید. برای مقایسه، Claude Fable 5 امتیاز ۸۳.۱٪ و Gemini 3.1 Pro Preview تنها ۷۰.۷٪ کسب کردند.
  • OSWorld 2.0: مدل Sol با کسب ۶۲.۶٪ برنده بود و در حالی این نتیجه را گرفت که ۸۵٪ توکن خروجی کمتری نسبت به Claude Opus 4.8 مصرف کرد. در این معیار، مدل Terra امتیاز ۵۰.۲٪ و مدل Luna امتیاز ۴۵.۶٪ گرفتند.
  • BrowseComp: مدل Sol به ۹۰.۴٪ رسید (که در حالت Ultra به ۹۲.۲٪ می‌رسد) و از امتیاز ۸۴.۴٪ مدل GPT-5.5 پیشی گرفت.
  • Agents’ Last Exam: این بنچمارک گردش کارهای حرفه‌ای را در ۵۵ حوزه مختلف ارزیابی می‌کند. OpenAI گزارش داده است که Sol به امتیاز بالای ۵۳.۶ رسیده است که ۱۳.۱ امتیاز بیشتر از Claude Fable 5 (در حالت استدلال تطبیقی) است. با این حال، در جدول ارزیابی داخلی خود OpenAI، عدد کمی پایین‌تر یعنی ۵۲.۷٪ برای Sol و ۴۰.۵٪ برای Fable 5 ذکر شده است.
  • DeepSWE v1.1: هر سه سطح GPT-5.6 شامل Sol (۷۲.۷٪)، Terra (۶۹.۶٪) و Luna (۶۷.۲٪) توانستند از رکورد قبلی یعنی ۶۷٪ در مدل GPT-5.5 عبور کنند.

با این حال، داده‌ها شکاف‌های بحرانی را نیز آشکار می‌کنند. در محک بسیار مورد توجه SWE-Bench Pro، مدل Sol امتیاز ۶۴.۶٪ را کسب کرده که حدود ۱۵ امتیاز از Claude Mythos 5 (۸۰.۳٪) و Fable 5 (۸۰٪) عقب‌تر است. همچنین Sol در شاخص AA Intelligence v4.1 با امتیاز ۵۸.۹ در برابر ۵۹.۹ برای Fable 5، و در رتبه‌بندی Elo در GDPval-AA v2 با امتیاز ۱,۷۴۷.۸ در برابر ۱,۷۵۹.۶ برای Fable 5 شکست خورده است.

نقاط ضعف و اصطکاک‌های اضافی

فراتر از بنچمارک‌های اصلی، چندین نقطه ضعف دیگر در داده‌ها مشاهده می‌شود:

  • استفاده از ابزار (Tool Use): در آزمون Toolathlon، مدل Sol امتیاز ۵۸٪ گرفت، در حالی که Fable 5 به ۶۱.۷٪ و Opus 4.8 به ۵۹.۹٪ رسیدند. نکته جالب این است که Luna با ۵۳.۴٪ کمی بهتر از Terra (۵۳.۱٪) عمل کرد و ترتیب استاندارد لایه‌ها در اینجا معکوس شد.
  • دانش و سلامت: در بنچمارک HealthBench Professional، مدل Fable 5 با ۶۰.۹٪ برتری اندکی نسبت به Sol (۶۰.۵٪) دارد.
  • پنجره متنی بلند (Long Context): مدل Luna در آزمون 8-needle متعلق به OpenAI MRCR v2 با افت شدید مواجه شد و در هر دو بازه ۲۵۶K-۵۱۲K و ۵۱۲K-۱M توکن، امتیاز ۴۱.۳٪ را ثبت کرد. مدل Sol نیز در بازه ۵۱۲K-۱M امتیاز ۷۳.۸٪ گرفت که اندکی پایین‌تر از رکورد ۷۴٪ مدل GPT-5.5 است.

به‌روزرسانی‌های کش و بهره‌وری

OpenAI نحوه عملکرد «کش پرامپت» (Prompt Caching) را در این نسل بازبینی کرده است. سیستم اکنون از نقاط شکست صریح (Explicit Cache Breakpoints) و حداقل عمر اجباری ۳۰ دقیقه‌ای برای کش پشتیبانی می‌کند.

ساختار هزینه‌های مالی مربوط به کشینگ تغییر کرده است: نوشتن در کش (Cache Writes) اکنون ۱.۲۵ برابر نرخ ورودی بدون کش محاسبه می‌شود و این موضوع یک ردیف هزینه جدید را برای مدل‌سازی هزینه‌ها ایجاد می‌کند. در مقابل، خواندن از کش (Cache Reads) همچنان تخفیف ۹۰ درصدی دارد که باعث می‌شود پرس‌وجوهای مکرر با متن‌های طولانی برای کاربران سازمانی به‌طور قابل توجهی ارزان‌تر شود.

کاربران باید توجه داشته باشند که ادعاهای مربوط به تأخیر (Latency) و هزینه ارائه شده توسط OpenAI، شبیه‌سازی‌های آفلاین هستند و نه اعداد اندازه‌گیری شده در محیط عملیاتی تولید (Production). علاوه بر این، امتیازات سایبری با کاهش لایه‌های حفاظتی (Safeguards) اندازه‌گیری شده‌اند، به این معنی که رفتار مدل در محیط واقعی متفاوت خواهد بود.

تحلیل: استراتژی بهره‌وری

این انتشار سیگنالی است مبنی بر اینکه OpenAI دیگر به دنبال یک «مدل خدای» (God-model) واحد نیست، بلکه در حال بهینه‌سازی نسبت «توکن به ارزش» است. با ارائه عملکرد کدنویسی Sol با استفاده از کمتر از نیمی از توکن‌های خروجی رقبایش، OpenAI در حال حمله به اصلی‌ترین نقطه ضعف هوش مصنوعی عامل‌محور است: تأخیر و هزینه.

برای یک صاحب کسب‌وکار، این به معنای آن است که اکنون می‌توانید وظایف ساده را به Luna بسپارید و Sol را تنها برای منطق‌های پیچیده رزرو کنید. این استراتژی می‌تواند قبض API شما را بدون افت کیفیت در مسیرهای حیاتی، تا ۸۰٪ کاهش دهد. معرفی محیط ایزوله V8 نشان می‌دهد که OpenAI برای آینده‌ای آماده می‌شود که در آن LLMها از «پیشنهاد دادن کد» به «اجرای خودمختار منطق تجاری» تغییر وضعیت دهند.

کاربران باید عملکرد بتای چندعاملی را در API پاسخ‌ها رصد کنند تا ببینند آیا نتایج حالت «Ultra» به پایداری واقعی در محیط تولید تبدیل می‌شود یا خیر. به‌طور خاص، شکاف موجود در SWE-Bench Pro نشان می‌دهد که اگرچه Sol سریع‌تر و بهینه‌تر است، اما ممکن است Claude همچنان در وظایف مهندسی نرم‌افزار پیچیده و چند-فایلی برتری داشته باشد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل‌های Luna و Terra را برای کارهای ساده‌تر جایگزین Sol کنید تا هزینه API خود را تا ۸۰٪ کاهش دهید.
  • قابلیت Programmatic Tool Calling را در API پاسخ‌ها تست کنید تا میزان مصرف توکن‌های خود را بسنجید و از محیط Sandbox برای امنیت بیشتر استفاده کنید.
  • عملکرد حالت Ultra را در محیط‌های عملیاتی رصد کنید تا ببینید آیا این دقت بالاتر در دنیای واقعی منجر به پایداری سیستم می‌شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این عرضه بر اساس تخصص OpenAI در بهینه‌سازی استنتاج است و اجازه می‌دهد کسب‌وکارها بدون افت کیفیت، هزینه‌های عملیاتی را به شدت کاهش دهند. جابجایی از «پیشنهاد کد» به «اجرای کد» در محیط V8، شروع عصر خودمختاری واقعی در ابزارهای توسعه است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به لایه‌های Sol و Ultra برای توسعه‌دهندگان ایرانی دشوار است. با این حال، کاهش هزینه توکن‌ها در مدل Luna می‌تواند برای استارتاپ‌های ایرانی که از واسطه‌ها استفاده می‌کنند، جذاب باشد.

·نگاه ما
تحریریه دات‌هوش

OpenAI استراتژی خود را از تعقیب یک «مدل خدای‌گونه» به بهینه‌سازی نرخ «توکن به ارزش» تغییر داده است. تمرکز بر کاهش توکن‌های خروجی در حالی که عملکرد کدنویسی افزایش یافته، نشان می‌دهد که OpenAI می‌خواهد گلوگاه اصلی عوامل هوشمند یعنی تأخیر و هزینه را بزند. با این حال، عقب ماندن Sol از کلود در مهندسی نرم‌افزارهای پیچیده چندفایلی (SWE-Bench Pro) نشان می‌دهد که برای پروژه‌های بزرگ مقیاس، هنوز Anthropic دست برتر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.