پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-5.6 Sol مصرف توکن‌های عامل‌های هوشمند را ۶۳.۵٪ کاهش داد

·۲۳ تیر ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
تست سرورهای GPT-5.6 MCP با سول، ترا و لونا
تست سرورهای GPT-5.6 MCP با سول، ترا و لونا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی زنجیره متوالی فراخوانی ابزار با اجرای اسکریپت‌های جاوااسکریپت در سندباکس V8، که منجر به کاهش ۶۳.۵ درصدی توکن‌های مصرفی در عملیات عامل‌محور شده است.

اگر امروز برای مدیریت عامل‌های هوشمند هزینه پرداخت می‌کنید، احتمالاً متوجه شده‌اید که چرخه‌های تکراریِ فراخوانی ابزار، بودجه شما را می‌بلعد. در مدل‌های سنتی، مدل باید ابزار را فراخوانی می‌کرد، منتظر پاسخ می‌ماند و سپس دوباره پاسخ را پردازش می‌کرد تا گام بعدی را بردارد. GPT-5.6 اکنون این الگو را تغییر داده و مصرف توکن‌ها را در حجم‌های کاری واقعیِ عامل‌محور تا ۶۳.۵٪ کاهش داده است. این مدل در واقع کفِ بهینگیِ هزینه‌ای برای اتوماسیون‌های ابزار-محور را جابه‌جا می‌کند.

این تحول باعث می‌شود نحوه تعامل عامل‌های هوش مصنوعی با داده‌های خارجی تغییر کند. در واقع، تست سرورهای پروتکل زمینهٔ مدل (MCP) — که یک استاندارد جامع برای ایجاد روشی سازگار جهت اتصال هوش مصنوعی به منابع داده‌ای مانند GitHub یا Postgres است — با GPT-5.6 تجربه‌ای بنیادین متفاوت از تست یک مدل چت ساده است. در این چشم‌انداز جدید، کل بازی در «انتخاب ابزار» (Tool Selection) نهفته است. با این حال، صرفاً داشتن ابزار کافی نیست؛ چرا که بسیاری از استقرار‌های تجاری MCP به‌دلیل نبود نقشه عملیاتی با شکست مواجه شده‌اند و بهینگی عملیاتی همچنان یک چالش است.

این به‌روزرسانی در حالی رخ می‌دهد که کل صنعت از چت‌بات‌های ساده به سمت توسعه عامل‌های خودمختار (Autonomous Agents) حرکت می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اینکه DeepSeek V4 چگونه مرزهای قیمت‌گذاری را جابه‌جا کرد اشاره کردیم، OpenAI اکنون به جای تمرکز صرف بر قیمت‌گذاری خام، شکاف بهینگی را از طریق «ارکستراسیون» هدف قرار داده است. هدف این انتشار، پروتکل MCP است تا مدل‌ها بتوانند به صورت سیستماتیک به داده‌ها دسترسی داشته باشند. هر یک از مدل‌های این خانواده جدید، پشتیبانی بومی از MCP را از طریق Responses API ارائه می‌دهند.

سلسله‌مراتب سه‌لایه

در ۹ جولای ۲۰۲۶، خانواده GPT-5.6 در سه سطح متمایز عرضه شد تا قدرت پردازشی مدل با هزینه آن تطبیق یابد. OpenAI این خانواده را به گونه‌ای تقسیم کرد که توسعه‌دهندگان بتوانند مدل را دقیقاً متناسب با نیازts هر پروژه انتخاب کنند. به نقل از گزارشی در dev.to، این دسته‌بندی شامل موارد زیر است:

  • GPT-5.6 Sol: مدل پرچم‌دار برای کارهای جاه‌طلبانه و پیچیده عامل‌محور. قیمت این مدل ۵.۰۰ دلار برای هر ۱ میلیون توکن ورودی و ۳۰.۰۰ دلار برای هر ۱ میلیون توکن خروجی است.
  • GPT-5.6 Terra: یک لایه متوازنه برای کارهای بهینه با حجم بالا. هزینه آن ۲.۵۰ دلار برای ورودی و ۱۵.۰۰ دلار برای خروجی به ازای هر میلیون توکن است.
  • GPT-5.6 Luna: گزینه سریع و مقرون‌به‌صرفه برای کارهای روزمره و ساده، با قیمت ۱.۰۰ دلار برای ورودی و ۶.۰۰ دلار برای خروجی به ازای هر میلیون توکن.

هر سه مدل برای تضمین سازگاری در کل خانواده، محدودیت‌های فنی یکسانی دارند. هر کدام دارای پنجرهٔ زمینه (Context Window) یک میلیون توکنی — شبیه به یک میز کاری بسیار بزرگ که اجازه می‌دهد حجم عظیمی از داده را هم‌زمان باز نگه دارید — و حداکثر خروجی ۱۲۸ هزار توکن هستند. همچنین تاریخ قطع دانش (Knowledge Cutoff) برای هر سه مدل ۱۶ فوریه ۲۰۲۶ است. از آنجایی که این مشخصات مشترک هستند، انتخاب بین لایه‌ها بر اساس محدودیت حافظه یا قابلیت‌های کلی نیست، بلکه بر اساس این است که هر تسک دقیقاً به چه میزان «استدلال» (Reasoning) نیاز دارد.

فراخوانی برنامه‌ریزی‌شده ابزارها

مهم‌ترین تغییر فنی در این نسخه، معرفی فراخوانی برنامه‌ریزی‌شده ابزار (Programmatic Tool Calling) است. در نسخه‌های قبلی، مدل ابزارها را یکی‌یکی و به صورت ترتیبی فراخوانی می‌کرد. اما اکنون، مدل می‌تواند با نوشتن کدهای جاوااسکریپت، زنجیره‌ای از فراخوانی‌های ابزار را سازمان‌دهی و مدیریت کند.

این اسکریپت در یک سندباکس V8 (V8 Sandbox) ایزوله اجرا می‌شود که هیچ دسترسی به شبکه ندارد و این امر به مدل اجازه می‌دهد تا منطق عملیاتی را به‌طور مؤثری دسته‌بندی (Batch) کند. چرا این موضوع اهمیت دارد؟ در الگوی قدیمی، هر نتیجه‌ی ابزار باید یک مسیر رفت و برگشت کامل را از طریق مدل طی می‌کرد. برای مثال، ده فراخوانی به معنای ده نوبت هزینه و تأخیر بود. اکنون با تجمیع این منطق در یک اسکریپت واحد، OpenAI گزارش داده است که مصرف توکن در حجم‌های کاری واقعی بین ۳۸٪ تا ۶۳.۵٪ کاهش یافته است. برای سرورهای MCP که ابزارهای متعددی دارند، این به معنای هزینه‌های کمتر و عامل‌هایی با سرعت بسیار بالاتر است.

ارکستراسیون چندعاملی

مدل GPT-5.6 همچنین حالت «فوق چندعاملی» (Ultra Multi-Agent Mode) را معرفی کرده است. به‌طور پیش‌فرض، سیستم می‌تواند چهار زیر-عامل (Sub-agent) را به‌صورت موازی فعال کند تا یک تسک پیچیده MCP را به مسیرهای مجزای اجرایی تقسیم کرده و به‌صورت هم‌زمان پیش ببرند.

این پردازش موازی منجر به دستاوردهای قابل اندازه‌گیری شده است. در محک Terminal-Bench 2.1، این قابلیت توانست عملکرد مدل Sol را از ۸۸.۸٪ به ۹۱.۹٪ ارتقا دهد. این داده‌ها نشان می‌دهند که عامل‌های موازی به‌ویژه در مدیریت تسک‌های دشوار MCP که مدل‌های تک-جریانی (Single-Stream) در آن‌ها دچار مشکل می‌شوند، بسیار مؤثرتر عمل می‌کنند.

رویارویی Sol و Claude: توازن فراخوانی ابزار

در مقایسه با رقبا، GPT-5.6 Sol برتری واضحی در ارکستراسیون عامل‌محور و ابزار-محور دارد. در آزمون Agents' Last Exam، مدل Sol رکورد جدیدی ثبت کرد و Claude Fable 5 را با اختلاف دو رقمی شکست داد. همچنین این مدل در شاخص Coding Agent و محک Terminal-Bench 2.1 در جایگاه نخست قرار گرفت.

با این حال، وقتی صحبت از «دقت خام کدنویسی» (Raw Code Accuracy) به میان می‌آید، این برتری از بین می‌رود. در محک SWE-Bench Pro، مدل Sol امتیاز ۶۴.۶٪ کسب کرد که تقریباً ۱۵ امتیاز پایین‌تر از Claude است. این نتایج نشان‌دهنده یک تقسیم‌بندی در بازار است: استفاده از GPT-5.6 برای ارکستراسیون ابزارها و بهینگی هزینه، و استفاده از Claude برای استدلال‌های عمیق کدنویسی. انتخاب درست کاملاً به این بستگی دارد که از کدام سرور MCP در پروژه استفاده می‌کنید.

استراتژی استقرار عملیاتی

تست‌های عملی روی این مدل‌ها نشان می‌دهد که برای جلوگیری از پرداخت هزینه‌های اضافی برای مدل Sol، باید از یک استراتژی «ارتقای پله‌ای» استفاده کرد. مدل Sol در هر دو بخش ورودی و خروجی، پنج برابر گران‌تر از Luna است؛ بنابراین انتخاب اشتباه مدل در مقیاس بالا منجر به افزایش شدید هزینه‌ها می‌شود. برای جلوگیری از این اتفاق، توسعه‌دهندگان نباید به‌طور پیش‌فرض для هر درخواست از Sol استفاده کنند.

کدام مدل برای کدام تسک MCP؟

  • GPT-5.6 Luna: برای جست‌وجوهای سریع (Fast Lookups)، خواندن تک-ابزاری و تست‌های اولیه (Smoke Tests) استفاده کنید. از این مدل برای هر کاری که نیاز به برنامه‌ریزی چندمرحله‌ای واقعی دارد، اجتناب کنید.
  • GPT-5.6 Terra: برای عامل‌های روزمره و اتوماسیون‌های با حجم کاری بالا مناسب است. اگر برنامه‌ای شامل ۸ یا تعداد بیشتری فراخوانی ابزار وابسته است، از Terra استفاده نکنید.
  • GPT-5.6 Sol: برای زنجیره‌های طولانی بین‌سروری، اهداف مبهم و عملیات «نوشتن» (Write Actions) به کار ببرید. برای خواندنی‌های ساده یا لیست کردن ابزارها از آن استفاده نکنید.

قانون طلایی من این است: با Luna شروع کنید، اگر مدل مراحل را گم کرد به Terra بروید و تنها زمانی به سراغ Sol بروید که با عامل‌های سخت و گران‌قیمتی سروکار دارید که شکست آن‌ها هزینه زیادی دارد. بهترین راه برای تأیید این موضوع، اجرای یک پرامپت یکسان روی دو لایه در کنار هم و مقایسه فراخوانی ابزارها است. این تست در محیط استودیو تنها ۳۰ ثانیه زمان می‌برد.

تضمین پایدار بودن فراخوانی‌ها

حتی یک مدل پرچم‌دار هم به تنظیمات تمیز نیاز دارد. اکثر لحظاتی که «عامل خراب شد»، در واقع مشکل از طرح‌واره (Schema) یا پرامپت است، نه خود مدل. برای حفظ پایداری GPT-5.6، توسعه‌دهندگان باید:

  • توصیفات ابزار را دقیق و کوبنده بنویسند: GPT-5.6 این توصیفات را به‌صورت تحت‌اللفظی می‌خواند؛ توصیفات مبهم منجر به فراخوانی‌های مبهم می‌شود.
  • آرگومان‌های ضروری را شفاف علامت‌گذاری کنند: طرح‌واره‌های مبهم حتی قوی‌ترین مدل‌ها را هم دچار خطا می‌کنند.
  • قبل از عملیات نوشتن، تأیید بگیرند: از عامل بخواهید ابتدا تغییر دقیق مورد نظر را بیان کند و سپس آن را اجرا نماید.
  • ارزان شروع کنند: از Luna برای تست اتصال (Smoke-test) استفاده کنید و سپس به Sol ارتقا دهید.

عیب‌یابی مدل در برابر سرور

یک نکته ظریف وجود دارد: اکثر خطاهای مشاهده‌شده توسط سرور بازگردانده می‌شوند، نه مدل. برای مثال، یک خطای ۴۰۱ یا ۴۱۰ در خروجی ابزار، صدای API است، نه GPT-5.6. وقتی فراخوانی‌ها شکست می‌خورند، کاربران باید پیش از متهم کردن ارکستراسیون LLM، کدهای خطای خاص API را بررسی کنند. علاوه بر این، چون عامل‌ها از طریق سندباکس V8 خودمختارتر شده‌اند، توسعه‌دهندگان باید سرورهای MCP را از نظر ریسک‌های «مسمومیت ابزار» (Tool-poisoning) و تزریق کد (Injection) پیش از اتصال به سرورهای عملیاتی (Production) اسکن کنند.

آزمایش با MCP Agent Studio

توسعه‌دهندگان می‌توانند بدون نیاز به API Key یا SDK شرکت OpenAI، در محیط MCP Agent Studio آزمایش کنند. کل این چرخه در مرورگر اجرا می‌شود و فرآیند آن سه گام اصلی دارد:

۱. اتصال سرور MCP: URL سرور خود را در فیلد اتصال وارد کنید. هر نقطه پایانی (Endpoint) از نوع Streamable HTTP یا SSE کار می‌کند. همچنین می‌توان سرورهای «یک-کلیکی» را از کاتالوگ میزبان MCP، شامل GitHub، Playwright و Postgres مستقر کرد.
۲. انتخاب لایه GPT-5.6: از انتخاب‌گر مدل برای انتخاب Sol، Terra یا Luna استفاده کنید. این انتخاب‌گر هزینه اعتبار به ازای هر پرامپت را نمایش می‌دهد. برای اجرای اول، Luna توصیه می‌شود چون ارزان و سریع است و تنها در صورت لکنت عامل، سطح را ارتقا دهید.
۳. ارسال و بازرسی: پرامپتی مانند «لیست PRهای باز گیت‌هابم را بگیر و موارد قدیمی را علامت بزن» ارسال کنید. جریان فراخوانی ابزارها را در پنل مشاهده کرده و روی هر فراخوانی کلیک کنید تا ورودی و خروجی دقیق را ببینید. این ردیابی تأیید می‌کند که آیا GPT-5.6 ابزار درست را با آرگومان‌های صحیح انتخاب کرده است یا خیر.

نقش MCP Playground

محیط MCP Playground اجازه می‌دهد تست A/B بین بیش از ۴۰ مدل را به‌صورت هم‌زمان انجام دهید. با اتصال یک نقطه پایانی و تغییر بین Sol، Terra و Luna در میانه‌ی یک چت، توسعه‌دهندگان می‌توانند دقیقاً ببینند کدام لایه قادر به حفظ برنامه عملیاتی (Plan) است.

کاتالوگ میزبان MCP با ارائه URLهای سرور زنده در یک کلیک، نیاز به نظارت دائمی بر زیرساخت را حذف می‌کند. این امر به توسعه‌دهندگان اجازه می‌دهد تا اعتبارهای مدل پرچم‌دار را فقط در جایی هزینه کنند که مدل واقعاً ارزش خود را ثابت کند. چه در حال تست یک نقطه پایانی واحد باشید و چه در یک تنظیمات چند-سروری، Playground پنجره‌ای بی‌درنگ به نحوه مدیریت زنجیره‌های پیچیده ابزار توسط مدل می‌گشاید.

جمع‌بندی قابلیت‌های GPT-5.6

برای تجمیع این انتشار جدید، خانواده GPT-5.6 یک معماری مقیاس‌پذیر برای کارهای عامل‌محور فراهم می‌کند. با ترکیب قدرت استدلالی بالای Sol با بهینگی Luna و Terra، OpenAI سیستمی ایجاد کرده است که در آن توسعه‌دهنده کنترل کامل نسبت هزینه به عملکرد را در دست دارد. اضافه شدن سندباکس V8 برای فراخوانی برنامه‌ریزی‌شده و معماری زیر-عامل‌های موازی، این مدل را به‌طور خاص برای پروتکل MCP بهینه کرده است و تأخیر و هزینه مرتبط با ارکستراسیون ابزارهای چندمرحله‌ای را به شدت کاهش داده است.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای تسک‌های ساده استفاده می‌کنید، همین امروز مدل‌های خود را به Luna یا Terra منتقل کنید و کاهش هزینه توکن را اندازه بگیرید.
  • سرورهای MCP خود را در MCP Agent Studio تست کنید تا از صحت توصیفات ابزارها (Tool Descriptions) مطمئن شوید.
  • برای تسک‌های پیچیده، حالت موازی را فعال کرده و خروجی‌ها را با نسخه تک-جریانی مقایسه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با کاهش چشمگیر هزینه استنتاج، استقرار عامل‌های هوشمند را از یک آزمایش گران‌قیمت به یک راهکار اقتصادی تبدیل می‌کند. تخصص OpenAI در بهینه‌سازی لایه ارکستراسیون، استانداردهای بهره‌وری در پروتکل MCP را جابه‌جا کرد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل‌ها دشوار است؛ اما استفاده از MCP Agent Studio برای تست‌های اولیه بدون نیاز به SDK، راهکاری سریع برای ارزیابی این لایه‌هاست.

·نگاه ما
تحریریه دات‌هوش

جابه جایی تمرکز OpenAI از «افزایش اندازه مدل» به «بهینه‌سازی ارکستراسیون» نشان می‌دهد که سد رشد عامل‌ها دیگر حافظه یا منطق خام نیست، بلکه هزینه و تأخیر در تعامل با ابزارهاست. با معرفی سندباکس V8، مدل از یک «متن‌نویس که دستور می‌دهد» به یک «کدنویس که اجرا می‌کند» تبدیل شده است. این تغییر، مدل‌های زبانی را از نقش مشاور به نقش اپراتور سیستم تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.