پرش به محتوای اصلی
پرش به محتوای مقاله

آیا افزایش ۲.۴۲ برابری هزینه برای دقت GPT-5.6 Sol توجیه‌پذیر است؟

·۲۸ تیر ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
تحلیل
آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های مهم. بهترین بیلدها.
آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های مهم. بهترین بیلدها.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف اثر معکوس حالت Max در رفع باگ‌های ساده (کاهش ۷.۱ درصدی دقت)؛ برخلاف تصور رایج که محاسبات بیشتر همیشه منجر به نتیجه بهتر می‌شود، در اینجا «بیش‌پردازش» باعث تخریب پاسخ در وظایف محدود شده است.

اگر امروز بودجهٔ API خود را برای دستیابی به بالاترین دقت در کدنویسی تخصیص می‌دهید، احتمالاً در حال پرداخت مبلغی هستید که با بهبود اندک کیفیت تناسب ندارد. در مدل GPT-5.6 Sol Max، افزایش محاسبات در زمان استنتاج (Test-time compute) تنها یک جهش جزئی در کیفیت ایجاد می‌کند که اغلب توجیه‌پذیر نیست. در واقع، در حالی که تنظیمات «Max» می‌تواند سدهای سخت انتزاعی را بشکند، اما برای تعمیرات محدود و مشخص، اغلب یک سطح دستاوردهای ثابت اما بسیار گران‌قیمت را ارائه می‌دهد.

این تحلیل در حالی منتشر می‌شود که توسعه‌دهندگان برای ایجاد تعادل بین خودمختاری عامل‌های هوش مصنوعی (AI Agents) و بودجه‌های API در تکاپو هستند. این چالش‌ها در راستای معرفی ۳ سطح جدید در GPT-5.6 برای بهینه‌سازی توازن هزینه و عملکرد است که امکان مدیریت دقیق‌تر منابع را فراهم می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی تمایل مدل‌های Sol به اجتناب از پاسخ در اثبات‌های پیچیده ریاضی اشاره کردیم، اکنون صنعت در این نقطه است که بپرسد آیا «استدلال بیشتر» همیشه به معنای نتایج بهتر است یا خیر. برای یک برنامه‌نویس، این تفاوت یعنی پرداخت هزینه برای رسیدن به راه حل، یا پرداخت هزینه برای اینکه مدل مدام در تصمیمات خود تردید کند و خودش را زیر سوال ببرد.

زمینه: چشم‌انداز محک‌ها

برای درک تفاوت عملکرد Sol Max، باید به ساختار و شکل وظایف نگاه کرد. داده‌ها بین دو محیط متمایز تقسیم شده‌اند: مجموعه داده عمومی DeepSWE v1.1 و پروژه اختصاصی Tura برای بازنویسی زبان Rust به Python در پروژه eza.

محک DeepSWE برای پیاده‌سازی‌های طولانی‌مدت در مخازن کد طراحی شده است و نباید آن را با محک‌های رفع باگ‌های کوچک اشتباه گرفت. طبق گزارش‌های داخلی این مجموعه، موارد مربوط به مکان‌یابی باگ و بازسازی کد (Refactoring) در آن کمتر نمایش داده شده‌اند. دامنه گسترده این محک در آمار وظایف آن مشهود است: در حالی که در SWE-bench Verified به‌طور میانگین ۱۰ خط کد اضافه و ۱ فایل ویرایش می‌شود، در DeepSWE میانگین ۶۶۸ خط کد اضافه شده و ۷ فایل در ۹۱ مخزن مختلف ویرایش شده است.

هزینهٔ دستاوردهای حاشیه‌ای

بر اساس تحلیل دقیقی که در ۱۹ ژوئیه ۲۰۲۶ در وب‌سایت dev.to منتشر شد، انتقال از سطح تلاش «High» به «Max» در محک DeepSWE v1.1 تنها منجر به افزایش ۳.۳ درصدی در امتیاز Pass@1 می‌شود (بهبود از ۶۹.۴٪ به ۷۲.۷٪).

با این حال، این دستاورد کوچک با هزینه‌های عملیاتی سنگینی همراه است:

  • هزینه هر وظیفه از ۳.۴۷ دلار به ۸.۳۹ دلار رسید (افزایش ۲.۴۲ برابری).
  • حجم توکن‌های خروجی از ۲۸.۵ هزار به ۶۰ هزار توکن جهش کرد (۲.۱۱ برابر).
  • توکن‌های ورودی ۲.۹۱ برابر افزایش یافت (از ۲.۷۱ میلیون به ۷.۹۱ میلیون).
  • زمان تکمیل پروژه تقریباً دو برابر شد و از ۹.۹ به ۱۸.۸ دقیقه رسید.
  • گام‌های زنجیره تفکر (Chain-of-Thought) از ۳۶.۹ به ۶۱.۳ گام رسید (۱.۶۶ برابر).

آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های مهم. بهترین بیلدها.

منحنی کارایی پیش از رسیدن به حالت Max مسطح می‌شود. در تنظیمات میانی XHigh، امتیاز Pass@1 به ۷۰.۷٪ با هزینه ۴.۷۰ دلار می‌رسد که افزایشی ۱.۳ درصدی را نشان می‌دهد. جهش بعدی از XHigh به Max تنها ۲ درصد دیگر به کیفیت می‌افزاید اما هزینه را ۷۸٪ افزایش می‌دهد. در واقع، این یعنی شما برای هر ۳۱ تلاش موفق، هزینه یک تلاش اضافی را می‌پردازید. در نتیجه، هزینه هر پاسخ موفق از حدود ۵ دلار در حالت High به ۱۱.۵۴ دلار در حالت Max می‌رسد.

زمان‌هایی که Max واقعاً اثر می‌کند

داده‌ها نشان می‌دهند که تنظیم Max همواره ناکارآمد نیست؛ بلکه ارزش آن به «شکل وظیفه» بستگی دارد. تفاوت اصلی زمانی ظاهر می‌شود که تعمیرات محدود با پیاده‌سازی ویژگی‌ها و بازنویسی‌های گسترده مقایسه شوند.

  • تعمیرات محدود (DeepSWE): برای ۷ وظیفه که با کلماتی چون «Fix»، «Restore»، «Preserve» یا «Reconstruct» شروع می‌شدند، امتیاز Max در واقع ۷.۱ درصد کاهش یافت (از ۶۴.۳٪ به ۵۷.۱٪)، در حالی که هزینه‌ها ۲.۵۳ برابر شد. این نشان می‌دهد که Max می‌تواند در واقع به اصلاحات ساده ضربه بزند.
  • پیاده‌سازی ویژگی (DeepSWE): برای ۹۵ وظیفه با پیشوند «Add» یا «Implement»، حالت Max افزایشی ۴.۴ درصدی (از ۷۰.۲٪ به ۷۴.۶٪) با افزایش هزینه ۲.۴۳ برابری ایجاد کرد.
  • بازنویسی مخزن (eza): اینجا جایی است که Max می‌درخشد. در پروژه بازنویسی Rust به Python توسط Tura، امتیازات از محدوده ۷۸.۸-۸۹.۴٪ به ۹۲.۳-۹۴.۲٪ رسید.

آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های بزرگ. ساخت‌های حداکثری.

در چارچوب بازنویسی eza، دستاوردهای خاص به شرح زیر است:

  • Tura Balanced: از ۸۹.۴٪ (High) به ۹۴.۲٪ (Max) | ۴.۸٪ افزایش | ۲.۳۹ برابر هزینه.
  • Tura Direct: از ۷۹.۸٪ (High) به ۹۲.۳٪ (Max) | ۱۲.۵٪ افزایش | ۳.۲۷ برابر هزینه.
  • Codex CLI: از ۷۸.۸٪ (High) به ۹۲.۳٪ (Max) | ۱۳.۵٪ افزایش | ۲.۲۷ برابر هزینه.

در این بازنویسی‌های طولانی‌مدت، مدل باید مسیری را از میان سطوح گسترده سازگاری پیدا کند. تحلیل‌ها اشاره دارند که Max به‌ویژه برای مهاجرت‌های کد و پروژه‌های جدید (Greenfield) که تصمیمات معماری در آن‌ها هنوز تثبیت نشده و حل‌نشده است، کاملاً توجیه‌پذیر است.

مالیات Max و تأخیر

فراتر از صورت‌حساب مستقیم API، یک جریمهٔ شدید در زمینه تأخیر (Latency) وجود دارد. داده‌های Artificial Analysis نشان می‌دهد انتقال از XHigh به Max، زمان تا نخستین توکن (Time to first token) را از ۴۴.۵۸ ثانیه به ۱۴۵.۶۱ ثانیه می‌رساند؛ یعنی افزایش ۳.۲۷ برابری تأخیر در استارت‌آپ مدل برای تنها یک امتیاز افزایش در شاخص هوشمندی (از ۵۸ به ۵۹).

آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های بزرگ. ساخت‌های حداکثری.

مقیاس‌بندی توکن‌ها و واقعیت‌های اقتصادی

ساختار قیمت‌گذاری API مدل GPT-5.6 Sol پیچیدگی‌های مالی را بیشتر می‌کند:

  • ورودی بدون کش: ۵ دلار برای هر ۱ میلیون توکن
  • خواندن از کش: ۰.۵۰ دلار برای هر ۱ میلیون توکن
  • نوشتن در کش: ۶.۲۵ دلار برای هر ۱ میلیون توکن
  • خروجی: ۳۰ دلار برای هر ۱ میلیون توکن

بررسی ۲۷۸ اجرا در خانواده‌های Tura و Codex نشان می‌دهد توکن‌های خروجی حجم بسیار کمی از کل ترافیک دارند (۰.۳۴٪ تا ۱.۷۷٪) اما بخش بزرگی از هزینه مدل شده را تشکیل می‌دهند (۱۲.۸٪ تا ۳۷.۶۴٪).

علاوه بر این، حجم کل توکن‌ها به‌صورت فوق‌خطی (Superlinearly) با تعداد دورهای استنتاج رشد می‌کند. برای Tura Balanced، توان توکن ۱.۴۷ و برای Codex High، ۱.۳۸ است. این یعنی دو برابر کردن دورهای استنتاج معمولاً بیش از دو برابر افزایش توکن‌های مصرفی دارد، هرچند مکانیزم کشینگ هزینه واقعی را به حالت خطی نزدیک می‌کند. در پروژه eza، حالت Max حلقه استنتاج را به‌شدت گسترش داد: Tura Balanced از ۳۰ به ۷۲ دور و Codex از ۶۲.۵ به ۹۲ دور رسید.

آیا GPT-5.6 Sol Max ارزش دارد؟ رفع باگ‌های بزرگ. ساخت‌های حداکثری.

مقایسه تلاش‌ها در مدل‌های مختلف

گزارش عرضه OpenAI، مدل Sol Max را به عنوان پیکربندی برتر معرفی کرده و به امتیاز ۷۲.۷٪ در DeepSWE v1.1 و ۸۸.۸٪ در Terminal-Bench 2.1 اشاره می‌کند. این در حالی است که پیش‌تر گزارش شده بود مدل GPT-5.6 Sol هزینه استنتاج را به یک‌سوم رقیب کاهش داد تا رقابت‌پذیری اقتصادی خود را به رخ بکشد. آن‌ها ادعا می‌کنند Sol Max مدل Fable 5 را در شاخص عامل‌های کدنویسی با ۲.۸ امتیاز شکست داده، در حالی که کمتر از نصف خروجی و زمان را مصرف کرده و هزینه تخمینی آن ۳۳٪ کمتر است. با این حال، این نتایج قدرت مطلق مدل را ثابت می‌کند، نه اقتصاد حاشیه‌ای ارتقا از High به Max را.

داده‌های شخص ثالث رابطه‌ای نامنظم بین میزان تلاش و موفقیت نشان می‌دهند:

  • ARC Prize (ARC-AGI-3): مدل Sol High امتیاز ۲.۱٪ و Max امتیاز ۷.۸٪ گرفت (+۵.۷ درصد). این مدرکی مستقیم است که Max می‌تواند از سدهای سخت انتزاع عبور کند.
  • FutureSearch (تحقیق وب): تلاش بیشتر در واقع به GPT-5 (۴۹.۶٪ Low در برابر ۴۸.۱٪ High) و Gemini 3 Flash (۴۹.۹٪ Low در برابر ۴۷.۹٪ High) ضربه زد، در حالی که به Claude 4.6 Opus (۵۳.۱٪ Low به ۵۵.۰٪ High) کمک کرد. این نشان می‌دهد وقتی استدلال گلوگاه نباشد، محاسبات بیشتر می‌تواند منجر به نتایج بدتر شود.
  • CodeRabbit: مدل Sol در ۶۳.۷٪ وظایف طولانی‌مدت پذیرفته شد. جالب است که خروجی بیشتر می‌تواند نرخ بازیابی (Recall) را بالا ببرد اما دقت (Precision) را کاهش دهد؛ چارچوب بررسی CodeRabbit نشان داد Sol با ۲۳۱ کامنت خام به ۶۹.۷٪ پاس‌های کاربردی رسید.

قانون مسیریابی عملی

یافته‌ها یک استراتژی تصاعدی برای توسعه‌دهندگان پیشنهاد می‌دهند:
۱. باگ‌های محدود یا تغییرات کوچک: با حالت High شروع کنید. تنها در صورتی به Max ارتقا دهید که مکان‌یابی باگ همچنان نامشخص باشد یا High شکست بخورد. توجه داشته باشید که برای برخی اصلاحات، Max ممکن است عملکرد را کاهش دهد.
۲. پیاده‌سازی ویژگی‌ها: با High شروع کنید. تنها زمانی به Max بروید که هزینه شکست پروژه به‌اندازه‌ای باشد که جهش ۲.۴ برابری قیمت را توجیه کند.
۳. بازنویسی‌ها یا مهاجرت کد: به‌طور پیش‌فرض از Max استفاده کنید. سطح سازگاری در اینجا گسترده است و توانایی Max برای رسیدن به خروجی نهایی به‌طور چشمگیری بالاتر است (انتقال از حدود ۴/۵ چک به بیش از ۹/۱۰ چک).
۴. پروژه‌های جدید (Greenfield): بر اساس دامنه، از High یا Max استفاده کنید. اگر یک عامل (Agent) مسئولیت معماری، پیاده‌سازی و تاییدیه را بر عهده دارد، Max فضای جستجوی لازم برای تصمیمات معماری را فراهم می‌کند.

این تغییر در رویکرد به این معناست که هدف دیگر یافتن «باهوش‌ترین» تنظیمات نیست، بلکه یافتن بهینه ترین مسیر مسیریابی (Routing) برای پیچیدگی خاص هر وظیفه است.

اما تأثیر این ساختار هزینه‌ای بر استقرار عامل‌های خودمختار در مقیاس سازمانی پیچیده‌تر است — به تحلیل ما درباره استراتژی‌های کاهش هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها با تکیه بر تحلیل‌های تجربی (Experience) نشان می‌دهند که مقیاس‌پذیری محاسبات در زمان استنتاج، یک راه حل جادویی برای همه مسائل نیست. شرکت‌ها باید برای جلوگیری از اتلاف بودجه، سیستم‌های مسیریابی را جایگزین تنظیمات یکسره Max کنند.

تأثیر برای ایران

به‌دلیل هزینه‌های بالای توکن‌های خروجی و ورودی در حالت Max، استفاده از این پیکربندی برای تیم‌های کوچک ایرانی با بودجه محدود API به‌شدت ریسک‌زا است و توصیه می‌شود تنها برای بازنویسی‌های حیاتی کد استفاده شود.

·نگاه ما
تحریریه دات‌هوش

رابطه غیرخطی بین هزینه و کیفیت در Sol Max نشان می‌دهد که ما به سقف بازدهی محاسباتی در زمان استنتاج برای بسیاری از وظایف کدنویسی رسیده‌ایم. نکته کلیدی این است که «بیشتر فکر کردن» برای مدل، در وظایف ساده نه تنها بی‌فایده است، بلکه به‌دلیل پیچیدگی بیش از حد (Over-engineering) می‌تواند منجر به کاهش دقت شود. استراتژی آینده توسعه‌دهندگان باید از «انتخاب مدل هوشمندتر» به «مسیریابی هوشمندانه وظایف» (Task Routing) تغییر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.