پرش به محتوای اصلی
پرش به محتوای مقاله

Claude Opus 5 در شاخص هوش خنثی از GPT-5.6 Sol پیشی گرفت

·۵ مرداد ۱۴۰۵۱۶ دقیقه مطالعه۲ بازدید
مقایسه Claude Opus 5 و GPT-5.6 Sol در بنچمارک‌ها و هزینه واقعی ۲۰۲۶
مقایسه Claude Opus 5 و GPT-5.6 Sol در بنچمارک‌ها و هزینه واقعی ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی بنچمارک‌های تبلیغاتی با شاخص خنثی Artificial Analysis که نشان می‌دهد Opus 5 در استدلال‌های پیچیده لبه‌ای، حتی از برادر بزرگ‌تر خود (Fable 5) پیشی گرفته است.

اگر همین حالا در حال انتخاب بین دو مدل لبه (Frontier) برای یک سیستم عامل‌محور هستید، تفاوت ۶۱ در برابر ۵۹ در شاخص هوش Artificial Analysis می‌تواند مسیر شما را تغییر دهد. این تفاوت کوچک در عدد، در دنیای واقعی به معنای برتری Claude Opus 5 در تنها بنچمارک خنثی و شخص ثالثی است که هر دو مدل را در یک تراز می‌سنجد. در حال حاضر، انتخاب بین این دو مدل به این بستگی دارد که شما واکنش اولیه (Responsiveness) را اولویت قرار می‌دهید یا توان عملیاتی استریم خام (Raw streaming throughput) را.

این رقابت در حالی شکل می‌گیرد که صنعت از رابط‌های ساده‌ی چت به سمت گردش‌های کاری عامل‌محور (Agentic) — شبیه به تبدیل یک دستیار که فقط جواب می‌دهد به کارمندی که واقعاً کارها را انجام می‌دهد — حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهایی مثل cursor-bridge اشاره کردیم که دسترسی به محیط‌های کدنویسی پیشرفته را فراهم می‌کنند، نبرد بین Anthropic و OpenAI دیگر تنها بر سر هوش کلی نیست، بلکه روی معیارهای سخت‌گیرانه‌ای مثل «زمان تا نخستین توکن» و «هزینه به ازای هر میلیون توکن» متمرکز شده است. این رقابت اقتصادی و فنی در واقع تداوم بررسی‌های ما پیرامون موازنه هزینه و عملکرد در مدل‌های Opus 4.8 و GPT-5.6 است که پیش‌تر برای برنامه‌نویسان تحلیل کردیم. برای یک برنامه‌نویس، این انتخاب شبیه به خرید دو ورک‌استیشن گران‌قیمت است: یکی سریع‌تر بوت می‌شود و دیگری فریم‌ها را سریع‌تر رندر می‌کند.

تله‌ی بنچمارک‌های رسمی

طبق گزارش وب‌سایت dev.to در ۲۷ ژوئیه ۲۰۲۶، اکثر اعدادی که شرکت‌ها هنگام عرضه منتشر می‌کنند به دلیل استفاده از محیط‌های تست داخلی، غیرقابل مقایسه هستند. تنها معیار معتبر «سیب-در-مقابل-سیب»، شاخص Artificial Analysis Intelligence Index v4.1 است. این شاخص یک ترکیب موزون (Weighted composite) از ۹ ارزیابی مختلف است، از جمله GDPval-AA v2، Terminal-Bench v2.1، SciCode، Humanity's Last Exam، GPQA Diamond و AA-LCR. وزن‌دهی این شاخص به شدت روی کارهای عامل‌محور و کدنویسی متمرکز شده است: ۳۴٪ برای عامل‌ها، ۲۴٪ کدنویسی، ۲۴٪ استدلال علمی و ۱۸٪ هوش عمومی.

برتری دو امتیازی Opus 5 (۶۱ در برابر ۵۹) در حالت حداکثری (Max effort)، قوی‌ترین داده‌ی این مقایسه است، هرچند حاشیه برتری باریک است. برای درک بهتر، این شاخص مدل Claude Fable 5 را در امتیاز ۶۰ (حالت حداکثری) قرار داده است؛ این بدان معناست که Opus 5 حتی کمی بهتر از برادر بزرگ‌تر خودش عمل کرده، در حالی که Sol درست پایین‌تر از آن قرار دارد. یک فاصله دو امتیازی در یک ترکیب ۹-ارزیابی، یک ضربهٔ تمام‌کننده نیست؛ بلکه نشان می‌دهد Opus 5 دست‌کم با Sol در یک تست خنثی برابر است، اما لزوماً برتری آن را برای هر ریفکتور یا مهاجرت کد (Migration) خاص تضمین نمی‌کند.

چرا اعداد عرضه با هم همخوانی ندارند؟

به نقل از مستندات هر دو شرکت، ارقام منتشر شده بیشتر شبیه به کاتالوگ‌های تبلیغاتی هستند تا یک جدول مقایسه‌ای. ادعاهای Anthropic برای Opus 5 شامل این موارد است: پیشی گرفتن از تمام مدل‌های دیگر در Frontier-Bench v0.1 (که بیش از دو برابر Opus 4.8 است)، حفظ فاصله کمتر از ۰.۵٪ با پیک عملکرد Fable 5 در CursorBench 3.2 با نصف هزینه، و تقریباً سه برابر کردن عملکرد مدل بعدی در ARC-AGI-3. آن‌ها همچنین ادعای عملکرد State-of-the-art در GDPval-AA و شکست دادن Fable 5 در OSWorld 2.0 با یک‌سوم هزینه را دارند.

در مقابل، ارقام OpenAI برای GPT-5.6 Sol روی معیارهای متفاوتی تمرکز کرده است. آن‌ها امتیاز ۸۸.۸٪ در Terminal-Bench 2.1 (نسخه پایه) و ۵۳.۶ در Agents' Last Exam را گزارش کرده‌اند، جایی که تلاش متوسط (Medium effort) آن‌ها ۱۱.۴ امتیاز بیشتر از Fable 5 و تقریباً با یک‌چهارم هزینه است. این رویکرد OpenAI در قالب بهینه‌سازی هزینه‌های استنتاج در مدل Sol دنبال شده تا عملکردی مشابه Fable 5 را با هزینه بسیار کمتر ارائه دهد. آن‌ها همچنین به امتیاز ۶۴.۶٪ در SWE-Bench Pro اشاره کرده‌اند. با این حال، مقایسه این اعداد با گزارش ۸۰ درصدی Anthropic برای Fable 5 در همان بنچمارک گمراه‌کننده است، چرا که ارقام از اجراهای متفاوتی از محیط تست (Harness runs) به دست آمده‌اند.

موازنه سرعت و تأخیر

بر اساس بررسی‌های Artificial Analysis در ۲۷ ژوئیه ۲۰۲۶، عملکرد این دو مدل در شرایط فشار (Under load) متفاوت است:

  • سرعت خروجی: مدل GPT-5.6 Sol توکن‌ها را تقریباً ۱.۴ برابر سریع‌تر استریم می‌کند و به ۷۵.۹ توکن در ثانیه می‌رسد، در حالی که Opus 5 سرعت ۵۲.۸ توکن در ثانیه دارد. این موضوع Sol را به گزینه‌ای برتر برای تولید اسناد طولانی تبدیل می‌کند، جایی که کاربر متن را در حال استریم تماشا می‌کند.
  • زمان تا نخستین توکن (TTFT): مدل Claude Opus 5 تقریباً ۱.۹ برابر سریع‌تر اولین توکن را تولید می‌کند. در همین تست، Opus 5 در ۶۹.۷ ثانیه به اولین توکن رسید، در حالی که Sol ۱۲۹.۵ ثانیه زمان برد.

در دستیارهای کدنویسی تعاملی یا حلقه‌های فراخوانی ابزار (Tool-calling loops)، این تأخیر کمتر باعث می‌شود Opus 5 بسیار چابک‌تر به نظر برسد. اگرچه هر دو عدد TTFT بالا هستند (چون این‌ها مدل‌های استدلالی در تست‌های فشار بالا هستند)، اما ترتیب آن‌ها تعیین‌کننده است.

هزینه واقعی تولید

قیمت‌ها بسته به ارائه‌دهنده در حال تغییر است. در قیمت‌های رسمی فروشندگان، Opus 5 در خروجی حدود ۱۷٪ ارزان‌تر است (۲۵ دلار در برابر ۳۰ دلار به ازای هر میلیون توکن)، در حالی که هزینه‌های ورودی و کش (Cache) در هر دو مدل یکسان و به ترتیب ۵ دلار و ۰.۵۰ دلار است. طبق تخمین Artificial Analysis، هزینه ترکیبی (Blended cost) برای Opus 5 حدود ۳.۸۵ دلار و برای Sol حدود ۴.۳۵ دلار به ازای هر یک میلیون توکن است.

اما در پلتفرم ofox در ۲۷ ژوئیه ۲۰۲۶، محاسبات تغییر می‌کند. Sol در حال حاضر تحت یک جشنواره ۲۰ درصدی است که قیمت آن را به ۴ دلار ورودی، ۲۴ دلار خروجی و ۰.۴۰ دلار برای کش تغییر داده است. این باعث می‌شود Sol تا پایان دوره تخفیف در هر ردیف هزینه ارزان‌تر باشد، در حالی که Opus 5 در قیمت لیست (۵/۲۵/۰.۵۰ دلار) باقی مانده است.

یک ناوگان عامل کدنویسی را در نظر بگیرید که روزانه ۱۰۰,۰۰۰ درخواست ارسال می‌کند (۴ هزار ورودی، ۲ هزار خروجی):

  • بدون کش (Caching): هزینه ماهانه Opus 5 حدود ۲۱۰,۰۰۰ دلار و Sol در ofox حدود ۱۹۲,۰۰۰ دلار است (یک تفاوت ۱۸,۰۰۰ دلاری در ماه).
  • با نرخ ۷۰٪ کش: این فاصله کمتر می‌شود اما همچنان باقی می‌ماند. نرخ ورودی مؤثر Opus 5 به حدود ۱.۸۵ دلار و Sol به ۱.۴۸ دلار می‌رسد که منجر به هزینه ۱۷۲,۰۰۰ دلاری برای Opus 5 و ۱۶۲,۰۰۰ دلاری برای Sol در ماه می‌شود.

هزینه‌های اضافی شامل فراخوانی ابزارهاست: در ofox، هر جستجوی وب برای Sol مبلغ ۰.۰۳۵ دلار و برای Opus 5 مبلغ ۰.۰۱۵ دلار هزینه دارد. همچنین هزینه‌های سرعت متفاوت است؛ حالت Fast Mode در Opus 5 می‌تواند سرعت خروجی را تا ۲.۵ برابر افزایش دهد اما هزینه پایه را دو برابر می‌کند، در حالی که حالت‌های Pro و Ultra در Sol توکن‌های بیشتری را به ازای هر تسک مصرف می‌کنند.

ظرافت‌های فنی و API

جابه‌جایی بین این دو مدل فقط با تغییر یک رشته متنی انجام نمی‌شود. کنترل استدلال در هر دو اساساً متفاوت است:

  • Claude Opus 5: از یک نردبان تلاش تطبیقی (Adaptive thinking effort ladder) از سطح Low تا Max استفاده می‌کند و تفکر به‌صورت پیش‌فرض فعال است. اگر از مدل‌های قدیمی‌تر مثل Opus 4.8 که ساکت بودند استفاده می‌کردید، باید max_tokens را بالا ببرید تا پاسخ‌ها قطع نشوند. برای بازگرداندن رفتار قدیمی، تفکر را روی {"type": "disabled"} تنظیم کنید. توجه داشته باشید که غیرفعال کردن تفکر فقط در سطح تلاش High یا پایین‌تر مجاز است؛ تلاش برای غیرفعال کردن آن در حالت Max منجر به خطای ۴۰۰ می‌شود.
  • GPT-5.6 Sol: از پارامتر reasoning_effort (از None تا Xhigh) استفاده می‌کند. قدرتمندترین حالت آن یعنی «Ultra» — که یک معماری زیر-عاملی موازی است و به امتیاز ۹۱.۹٪ در Terminal-Bench رسیده است — نیازمند مهاجرت به OpenAI Responses API است و دیگر از نقطه انتهایی (Endpoint) استاندارد چت پشتیبانی نمی‌کند. نسخه Base Sol امتیاز ۸۸.۸٪ را در همین بنچمارک گرفته است. برای مدیریت دقیق‌تر این توازن، معرفی ۳ سطح جدید در GPT-5.6 امکان بهینه‌سازی دقیق‌تر بین هزینه و عملکرد را برای کاربران فراهم کرده است. نسخه Base Sol امتیاز ۸۸.۸٪ را در همین بنچمارک گرفته است.

در پلتفرم ofox، کاربران باید دقیقاً از شناسه openai/gpt-5.6-sol (یا نسخه‌های -terra/-luna) استفاده کنند، زیرا شناسه openai/gpt-5.6 شناسایی نمی‌شود و خطای ۴۰۴ بازمی‌گرداند.

راهنمای انتخاب مدل

از Claude Opus 5 استفاده کنید اگر:

  • قیمت لیست رسمی را می‌پردازید و حجم خروجی در صورت‌حساب شما غالب است.
  • تأخیر در اولین توکن (~۶۹.۷ ثانیه در برابر ~۱۲۹.۵ ثانیه) برای عامل‌های تعاملی شما حیاتی است.
  • به اتوماسیون دسکتاپ از طریق قاب‌بندی OSWorld 2.0 و AutomationBench شرکت Anthropic نیاز دارید.
  • هم‌اکنون از Claude Code یا پروتکل Anthropic استفاده می‌کنید؛ این مدل جایگزینی مستقیم (Drop-in replacement) برای Opus 4.8 است.
  • به دنبال بالاترین امتیاز خنثی (۶۱ در شاخص AA) هستید.

GPT-5.6 Sol را انتخاب کنید اگر:

  • از ofox برای بهره‌برداری از تخفیف ۲۰ درصدی (۴/۲۴/۰.۴۰ دلار) استفاده می‌کنید.
  • به بیشترین توان عملیاتی ممکن (۷۵.۹ توکن در ثانیه) برای پاسخ‌های طولانی نیاز دارید.
  • به حالت سنگین «Ultra» برای سخت‌ترین مسائل عامل‌محور نیاز دارید.
  • زیرساخت شما کاملاً OpenAI-native است و عمیقاً در Responses API ادغام شده است.
  • انعطاف‌پذیری در لایه‌ها می‌خواهید، زیرا می‌توانید با همان کلید API به مدل‌های ارزان‌تر Terra یا Luna سوییچ کنید.

استراتژی مسیریابی (Routing)

اجرای هر درخواست با یک مدل پرچم‌دار، اشتباهی هزینه‌بر است. برای کارهای با حجم بالا مثل طبقه‌بندی (Classification)، مسیریابی یا چت‌های کوتاه رابط، هر دو مدل بیش از حد قدرتمند (Overkill) هستند. کاربران باید تسک‌های ساده را به لایه‌های به‌صرفه منتقل کنند:

  • GPT-5.6 Luna: حدود ۰.۸۰ دلار ورودی / ۴.۸۰ دلار خروجی به ازای هر میلیون.
  • Claude Sonnet 5: حدود ۲ دلار ورودی / ۱۰ دلار خروجی به ازای هر میلیون.

رزرو کردن Opus 5 و Sol برای بخش‌هایی که استدلال سنگین نیاز دارند، نشان‌دهنده عصر جدیدی در معماری هوش مصنوعی است. تمرکز دیگر روی یافتن «بهترین» مدل نیست، بلکه روی ساخت بهین‌ترین خط لوله (Pipeline) برای موازنه هزینه، سرعت و هوش است.

تست A/B از طریق ofox

از آنجایی که هر دو مدل در یک نقطه انتهایی سازگار با OpenAI در ofox در دسترس هستند، موثرترین راه تصمیم‌گیری، یک تست A/B مستقیم روی ۲۰ تا ۳۰ تسک واقعی است. برنامه‌نویسان با استفاده از شناسه‌های anthropic/claude-opus-5 و openai/gpt-5.6-sol می‌توانند در پایتون یا Node.js حلقه‌هایی بسازند تا کیفیت و هزینه را در یک محیط یکسان اندازه بگیرند. این روش، بحث‌های روز اول عرضه درباره بنچمارک‌ها را با اعداد سختِ حاصل از حجم کاری (Workload) واقعی جایگزین می‌کند.

گام بعدی شما

  • برای تعیین برنده واقعی، ۲۰ تا ۳۰ تسک واقعی از دیتابیس خود را روی هر دو مدل در یک نقطه انتهایی مشترک (مثل ofox) تست کنید.
  • اگر از Claude Opus 5 استفاده می‌کنید، حتماً پارامتر max_tokens را برای جلوگیری از قطع شدن پاسخ‌های استدلالی افزایش دهید.
  • استراتژی مسیریابی را پیاده کنید تا درخواست‌های ساده را به لایه‌های Luna یا Sonnet منتقل کرده و هزینه را کاهش دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مقایسه بر اساس اعتبار داده‌های شخص ثالث نشان می‌دهد که انتخاب مدل دیگر یک تصمیم کیفی نیست، بلکه یک محاسبه ریاضی روی هزینه، سرعت پاسخ‌دهی و دقت است. شرکت‌ها باید بین «سرعت شروع» (Opus) و «سرعت تولید» (Sol) یکی را انتخاب کنند.

تأثیر برای ایران

دسترسی به این مدل‌ها برای توسعه‌دهندگان ایرانی از طریق پلتفرم‌های واسطی مثل ofox ممکن است، اما هزینه بالای استنتاج در مقیاس صنعتی، استفاده از مدل‌های کوچک‌تر (SLM) را برای استارتاپ‌های داخلی جذاب‌تر می‌کند.

·نگاه ما
تحریریه دات‌هوش

برتری Opus 5 در بنچمارک خنثی، پایان توهم «یک مدل برتر مطلق» را می‌رساند و جای آن را به بهینه‌سازی لایه‌ای می‌دهد. در واقع، رقابت از «هوش خام» به «کارایی عملیاتی» (تأخیر در برابر توان عملیاتی) منتقل شده است. استراتژی مسیریابی (Routing) که در این مقاله ذکر شد، احتمالاً به استاندارد اصلی معماری عامل‌های سازمانی در سال ۲۰۲۶ تبدیل خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.