اگر امروز برای پردازشهای سنگین هوش مصنوعی بودجه تخصیص میدهید، باید بدانید هزینهٔ هر تسک در مدل جدید Anthropic حدود ۲۰٪ ارزانتر شده است. این کاهش قیمت در حالی رخ میدهد که Claude Opus 5 در اکثر آزمونهای کلیدی، رقیب سرسخت خود یعنی Fable 5 را شکست داده است. این پیشرفت در تداوم روندی است که در گزارشهای پیشین درباره تطبیق عملکرد Opus 5 با مدل Fable 5 اما با هزینه استنتاج بسیار کمتر به آن پرداخته بودیم. طبق گزارش ۲۵ ژوئیه ۲۰۲۶ از Artificial Analysis، این مدل توانسته است موازنهٔ میان قیمت و عملکرد را به نفع کاربر تغییر دهد و در عین حال قیمت پایینتری را نسبت به نسلهای قبل حفظ کند.
ما در دوران «همگرایی مدلهای پیشرو» هستیم؛ وضعیتی که در آن تفاوت قدرت بین مدلهای برتر بسیار کم شده و رقابت از «جنگ برای هوش خالص» به «جنگ برای بهرهوری و ارزش» تغییر مسیر داده است. همانطور که در تحلیل قبلی ما دربارهی Claude Code و اتلاف توکنها در اثر ارکستراسیون اشاره کردیم، به نظر میرسد Anthropic اکنون تمرکز خود را روی بهینهسازی نسبت هزینه به عملکرد در مدل زیربنایی گذاشته است.
زمینه و جایگاه رقابتی
رقابت میان مدلهای پیشرو اکنون چنان تنگ شده است که تفاوتهای کوچک تعیینکننده هستند. مؤسسه Epoch AI اخیراً مدل Claude Opus 5 را آزمایش کرد و امتیاز کلی ۱۵۹ را در شاخص قابلیت Epoch (Epoch Capability Index) به آن اختصاص داد. این امتیاز مدل را درست پشت سر Fable 5 قرار میدهد که امتیاز ۱۶۱ را کسب کرده است. با این حال، در بنچمارکهای مهندسی نرمافزار (SWE-ECI)، مدل Opus 5 با امتیاز ۱۶۱ دقیقاً با Fable 5 برابر شده است. هر دو مدل در این بخش از Claude Opus 4.8 و GPT-5.6 Terra پیشی گرفتهاند، اگرچه GPT-5.6 Sol همچنان در هر دو دسته پیشتاز است.
این فقدان یک رهبر مطلق و بیرقیب، به این استدلال وزن میدهد که مدلهای هوش مصنوعی در حال تبدیل شدن به یک «کالای عمومی» (Commodity) هستند. وقتی هیچ مدل واحدی نمیتواند فاصلهٔ جدای و چشمگیری ایجاد کند، به این معناست که دستاوردهای عملکردی به صورت حاشیهای (Marginal) هستند و رقابت به سمت قیمتگذاری و کاربردهای خاص تغییر جهت میدهد.
عملکرد و بنچمارکها
مدل Claude Opus 5 در شاخص هوش Artificial Analysis امتیاز ۶۱ را کسب کرد. این شاخص نتایج نه آزمون مختلف را که شامل دقت واقعگرایانه، استدلال علمی، کدنویسی و کارهای دانشی است، تجمیع میکند. این امتیاز مدل را بالاتر از Claude Fable 5 (امتیاز ۶۰)، GPT-5.6 Sol (امتیاز ۵۹)، Kimi K3 (امتیاز ۵۷) و Claude Opus 4.8 (امتیاز ۵۶) قرار میدهد.

در حوزه کدنویسی و مهندسی خودکار، این مدل قدرت خیرهکنندهای نشان میدهد:
- شاخص عاملهای کدنویسی (Coding Agent Index): ترکیب Opus 5 و Claude Code با ۶۷ امتیاز، جایگاه نخست را با GPT-5.6 Sol (که از Codex استفاده میکند) تقسیم میکند.
- Terminal-Bench v2.1: در آزمایش عاملها به عنوان مهندسان خودکار در محیطهای واقعی ترمینال، Opus 5 در سطح استدلال «max» به دقت ۸۹٪ رسید و با رکورد قبلی یعنی GPT-5.6 Sol برابر شد.
- شاخص کدنویسی Artificial Analysis: مدل Opus 5 در تنظیمات «xhigh» در ترکیب با Claude Code، برای مدیریت وظایف برنامهنویسی و رفع باگها در صدر قرار دارد.
با این حال، استدلال علمی همچنان نتایج متناقضی دارد. این مدل در آزمون دشوار و چندرشتهای «آخرین امتحان بشریت» (Humanity's Last Exam) با ۵۳٪ با Fable 5 برابر شد. همچنین در CritPt، که یک بنچمارک فیزیک از طرف دانشگاه UIUC و آزمایشگاه ملی Argonne است، باز هم با Fable 5 برابر شد اما از GPT-5.5 Pro، GPT-5.6 Sol و GPT-5.6 Terra عقب ماند.

تحلیل توازن در سطوح استدلال
یکی از حیاتیترین یافتهها توسط Vals.ai منتشر شد. آنها پنج سطح استدلال یا مدل استدلالی (Reasoning Model) — مدلی که قبل از جواب، یک قدم درنگ میکند و فکر میکند، شبیه شطرنجبازی که چند حرکت جلوتر را میبیند — را در Vibe Code Bench برای تسکهای برنامهنویسی بررسی کردند. نتیجه این بود که هزینهٔ بیشتر، همیشه به معنای نتیجهٔ بهتر نیست:
- سطوح پایین تا متوسط: امتیازها از ۷۶.۷٪ (پایین) به ۸۲٪ (متوسط) افزایش مییابند.
- سطح High: قابلاعتمادترین نتایج کدنویسی با ۸۹.۸٪ را ارائه داد. این سطح راهکارهای سادهتری تولید میکند که با احتمال بیشتری با الزامات پروژه مطابقت دارند.
- سطح Max: راهکارهای پیچیدهتری تولید کرد که بیشتر شکست میخوردند و امتیاز ۸۸.۴٪ را کسب کردند. به همین ترتیب، سطح «xhigh» نیز امتیاز ۸۸.۳٪ را گرفت.

دادههای Terminal-Bench 2.1 الگوی مشابهی را نشان میدهد. سطح «high» بر «max» برتری دارد زیرا مدل در سطح بالاتر، زمان بیش از حدی را صرف هر تلاش میکند و در نتیجه تعداد کل تلاشهای موفق در بازه زمانی محدود کاهش مییابد. به همین دلیل Anthropic سطح «High» را به عنوان پیشفرض برای API و Claude Code تعیین کرده است.
کارهای دانشی و دقت
مدل Opus 5 در بنچمارک AA-Briefcase برای تسکهای اداری — مانند تحلیل صفحات گسترده، ساخت ارائهها و نوشتن گزارشها از میان هزاران فایل — مسلط است. عملکرد در اینجا با رتبهبندی Elo اندازهگیری میشود:
- استدلال Max: به امتیاز Elo ۱۷۲۰ میرسد که ۱۴۶ امتیاز بیشتر از Claude Fable 5 (امتیاز ۱۵۷۴) است.
- سطوح برتر: سطوح max، xhigh و high سه رتبه اول در AA-Briefcase را به طور کامل در اختیار دارند.
- GDPval-AA v2: مدل Opus 5 در سطح «max» به Elo ۱۸۶۱ میرسد که بسیار بالاتر از خط مبنای انسانی (۱۰۰۰) است.


بزرگترین پیشرفت در زمینه کیفیت تحلیل است؛ در سطح «max»، امتیاز کیفیت تحلیل (Analytical Quality Elo) به ۲۰۱۶ میرسد که تقریباً ۳۰۰ امتیاز از Fable 5 جلوتر است. نرخ پذیرش بر اساس معیارها (Rubric Pass Rate) برای سطح «max» برابر ۵۸٪، برای «xhigh» برابر ۵۷.۲٪ و برای «high» برابر ۵۶٪ است.
اما کیفیت ارائهها ضعیفتر است. Opus 5 امتیاز Elo ارائه ۱۶۲۸ را کسب کرد که از GPT-5.6 Sol در سطح «max» (امتیاز ۱۶۶۶) کمتر است. علاوه بر این، عملکرد بالاتر نیازمند زمان بیشتر است: سطح «max» بیش از ۳۶ دقیقه برای هر تسک با ۱۰۳ پاس مصرف میکند، در حالی که Opus 4.8 حدود ۲۴ دقیقه و ۵۵ پاس نیاز داشت.
دقت همچنان پاشنه آشیل این مدل است. اگرچه صحت پاسخها در AA-Omniscience نسبت به Opus 4.8 هفت امتیاز رشد کرد، اما نرخ توهم (Hallucination Rate) — یعنی وقتی مدل با اطمینان چیزی میگوید که اصلاً وجود ندارد — ۱۴ امتیاز افزایش یافت و به ۵۰٪ رسید؛ چراکه مدل در زمان تردید، تمایل بیشتری به پاسخ دادن دارد.
اقتصاد هوشمند
بهرهوری قیمتی، ویژگی برجسته این مدل است. هزینه یک تسک معمولی در شاخص هوش با Opus 5 حدود ۲.۰۳ دلار است، در حالی که برای Fable 5 این رقم ۲.۷۵ دلار بود. اگرچه این هزینه بیشتر از Opus 4.8 (۱.۸۰ دلار) و Sonnet 5 (۱.۵۳ دلار) است، اما Opus 5 در سطوح «high» و «xhigh» از هر دوی آنها در عملکرد بهتر است و در عین حال ارزانتر از Fable 5 باقی میماند.
در بنچمارک AA-Briefcase، هزینه هر تسک ۲۰٪ کاهش یافت و از ۲۲.۳۰ دلار (Fable 5) به ۱۷.۷۹ دلار رسید. تفکیک هزینهها بر اساس سطوح استدلال به این صورت است:
- سطح Max: ۱۷.۷۹ دلار
- سطح Xhigh: ۱۴.۲۶ دلار
- سطح High: ۱۰.۴۱ دلار (کمتر از نصف هزینه Fable 5)

قیمت توکنها ثابت مانده است: ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای هر میلیون توکن خروجی. هزینه نوشتن در کش (Cache writes) مبلغ ۶.۲۵ دلار برای هر میلیون توکن (با عمر پنج دقیقه) است و هزینه بازخوانی از کش (Cache hits) مبلغ ۰.۵۰ دلار است. با وجود امتیازات بالای GDPval-AA v2، مدل Opus 5 توکنهای بسیار بیشتری نسبت به رقبایش مصرف میکند، که همین موضوع استفاده از سطوح استدلال پایینتر را برای بهرهوری اقتصادی ضروری میکند.
گام بعدی شما
- برای تسکهای کدنویسی، به جای سطح Max از سطح High استفاده کنید تا از پیچیده کردن بیش از حد کد (Over-engineering) و هزینههای اضافی جلوگیری کنید.
- اگر تحلیلهای حجیم اداری انجام میدهید، Opus 5 در حال حاضر بهینهترین انتخاب از نظر کیفیت تحلیل است.
- نرخ توهم ۵۰ درصدی در سطح Max را جدی بگیرید و نتایج را با دقت بازبینی کنید.
اما تأثیر این مدل بر اکوسیستم توسعهدهندگان ایرانی و مدلهای محلی چیست؟ تحلیل ما درباره اثرات اقتصادی مدلهای ارزانقیمت را در گزارش بعدی میخوانید.




گفتگو