پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش عملکرد: Claude Opus 5 در کدنویسی از Fable 5 پیشی گرفت

·۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
هزینه Claude Opus 5 انسان‌نما بسیار کمتر از Fable 5 است، اما در اکثر معیارها برابری یا برتری دارد.
هزینه Claude Opus 5 انسان‌نما بسیار کمتر از Fable 5 است، اما در اکثر معیارها برابری یا برتری دارد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۲۰ درصدی هزینه استنتاج در عین افزایش عملکرد در کارهای اداری و کدنویسی. همچنین شناسایی یک نقطه شکست در سطوح بالای استدلال (Max Tier) که منجر به افزایش توهم و کاهش دقت می‌شود.

اگر امروز برای پردازش‌های سنگین هوش مصنوعی بودجه تخصیص می‌دهید، باید بدانید هزینهٔ هر تسک در مدل جدید Anthropic حدود ۲۰٪ ارزان‌تر شده است. این کاهش قیمت در حالی رخ می‌دهد که Claude Opus 5 در اکثر آزمون‌های کلیدی، رقیب سرسخت خود یعنی Fable 5 را شکست داده است. این پیشرفت در تداوم روندی است که در گزارش‌های پیشین درباره تطبیق عملکرد Opus 5 با مدل Fable 5 اما با هزینه استنتاج بسیار کمتر به آن پرداخته بودیم. طبق گزارش ۲۵ ژوئیه ۲۰۲۶ از Artificial Analysis، این مدل توانسته است موازنهٔ میان قیمت و عملکرد را به نفع کاربر تغییر دهد و در عین حال قیمت پایین‌تری را نسبت به نسل‌های قبل حفظ کند.

ما در دوران «همگرایی مدل‌های پیشرو» هستیم؛ وضعیتی که در آن تفاوت قدرت بین مدل‌های برتر بسیار کم شده و رقابت از «جنگ برای هوش خالص» به «جنگ برای بهره‌وری و ارزش» تغییر مسیر داده است. همان‌طور که در تحلیل قبلی ما درباره‌ی Claude Code و اتلاف توکن‌ها در اثر ارکستراسیون اشاره کردیم، به نظر می‌رسد Anthropic اکنون تمرکز خود را روی بهینه‌سازی نسبت هزینه به عملکرد در مدل زیربنایی گذاشته است.

زمینه و جایگاه رقابتی

رقابت میان مدل‌های پیشرو اکنون چنان تنگ شده است که تفاوت‌های کوچک تعیین‌کننده هستند. مؤسسه Epoch AI اخیراً مدل Claude Opus 5 را آزمایش کرد و امتیاز کلی ۱۵۹ را در شاخص قابلیت Epoch (Epoch Capability Index) به آن اختصاص داد. این امتیاز مدل را درست پشت سر Fable 5 قرار می‌دهد که امتیاز ۱۶۱ را کسب کرده است. با این حال، در بنچمارک‌های مهندسی نرم‌افزار (SWE-ECI)، مدل Opus 5 با امتیاز ۱۶۱ دقیقاً با Fable 5 برابر شده است. هر دو مدل در این بخش از Claude Opus 4.8 و GPT-5.6 Terra پیشی گرفته‌اند، اگرچه GPT-5.6 Sol همچنان در هر دو دسته پیشتاز است.

این فقدان یک رهبر مطلق و بی‌رقیب، به این استدلال وزن می‌دهد که مدل‌های هوش مصنوعی در حال تبدیل شدن به یک «کالای عمومی» (Commodity) هستند. وقتی هیچ مدل واحدی نمی‌تواند فاصلهٔ جدای و چشمگیری ایجاد کند، به این معناست که دستاوردهای عملکردی به صورت حاشیه‌ای (Marginal) هستند و رقابت به سمت قیمت‌گذاری و کاربردهای خاص تغییر جهت می‌دهد.

عملکرد و بنچمارک‌ها

مدل Claude Opus 5 در شاخص هوش Artificial Analysis امتیاز ۶۱ را کسب کرد. این شاخص نتایج نه آزمون مختلف را که شامل دقت واقع‌گرایانه، استدلال علمی، کدنویسی و کارهای دانشی است، تجمیع می‌کند. این امتیاز مدل را بالاتر از Claude Fable 5 (امتیاز ۶۰)، GPT-5.6 Sol (امتیاز ۵۹)، Kimi K3 (امتیاز ۵۷) و Claude Opus 4.8 (امتیاز ۵۶) قرار می‌دهد.

هزینه کلود اوپوس ۵ پایین‌تر از فیبل ۵، در حالی که در اکثر معیارها برابری یا برتری دارد.

در حوزه کدنویسی و مهندسی خودکار، این مدل قدرت خیره‌کننده‌ای نشان می‌دهد:

  • شاخص عامل‌های کدنویسی (Coding Agent Index): ترکیب Opus 5 و Claude Code با ۶۷ امتیاز، جایگاه نخست را با GPT-5.6 Sol (که از Codex استفاده می‌کند) تقسیم می‌کند.
  • Terminal-Bench v2.1: در آزمایش عامل‌ها به عنوان مهندسان خودکار در محیط‌های واقعی ترمینال، Opus 5 در سطح استدلال «max» به دقت ۸۹٪ رسید و با رکورد قبلی یعنی GPT-5.6 Sol برابر شد.
  • شاخص کدنویسی Artificial Analysis: مدل Opus 5 در تنظیمات «xhigh» در ترکیب با Claude Code، برای مدیریت وظایف برنامه‌نویسی و رفع باگ‌ها در صدر قرار دارد.

با این حال، استدلال علمی همچنان نتایج متناقضی دارد. این مدل در آزمون دشوار و چندرشته‌ای «آخرین امتحان بشریت» (Humanity's Last Exam) با ۵۳٪ با Fable 5 برابر شد. همچنین در CritPt، که یک بنچمارک فیزیک از طرف دانشگاه UIUC و آزمایشگاه ملی Argonne است، باز هم با Fable 5 برابر شد اما از GPT-5.5 Pro، GPT-5.6 Sol و GPT-5.6 Terra عقب ماند.

مقایسه هزینه و عملکرد Claude Opus 5 با Fable 5 در بنچ‌مارک‌ها

تحلیل توازن در سطوح استدلال

یکی از حیاتی‌ترین یافته‌ها توسط Vals.ai منتشر شد. آن‌ها پنج سطح استدلال یا مدل استدلالی (Reasoning Model) — مدلی که قبل از جواب، یک قدم درنگ می‌کند و فکر می‌کند، شبیه شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — را در Vibe Code Bench برای تسک‌های برنامه‌نویسی بررسی کردند. نتیجه این بود که هزینهٔ بیشتر، همیشه به معنای نتیجهٔ بهتر نیست:

  • سطوح پایین تا متوسط: امتیازها از ۷۶.۷٪ (پایین) به ۸۲٪ (متوسط) افزایش می‌یابند.
  • سطح High: قابل‌اعتمادترین نتایج کدنویسی با ۸۹.۸٪ را ارائه داد. این سطح راهکارهای ساده‌تری تولید می‌کند که با احتمال بیشتری با الزامات پروژه مطابقت دارند.
  • سطح Max: راهکارهای پیچیده‌تری تولید کرد که بیشتر شکست می‌خوردند و امتیاز ۸۸.۴٪ را کسب کردند. به همین ترتیب، سطح «xhigh» نیز امتیاز ۸۸.۳٪ را گرفت.

هزینه کلود اوپوس ۵ پایین‌تر از فیبل ۵، در حالی که در اکثر معیارها برابری یا برتری دارد.

داده‌های Terminal-Bench 2.1 الگوی مشابهی را نشان می‌دهد. سطح «high» بر «max» برتری دارد زیرا مدل در سطح بالاتر، زمان بیش از حدی را صرف هر تلاش می‌کند و در نتیجه تعداد کل تلاش‌های موفق در بازه زمانی محدود کاهش می‌یابد. به همین دلیل Anthropic سطح «High» را به عنوان پیش‌فرض برای API و Claude Code تعیین کرده است.

کارهای دانشی و دقت

مدل Opus 5 در بنچمارک AA-Briefcase برای تسک‌های اداری — مانند تحلیل صفحات گسترده، ساخت ارائه‌ها و نوشتن گزارش‌ها از میان هزاران فایل — مسلط است. عملکرد در اینجا با رتبه‌بندی Elo اندازه‌گیری می‌شود:

  • استدلال Max: به امتیاز Elo ۱۷۲۰ می‌رسد که ۱۴۶ امتیاز بیشتر از Claude Fable 5 (امتیاز ۱۵۷۴) است.
  • سطوح برتر: سطوح max، xhigh و high سه رتبه اول در AA-Briefcase را به طور کامل در اختیار دارند.
  • GDPval-AA v2: مدل Opus 5 در سطح «max» به Elo ۱۸۶۱ می‌رسد که بسیار بالاتر از خط مبنای انسانی (۱۰۰۰) است.

هزینه کلود اوپوس ۵ پایین‌تر از فیبل ۵، در حالی که در اکثر معیارها برابری یا برتری دارد.

هزینه کلود اوپوس ۵ پایین‌تر از فیبل ۵، در حالی که در اکثر معیارها برابری یا برتری دارد.

بزرگترین پیشرفت در زمینه کیفیت تحلیل است؛ در سطح «max»، امتیاز کیفیت تحلیل (Analytical Quality Elo) به ۲۰۱۶ می‌رسد که تقریباً ۳۰۰ امتیاز از Fable 5 جلوتر است. نرخ پذیرش بر اساس معیارها (Rubric Pass Rate) برای سطح «max» برابر ۵۸٪، برای «xhigh» برابر ۵۷.۲٪ و برای «high» برابر ۵۶٪ است.

اما کیفیت ارائه‌ها ضعیف‌تر است. Opus 5 امتیاز Elo ارائه ۱۶۲۸ را کسب کرد که از GPT-5.6 Sol در سطح «max» (امتیاز ۱۶۶۶) کمتر است. علاوه بر این، عملکرد بالاتر نیازمند زمان بیشتر است: سطح «max» بیش از ۳۶ دقیقه برای هر تسک با ۱۰۳ پاس مصرف می‌کند، در حالی که Opus 4.8 حدود ۲۴ دقیقه و ۵۵ پاس نیاز داشت.

دقت همچنان پاشنه آشیل این مدل است. اگرچه صحت پاسخ‌ها در AA-Omniscience نسبت به Opus 4.8 هفت امتیاز رشد کرد، اما نرخ توهم (Hallucination Rate) — یعنی وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد — ۱۴ امتیاز افزایش یافت و به ۵۰٪ رسید؛ چراکه مدل در زمان تردید، تمایل بیشتری به پاسخ دادن دارد.

اقتصاد هوشمند

بهره‌وری قیمتی، ویژگی برجسته این مدل است. هزینه یک تسک معمولی در شاخص هوش با Opus 5 حدود ۲.۰۳ دلار است، در حالی که برای Fable 5 این رقم ۲.۷۵ دلار بود. اگرچه این هزینه بیشتر از Opus 4.8 (۱.۸۰ دلار) و Sonnet 5 (۱.۵۳ دلار) است، اما Opus 5 در سطوح «high» و «xhigh» از هر دوی آن‌ها در عملکرد بهتر است و در عین حال ارزان‌تر از Fable 5 باقی می‌ماند.

در بنچمارک AA-Briefcase، هزینه هر تسک ۲۰٪ کاهش یافت و از ۲۲.۳۰ دلار (Fable 5) به ۱۷.۷۹ دلار رسید. تفکیک هزینه‌ها بر اساس سطوح استدلال به این صورت است:

  • سطح Max: ۱۷.۷۹ دلار
  • سطح Xhigh: ۱۴.۲۶ دلار
  • سطح High: ۱۰.۴۱ دلار (کمتر از نصف هزینه Fable 5)

هزینه کلود اوپوس ۵ پایین‌تر از فیبل ۵، در حالی که در اکثر معیارها برابری یا برتری دارد.

قیمت توکن‌ها ثابت مانده است: ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای هر میلیون توکن خروجی. هزینه نوشتن در کش (Cache writes) مبلغ ۶.۲۵ دلار برای هر میلیون توکن (با عمر پنج دقیقه) است و هزینه بازخوانی از کش (Cache hits) مبلغ ۰.۵۰ دلار است. با وجود امتیازات بالای GDPval-AA v2، مدل Opus 5 توکن‌های بسیار بیشتری نسبت به رقبایش مصرف می‌کند، که همین موضوع استفاده از سطوح استدلال پایین‌تر را برای بهره‌وری اقتصادی ضروری می‌کند.

گام بعدی شما

  • برای تسک‌های کدنویسی، به جای سطح Max از سطح High استفاده کنید تا از پیچیده کردن بیش از حد کد (Over-engineering) و هزینه‌های اضافی جلوگیری کنید.
  • اگر تحلیل‌های حجیم اداری انجام می‌دهید، Opus 5 در حال حاضر بهینه‌ترین انتخاب از نظر کیفیت تحلیل است.
  • نرخ توهم ۵۰ درصدی در سطح Max را جدی بگیرید و نتایج را با دقت بازبینی کنید.

اما تأثیر این مدل بر اکوسیستم توسعه‌دهندگان ایرانی و مدل‌های محلی چیست؟ تحلیل ما درباره اثرات اقتصادی مدل‌های ارزان‌قیمت را در گزارش بعدی می‌خوانید.

چرا این موضوع مهم است؟

این به‌روزرسانی نشان می‌دهد که رقابت مدل‌های پیشرو از مرحله افزایش خام قدرت به مرحله بهینه‌سازی هزینه وارد شده است. بر اساس داده‌های Artificial Analysis، این مدل با کاهش ۲۰ درصدی هزینه‌ها، استانداردهای جدیدی برای بهره‌وری در کارهای دانشی تعریف می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به سطوح استدلال جدید Opus 5 برای توسعه‌دهندگان ایرانی دشوار است و احتمالاً از طریق واسطه‌ها با هزینه بیشتر در دسترس قرار می‌گیرد.

·نگاه ما
تحریریه دات‌هوش

کاهش هزینه در Opus 5 یک استراتژی دفاعی در برابر کالاشده شدن است؛ وقتی مدل‌ها در سطح هوش به سقف مشابهی می‌رسند، تنها راه حفظ سهم بازار، پایین آوردن قیمت است. نکته تکان‌دهنده، رابطه معکوس بین پیچیدگی استدلال (سطح Max) و صحت پاسخ‌هاست که نشان می‌دهد «بیشتر فکر کردن» در مدل‌های فعلی لزوماً به معنای «درست‌تر فکر کردن» نیست.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.