پرش به محتوای اصلی
پرش به محتوای مقاله

Claude Sonnet 5: کاهش هزینه استنتاج در کنار افزایش قابلیت‌های عامل‌محور

·۲۳ تیر ۱۴۰۵۷ دقیقه مطالعه
مقایسه مدل‌های کدنویسی Anthropic: بنچمارک، قیمت‌گذاری API و تعادل هزینه-عملکرد
مقایسه مدل‌های کدنویسی Anthropic: بنچمارک، قیمت‌گذاری API و تعادل هزینه-عملکرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی «سطوح تلاش» (Effort Levels) برای کنترل متغیر هزینه-کیفیت و بهینه‌سازی مدل برای پایداری در اجرای زنجیره‌ای ابزارها، به‌جای افزایش صرفِ پارامترها.

تست استقلال مدل‌های هوش مصنوعی دیگر با یک بنچمارک تک‌بعدی یا یک تیتر خبری ساده سنجیده نمی‌شود، بلکه معیار واقعی، میزان بقای یک مدل در یک زنجیره طولانی از وظایف است. آنتروپیک (Anthropic) در ۳۰ ژوئن ۲۰۲۶ با معرفی Claude Sonnet 5، پارادایم تمرکز را از بازیابی صرف دانش به «پایداری عامل‌محور» (agentic reliability) تغییر داد. این نسخه به‌گونه‌ای مهندسی شده است که بیشترین تمرکز را بر قابلیت‌های عاملی داشته باشد تا صرفاً یک پایگاه داده متنی باشد.

طبق اعلام این شرکت، این نسخه مدل‌ محورترین Sonnet تا به امروز است که به‌طور خاص برای برنامه‌ریزی، هدایت مرورگرها و ترمینال‌ها و اجرای خودکار وظایفی با مدت‌زمان طولانی طراحی شده است. این مدل می‌تواند به‌جای پاسخ‌های کوتاه، مسیرهای عملیاتی پیچیده را مدیریت کند.

این عرضه در حالی رخ می‌دهد که توسعه‌دهندگان از رابط‌های ساده‌ی چت فاصله گرفته و به سمت عامل (Agent)های خودکاری می‌روند که ابزارهای سیستم‌عامل، مرورگرها و ترمینال‌ها را کنترل می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی افزونه‌ی Claude-Meseeks و نبرد با «رانش جلسه» (session drift) اشاره کردیم، Sonnet 5 قصد دارد موتور قابل‌اطماینی برای این جریان‌های کاری باشد؛ به‌طوری که هنگام شکست در استفاده از ابزار (Tool Use)، توانایی خوداصلاحی بهتری داشته باشد و رفتار پایدارتری در جلسات طولانی‌مدت در محیط‌های Claude Code یا Cowork از خود نشان دهد.

از نظر جایگاه فنی، Sonnet 5 میان مدل سبک Haiku 4.5 و پرچمدار Opus 4.8 قرار می‌گیرد. این مدل ارتقای مستقیم Sonnet 4.6 است که در فوریه ۲۰۲۶ عرضه شده بود. در حال حاضر، Sonnet 5 پیش‌فرض جدید برای کاربران رایگان و Pro است و برای کاربران طرح‌های Max، Team و Enterprise به‌صورت انتخابی در دسترس است. همچنین این مدل به‌طور کامل در Claude Code و پلتفرم گسترده‌تر کلاود ادغام شده و آماده بهره‌برداری است.

بنچمارک‌ها و عملکرد

بر اساس مستندات رسمی آنتروپیک، Sonnet 5 در تمام دسته‌های منتشرشده از نسل پیشین خود پیشی گرفته و فاصله را با Opus 4.8 به‌شدت کم کرده است. بیشترین پیشرفت‌ها در کدنویسی عامل‌محور و استفاده از کامپیوتر دیده می‌شود:

  • SWE-bench Pro (کدنویسی عامل‌محور): امتیاز ۶۳.۲٪ را کسب کرد که بالاتر از ۵۸.۱٪ در Sonnet 4.6 است، هرچند هنوز پشت Opus 4.8 با ۶۹.۲٪ قرار دارد.
  • OSWorld-Verified (استفاده از کامپیوتر): این مدل به امتیاز ۸۱.۲٪ رسید که نسبت به ۷۸.۵٪ در نسخه قبلی بهبود یافته است.
  • Terminal-Bench 2.1: جهش قابل‌توجهی از ۶۷.۰٪ در Sonnet 4.6 به ۸۰.۴٪ داشت.
  • Humanity’s Last Exam (با ابزارها): امتیاز ۵۷.۴٪ را کسب کرد که تقریباً با ۵۷.۹٪ مدل پرچمدار Opus 4.8 برابری می‌کند و نشان‌دهنده توانایی بالای آن در حل مسائل دشوار است.

مقایسه مدل‌های Claude Sonnet 5، Sonnet 4.6 و Opus 4.8: بنچمارک کدنویسی، قیمت API و تعادل هزینه-عملکرد

یک نکته قابل توجه این است که Sonnet 5 در بنچمارک کارهای دانشی GDPval-AA v2 حتی از مدل پرچمدار پیشی گرفته است؛ به‌طوری که امتیاز ۱۶۱۸ را در مقابل ۱۶۱۵ برای Opus 4.8 به دست آورد. از آنجایی که این بنچمارک خاص از مقیاس متفاوتی استفاده می‌کند، به عنوان یک دستاورد متمایز ذکر شده و در نمودارهای درصدی استاندارد قرار نگرفته است.

اقتصاد سطوح تلاش (Effort Levels)

یکی از کلیدی‌ترین و تاثیرگذارترین اضافات در این نسخه، معرفی «سطوح تلاش» (effort levels) است که شامل چهار سطح low، medium، high و xhigh (بسیار بالا) می‌شود. سطوح بالاتر به مدل اجازه می‌دهد توکن‌های بیشتری را صرف استدلال و زنجیره تفکر (Chain-of-Thought) کند. این فرآیند کیفیت خروجی را به‌طور قابل توجهی بالا می‌برد، اما به‌طور همزمان هزینه کل هر وظیفه را افزایش می‌دهد.

مقایسه Claude Sonnet 5، Sonnet 4.6 و Opus 4.8: معیارهای کدنویسی هوشمند، قیمت API و تعادل هزینه-عملکرد

قیمت‌گذاری Sonnet 5 تا ۳۱ اوت ۲۰۲۶ در فاز معرفی (Introductory) است. در این بازه زمانی، نرخ ورودی ۲ دلار برای هر میلیون توکن و نرخ خروجی ۱۰ دلار برای هر میلیون توکن است. پس از این تاریخ، قیمت‌های استاندارد به ترتیب به ۳ و ۱۵ دلار تغییر خواهند کرد. در مقام مقایسه، Opus 4.8 همچنان با ۵ دلار برای ورودی و ۲۵ دلار برای خروجی، به‌طور چشمگیری گران‌تر است. همچنین تخفیف ۵۰ درصدی Batch API و قابلیت کشینگ استاندارد پرامپت (که در آن خواندن از کش ۰.۱ برابر هزینه ورودی است) برای این مدل فعال است.

با این حال، توسعه‌دهندگان باید تغییر در توکن‌سازی (Tokenization) را به دقت در نظر بگیرند. Sonnet 5 از توکن‌ساز به‌روز شده‌ای استفاده می‌کند که پیش‌تر در Opus 4.7 معرفی شده بود. این بدان معناست که یک متن مشابه ممکن است ۱.۰ تا ۱.۳۵ برابر توکن‌های بیشتری نسبت به نسخه‌های قبلی Sonnet مصرف کند. برای مثال، در یک تسک معمولی با ۲۰,۰۰۰ توکن ورودی و ۶,۰۰۰ توکن خروجی در ۵۰۰ تسک روزانه (با فرض ضریب ۱.۱۵)، هزینه هر تسک تقریباً ۰.۱۱۵ دلار و هزینه ماهانه حدود ۱,۷۲۵.۰۰ دلار خواهد بود.

جریان‌های کاری در دنیای واقعی

شرکای دسترسی زودهنگام استقرار موفقیت‌آمیز مدل در نقش‌های مهندسی و تجاری با پیچیدگی بالا را گزارش کرده‌اند. جریان‌های کاری عینی که با مشاغل مهندسی رایج مطابقت دارد، عبارتند از:

  • مهندسی نرم‌افزار چندمرحله‌ای: تست‌کننده‌ها از Sonnet 5 خواستند یک باگ را بررسی کند. مدل ابتدا یک تست برای بازتولید باگ نوشت، سپس اصلاحیه را پیاده‌سازی کرد و در نهایت تأیید نمود که در صورت حذف تغییرات، باگ دوباره بازمی‌گردد. تمام این مراحل در یک دور اجرا (Single Pass) کامل شد.
  • عیب‌یابی کدهای قدیمی (Brownfield Debugging): شرکا از این مدل برای بررسی Pull Requestهای دشوار استفاده کردند. مدل توانست خطاها را تا ریشه‌های اصلی (Root Causes) ردیابی کند و به‌جای وصله‌های سطحی برای رفع علائم، اصلاحات بادوامی را ارائه دهد.
  • اتوماسیون تجاری: شرکت Zapier از یک جریان کاری دو بخشی استفاده کرد که در آن عامل به‌طور خودکار سطوح حساب‌های Salesforce را به‌روزرسانی کرده و سپس ایمیل‌های لانچ را برای مخاطبان سازمانی از ابتدا تا انتها ارسال می‌نمود.
  • عامل‌های استفاده از کامپیوتر: شرکت Pace جریان‌های کاری بیمه، مانند پذیرش درخواست‌ها و گزارش‌های خسارت (loss runs) را با استفاده از عامل‌هایی اجرا می‌کند که مستقیماً روی سیستم‌های عملیاتی فعلی تیم‌ها اثر می‌گذارند.
  • کاوش داده‌ها: عامل‌های ClickHouse داده‌های زنده را کوئری کرده و تحلیل‌های آنی تولید می‌کنند. آن‌ها از استدلال‌های سریع‌تر برای کاهش زمان رسیدن به تحلیل‌های نهایی (Time-to-insight) برای تحلیلگران استفاده می‌کنند.

موازنه فنی و استراتژیک

با وجود تمام پیشرفت‌ها، Sonnet 5 جایگزین کامل Opus 4.8 نیست. مدل پرچمدار همچنان انتخاب اول برای کارهایی است که دقت در آن‌ها حیاتی است (accuracy-critical) و همچنین برای تسک‌های مجاز در حوزه امنیت سایبری. دلیل این امر آن است که Sonnet 5 به‌طور عمدی دارای قابلیت‌های سایبری پایینی است تا ایمنی و امنیت سیستم تضمین شود.

علاوه بر این، ارزش پیشنهادی مدل در بالاترین سطوح تلاش تغییر می‌کند. در سطح تلاش xhigh، هزینه اجرای Sonnet 5 ممکن است بدون ایجاد افزایش متناسب در کیفیت، از هزینه Opus 4.8 بیشتر شود. بنابراین، Sonnet 5 در سطوح تلاش low و medium، بیشترین ارزش خرید و بهینه‌ترین گزینه است.

این موضوع منطق مسیریابی (Routing) جدیدی را برای توسعه‌دهندگان ایجاد می‌کند:

  • Haiku 4.5 برای فراخوانی‌های حجیم و حساس به تأخیر (Latency-sensitive).
  • Sonnet 5 برای بخش اعظم کدنویسی عامل‌محور، استفاده از ابزارها و کارهای دانشی.
  • Opus 4.8 برای سخت‌گیرانه‌ترین نیازهای دقت و تسک‌های حیاتی.

از منظر کل صنعت، این یک چرخش به سمت «سطح رویه هزینه-عملکرد» (cost-performance surface area) است تا دسترسی به «سقف قابلیت‌ها». آنتروپیک عملاً ابزاری با استدلال لایه‌بندی‌شده ارائه می‌دهد که توسعه‌دهنده تصمیم می‌گیرد دقیقاً چه مقدار محاسبه برای یک وظیفه خاص «کافی» است. از نظر قیمت هر توکن، Sonnet 5 ارزان‌تر از GPT-5.5 و Gemini 3.1 Pro است، هرچند Gemini 3.5 Flash همچنان ارزان‌ترین گزینه بازار است. همچنین پنجره زمینه (Context Window) این مدل ۱ میلیون توکن است.

واکنش جامعه و ادغام API

واکنش‌ها در Hacker News و X متناقض است. تحلیل واکنش‌های اولیه نشان می‌دهد ۳۸٪ مثبت، ۳۸٪ خنثی/مختلط و ۲۵٪ منفی بوده‌اند. کاربرانی مانند @kimmonismus عملکرد نزدیک به Opus 4.8 را با قیمت پایین‌تر ستودند، در حالی که منتقدانی چون andai استدلال کردند که کاربران برای کارهای واقعاً سخت همچنان باید از مدل‌های بزرگ‌تر استفاده کنند. توسعه‌دهندگان دیگری، به‌ویژه در r/LocalLLaMA، شروع به مقایسه نسبت قیمت-عملکرد Sonnet 5 با مدل‌های وزن‌باز (open-weights) مانند GLM-5.2 (با ۷۴۴ میلیارد پارامتر) و K2.7 کرده‌اند.

شما می‌توانید همین امروز با به‌روزرسانی ساده‌ی رشته‌ی مدل (model string) در فراخوانی‌های API خود، مهاجرت را آغاز کنید. این تغییر به‌صورت Drop-in است و نیاز به بازنویسی کد ندارد:

import anthropic
client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=1024,
    messages=[
        {"role": "user", "content": "Find the race condition in worker.py and ship a tested fix."}
    ],
)
print(message.content[0].text)

گام بعدی شما

  • اگر از Agentهای کدنویسی استفاده می‌کنید، مدل را به claude-sonnet-5 تغییر دهید تا پایداری در تسک‌های طولانی و زنجیره‌ای را تست کنید.
  • سطوح Effort را بر اساس ماتریس هزینه-کیفیت بهینه‌سازی کنید؛ برای اکثر کارهای روزمره، سطح Medium بهینه‌ترین نقطه است.
  • تاثیر توکن‌ساز جدید را روی هزینه‌های ماهانه خود با ضربدر ۱.۱۵ در تعداد توکن‌ها محاسبه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش هزینه استنتاج و افزایش قابلیت‌های عملیاتی، موانع مالی استقرار عامل‌های خودمختار را در مقیاس صنعتی می‌زداند. بر اساس تجربه عملی توسعه‌دهندگان، این تغییر باعث می‌شود اتوماسیون‌های پیچیده از محیط آزمایشگاه به محیط تولید (Production) منتقل شوند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به Sonnet 5 برای توسعه‌دهندگان ایرانی دشوار است و عمدتاً از طریق واسطه‌ها یا پروکسی‌ها امکان‌پذیر است.

·نگاه ما
تحریریه دات‌هوش

تمرکز آنتروپیک بر «پایداری عامل‌محور» به‌جای SOTA در بنچمارک‌های دانشی، نشان می‌دهد که رقابت از مرحله «چه کسی می‌داند» به «چه کسی می‌تواند به‌درستی اجرا کند» رسیده است. معرفی سطوح Effort عملاً مدل را به یک ابزار متغیر تبدیل می‌کند که در آن توسعه‌دهنده به‌جای انتخاب مدل، «مقدار محاسبه» را خریداری می‌کند. این رویکرد، مدل‌های میانی را به مرکز ثقل عملیاتی تبدیل کرده و مدل‌های عظیم را به ابزارهایی برای بازبینی نهایی (Review) تقلیل می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.