اگر امروز برای کارهای پیچیده کدنویسی از گرانترین مدلهای هوش مصنوعی استفاده میکنید، احتمالاً از ماه آینده ۳۰٪ از هزینههای خود را پس میگیرید. آنتروپیک (Anthropic) در ۲۸ سپتامبر ۲۰۲۶ مدل Claude Sonnet 5.5 را منتشر کرد تا مرز بین مدلهای میانرده و پرچمدار را بهطور کامل از بین ببرد. این مدل میانرده جهشی عظیم در کدنویسی و کارهای دانشی ایجاد کرده است و شکاف عملکردی بین خود و مدل پرچمدار Opus 5.5 را تقریباً پاک کرده است.
این مدل جدید در واقع یک مدل زبانی بزرگ (LLM) — شبیه کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — است که برای حجم کاری روزمره متخصصان طراحی شده است. طبق گزارشهای اولیه، سونت ۵.۵ در کارهایی مثل رفع باگ، نوشتن مستندات، ساخت ارائهها و ایجاد جداول پیچیده، عملکردی تقریباً مشابه با مدل گرانقیمت Opus 5.5 دارد.
همانطور که در تحلیل قبلی ما دربارهی سرعت و بهرهوری هزینهای این مدل اشاره کردیم، این عرضه نشاندهنده تغییری در جنگ قیمتگذاری هوش مصنوعی است. در حالی که مدلهای سطح بالا مانند GPT-6 Sol و Opus 5.5 برای قضاوتهای پیچیده هدفگذاری شدهاند، سونت ۵.۵ برای گردش کار حرفهای «روزمره» طراحی شده است. تفاوت سونت ۵.۵ با مدلهای سطح بالا، شبیه تفاوت بین استخدام یک مشاور تخصصی گرانقیمت و یک مدیر پروژه بسیار کارآمد است؛ شما برای کارهای رایج، تقریباً همان کیفیت خروجی را دریافت میکنید، اما کار سریعتر و با هزینه کمتر انجام میشود.
جایگاه در بازار و رقابت
آنتروپیک با خانواده مدلهای Fable، Opus و Sonnet، مستقیماً با خط تولید GPT-6 شرکت OpenAI رقابت میکند. با این ترکیب، آنتروپیک اکنون برای هر یک از مدلهای Astra، Sol و Luna شرکت OpenAI، یک رقیب مستقیم دارد.
بهطور تقریبی، سلسلهمراتب قدرت را میتوان اینگونه دید: Opus کمی بالاتر از Sol، Sonnet بالاتر از Luna و Fable بالاتر از Astra قرار میگیرد. این استراتژی در ادامه تلاشهای آنتروپیک برای ایجاد توازنی جدید میان هزینه و عملکرد در مدلهای زبانی است که پیشتر در مدل Fable مشاهده شد. با این حال، آنتروپیک بهطور کلی در تمام سطوح قیمتهای بالاتری را مطالبه میکند. به همین دلیل، وقتی تفاوت عملکردی بین این لایههای متناظر کم میشود، «قیمت» به عامل اصلی تصمیمگیری کاربران تبدیل میشود. انتظار میرود عرضه مدل Claude Haiku 5.5 در هفتههای آینده — که بر روی موارد استفاده با حجم پردازش بالا و هزینه کم تمرکز دارد — به آنتروپیک کمک کند تا این شکاف قیمتی را پر کند.
تحلیل بنچمارکها و عملکرد
به نقل از گزارش the-decoder.com، بیشترین جهش عملکرد در کدنویسی عاملمحور (Agentic) رخ داده است. در آزمون Terminal-Bench 4.0، مدل سونت ۵.۵ به امتیاز ۷۰.۶٪ رسید که در مقاشه با ۱۰.۳٪ در نسخه سونت ۵، یک جهش خیرهکننده است. جالب اینجاست که این مدل حتی از Opus 5.5 (با ۶۶.۴٪) نیز در این معیار خاص پیشی گرفته است.
سایر آمارهای کلیدی عملکرد عبارتاند از:
- CursorBench 4.0: در بازسازی جلسات واقعی کدنویسی از ویرایشگر Cursor، مدل سونت ۵.۵ به امتیاز ۵۵.۵٪ رسید که تنها ۲ درصد با Opus 5.5 (۵۷.۸٪) فاصله دارد و بسیار بالاتر از امتیاز ۳۴.۱٪ در سونت ۵ است.
- FrontierCode 1.1: در تنظیمات «High»، سونت ۵.۵ ده امتیاز بیشتر از سونت ۵ کسب کرد، در حالی که هزینه هر تسک تقریباً یکپنجم (یک پانزدهم) مدل قبلی است.
- GDPval-AA: در کارهای دانشی در ۴۴ حرفه و ۹ صنعت مختلف، این مدل ۱۸۴۴ امتیاز کسب کرد که تقریباً با ۱۸۴۶ امتیاز Opus 5.5 برابری میکند و بهطور قابلتوجهی بالاتر از ۱۴۸۷ امتیاز GPT-6 Sol است.
- AA Briefcase v1.1: مدل سونت ۵.۵ امتیاز ۱۸۱۱ را به دست آورد، در حالی که این رقم برای سونت ۵ برابر با ۱۳۵۹ و برای Opus 5.5 برابر با ۱۸۲۲ بود.
- Humanity's Last Exam: با استفاده از ابزارها، این مدل به امتیاز ۶۴.۵٪ رسید که نسبت به ۵۴.۹٪ در سونت ۵ بهبود یافته است.
- Chartography: نرخ تشخیص نمودارهای بصری از ۱۵.۶٪ در نسخه قبلی به ۶۱.۶٪ جهش یافت.
- OSWorld 2.1: مدل در ارزیابی مهارتهای کامپیوتری به امتیاز ۸۰.۱٪ دست یافت.
مکانیزم کاهش هزینه
آنتروپیک قیمت خام هر توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — را مشابه سونت ۵ نگه داشته است: ۲ دلار برای هر میلیون توکن ورودی، ۱۰ دلار برای هر میلیون توکن خروجی و ۰.۲۰ دلار برای خواندن حافظه پنهان (Cache reads). برای مقایسه، GPT-6 Luna با ۰.۱۰ دلار برای ورودی و ۰.۵۰ دلار برای خروجی ارزانتر است.
اما مدل جدید بسیار بهینهتر است. به دلیل استفاده از توکنهای کمتر برای انجام یک تسک مشابه، هزینه مؤثر هر عملیات تا ۳۰٪ کاهش یافته است. این بهینهسازی در واقع کاهش هزینه عملیاتی در عین افزایش بهرهوری است که یکی از اهداف اصلی عرضه این نسخه بود. همچنین سرعت تولید خروجی ۳۰٪ بیشتر شده است. این مدل اکنون فراخوانی ابزارها را بهصورت دستهای (Batch) و مکررتر انجام میدهد که تعداد کل مراحلی که برای رسیدن به یک راه حل لازم است را کاهش میدهد.
کاربران همچنین میتوانند از تنظیمات قابل تغییر «میزان تلاش» (Effort) برای تعادل بین سرعت و کیفیت استفاده کنند. در تنظیمات Low یا Medium، سونت ۵.۵ در چندین بنچمارک از بهترین امتیازات سونت ۵ پیشی میگیرد، در حالی که هزینه هر تسک حدود یکدهم است.
تناقض در تنظیمات استدلال
یک نکته عجیب در مورد تنظیمات «میزان تلاش» وجود دارد. در سطح Max، عملکرد مدل در آزمون FrontierCode (۴۶.۲٪) در واقع ضعیفتر از سطح Xhigh (۵۲.۱٪) است.
آنتروپیک توضیح میدهد که تلاش حداکثری باعث فعال شدن یک تابع بازبینی کد میشود که کار را بین چندین عامل (Agent) فرعی تقسیم میکند. در برخی موارد، این فرآیند منجر به اتمام زمان (Timeout) یا ایجاد تغییراتی میشود که خارج از محدوده تسک است؛ هر دوی این موارد در بنچمارک FrontierCode جریمه میشوند.
امنیت و دسترسی
به دلیل توانایی بهمراتب بالاتر مدل در حوزه امنیت سایبری، آنتروپیک حفاظهای جدیدی را معرفی کرده است. درخواستهای پرخطر در زمینه امنیت سایبری اکنون بهطور مشهود به مدل قدیمیتر سونت ۵ منتقل میشوند. متخصصان واجد شرایط میتوانند از طریق یک برنامه گسترشیافته «تاییدیه سایبری» (Cyber Verification Program) برای دسترسیهای سطحبندی شده درخواست دهند.
همچنین برای جلوگیری از حملات distillation — یعنی تلاش رقیبان برای استخراج دانش مدل و ساخت مدلهای ارزانتر بر اساس آن — طبقهبندیهای ایمنی جدیدی اضافه شده است. این رویکرد یادآور تأکید آنتروپیک بر توازن میان ایمنی و قابلیتها در مدل Opus 5.5 است تا از سوءاستفادههای احتمالی جلوگیری شود. این همان اقداماتی است که در قدرتمندترین مدلهای آنتروپیک استفاده شده و هدف آن جلوگیری از بهرهبرداری آزمایشگاههای رقیب، بهویژه در چین، برای پر کردن شکاف با آزمایشگاههای غربی است.
مدل سونت ۵.۵ هماکنون از طریق Amazon Web Services (AWS)، گوگل کلاود و مایکروسافت آزور در دسترس است. توسعهدهندگان میتوانند از طریق پلتفرم Claude و با استفاده از شناسه مدل claude-sonnet-5-5 به آن دسترسی پیدا کنند. این مدل مانند Opus 5.5 با سیاست «عدم ذخیرهسازی دادهها» (Zero data retention) ارائه میشود.
فراتر از بنچمارکها، تسترهای اولیه سونت ۵.۵ را به عنوان یک شریک گفتگو طبیعیتر توصیف میکنند که درک خوبی از طراحی دارد. این مدل میتواند رابطهای کاربری (UI) را بازطراحی کند و قالبهای اسلاید را چنان دقیق اجرا کند که نتایج بهسختی نیاز به اصلاح داشته باشند. همچنین، این نخستین مدل خانواده سونت است که قادر است بازی Pokémon Red را تنها با استفاده از اسکرینشاتها بازی کند؛ کاری که پیش از این نیازمند الگوریتمهای سفارشی بود.
برای کسبوکارها، این یعنی «کفِ هوشمندی» بالا آمده است. دیگر برای کدنویسی سطح بالا یا کارهای دانشی حرفهای، نیازی به گرانترین مدلها نیست و لایه میانرده برای تقریباً تمام عملیاتهای استاندارد شرکتی کافی است.
گام بعدی شما
- اگر از API مدلهای Opus استفاده میکنید، تسکهای تکراری خود را به Sonnet 5.5 منتقل کنید تا ۳۰٪ در هزینهها صرفهجویی کنید.
- تنظیمات Effort را روی Xhigh تست کنید؛ طبق دادهها، لزوماً Max بهترین خروجی را در کدنویسی نمیدهد.
- قابلیتهای بصری جدید مدل را برای تحلیل نمودارهای پیچیده سازمانی به کار بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو