پرش به محتوای اصلی
پرش به محتوای مقاله

کلود سونت ۵.۵: عملکرد مدل پرچم‌دار با ۳۰٪ هزینه کمتر

·۶ مهر ۱۴۰۵۵ دقیقه مطالعه
کلaude اوپوس ۵.۵ عملکرد فبل ۵.۱ را با هزینه کمتر دارد و نگارش کمتر «کلودی» وعده می‌دهد
کلaude اوپوس ۵.۵ عملکرد فبل ۵.۱ را با هزینه کمتر دارد و نگارش کمتر «کلودی» وعده می‌دهد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۳۰ درصدی هزینه مؤثر هر تسک بدون تغییر در قیمت توکن‌ها — این مدل از طریق بهینه‌سازی تعداد توکن‌های مصرفی و دسته‌بندی فراخوانی ابزارها، ارزان‌تر شده است، نه از طریق تخفیف قیمتی.

اگر امروز برای کارهای پیچیده کدنویسی از گران‌ترین مدل‌های هوش مصنوعی استفاده می‌کنید، احتمالاً از ماه آینده ۳۰٪ از هزینه‌های خود را پس می‌گیرید. آنتروپیک (Anthropic) در ۲۸ سپتامبر ۲۰۲۶ مدل Claude Sonnet 5.5 را منتشر کرد تا مرز بین مدل‌های میان‌رده و پرچم‌دار را به‌طور کامل از بین ببرد. این مدل میان‌رده جهشی عظیم در کدنویسی و کارهای دانشی ایجاد کرده است و شکاف عملکردی بین خود و مدل پرچم‌دار Opus 5.5 را تقریباً پاک کرده است.

این مدل جدید در واقع یک مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — است که برای حجم کاری روزمره متخصصان طراحی شده است. طبق گزارش‌های اولیه، سونت ۵.۵ در کارهایی مثل رفع باگ، نوشتن مستندات، ساخت ارائه‌ها و ایجاد جداول پیچیده، عملکردی تقریباً مشابه با مدل گران‌قیمت Opus 5.5 دارد.

همان‌طور که در تحلیل قبلی ما درباره‌ی سرعت و بهره‌وری هزینه‌ای این مدل اشاره کردیم، این عرضه نشان‌دهنده تغییری در جنگ قیمت‌گذاری هوش مصنوعی است. در حالی که مدل‌های سطح بالا مانند GPT-6 Sol و Opus 5.5 برای قضاوت‌های پیچیده هدف‌گذاری شده‌اند، سونت ۵.۵ برای گردش کار حرفه‌ای «روزمره» طراحی شده است. تفاوت سونت ۵.۵ با مدل‌های سطح بالا، شبیه تفاوت بین استخدام یک مشاور تخصصی گران‌قیمت و یک مدیر پروژه بسیار کارآمد است؛ شما برای کارهای رایج، تقریباً همان کیفیت خروجی را دریافت می‌کنید، اما کار سریع‌تر و با هزینه کمتر انجام می‌شود.

جایگاه در بازار و رقابت

آنتروپیک با خانواده مدل‌های Fable، Opus و Sonnet، مستقیماً با خط تولید GPT-6 شرکت OpenAI رقابت می‌کند. با این ترکیب، آنتروپیک اکنون برای هر یک از مدل‌های Astra، Sol و Luna شرکت OpenAI، یک رقیب مستقیم دارد.

به‌طور تقریبی، سلسله‌مراتب قدرت را می‌توان این‌گونه دید: Opus کمی بالاتر از Sol، Sonnet بالاتر از Luna و Fable بالاتر از Astra قرار می‌گیرد. این استراتژی در ادامه تلاش‌های آنتروپیک برای ایجاد توازنی جدید میان هزینه و عملکرد در مدل‌های زبانی است که پیش‌تر در مدل Fable مشاهده شد. با این حال، آنتروپیک به‌طور کلی در تمام سطوح قیمت‌های بالاتری را مطالبه می‌کند. به همین دلیل، وقتی تفاوت عملکردی بین این لایه‌های متناظر کم می‌شود، «قیمت» به عامل اصلی تصمیم‌گیری کاربران تبدیل می‌شود. انتظار می‌رود عرضه مدل Claude Haiku 5.5 در هفته‌های آینده — که بر روی موارد استفاده با حجم پردازش بالا و هزینه کم تمرکز دارد — به آنتروپیک کمک کند تا این شکاف قیمتی را پر کند.

تحلیل بنچمارک‌ها و عملکرد

به نقل از گزارش the-decoder.com، بیشترین جهش عملکرد در کدنویسی عامل‌محور (Agentic) رخ داده است. در آزمون Terminal-Bench 4.0، مدل سونت ۵.۵ به امتیاز ۷۰.۶٪ رسید که در مقاشه با ۱۰.۳٪ در نسخه سونت ۵، یک جهش خیره‌کننده است. جالب اینجاست که این مدل حتی از Opus 5.5 (با ۶۶.۴٪) نیز در این معیار خاص پیشی گرفته است.

سایر آمارهای کلیدی عملکرد عبارت‌اند از:

  • CursorBench 4.0: در بازسازی جلسات واقعی کدنویسی از ویرایشگر Cursor، مدل سونت ۵.۵ به امتیاز ۵۵.۵٪ رسید که تنها ۲ درصد با Opus 5.5 (۵۷.۸٪) فاصله دارد و بسیار بالاتر از امتیاز ۳۴.۱٪ در سونت ۵ است.
  • FrontierCode 1.1: در تنظیمات «High»، سونت ۵.۵ ده امتیاز بیشتر از سونت ۵ کسب کرد، در حالی که هزینه هر تسک تقریباً یک‌پنجم (یک پانزدهم) مدل قبلی است.
  • GDPval-AA: در کارهای دانشی در ۴۴ حرفه و ۹ صنعت مختلف، این مدل ۱۸۴۴ امتیاز کسب کرد که تقریباً با ۱۸۴۶ امتیاز Opus 5.5 برابری می‌کند و به‌طور قابل‌توجهی بالاتر از ۱۴۸۷ امتیاز GPT-6 Sol است.
  • AA Briefcase v1.1: مدل سونت ۵.۵ امتیاز ۱۸۱۱ را به دست آورد، در حالی که این رقم برای سونت ۵ برابر با ۱۳۵۹ و برای Opus 5.5 برابر با ۱۸۲۲ بود.
  • Humanity's Last Exam: با استفاده از ابزارها، این مدل به امتیاز ۶۴.۵٪ رسید که نسبت به ۵۴.۹٪ در سونت ۵ بهبود یافته است.
  • Chartography: نرخ تشخیص نمودارهای بصری از ۱۵.۶٪ در نسخه قبلی به ۶۱.۶٪ جهش یافت.
  • OSWorld 2.1: مدل در ارزیابی مهارت‌های کامپیوتری به امتیاز ۸۰.۱٪ دست یافت.

مکانیزم کاهش هزینه

آنتروپیک قیمت خام هر توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — را مشابه سونت ۵ نگه داشته است: ۲ دلار برای هر میلیون توکن ورودی، ۱۰ دلار برای هر میلیون توکن خروجی و ۰.۲۰ دلار برای خواندن حافظه پنهان (Cache reads). برای مقایسه، GPT-6 Luna با ۰.۱۰ دلار برای ورودی و ۰.۵۰ دلار برای خروجی ارزان‌تر است.

اما مدل جدید بسیار بهینه‌تر است. به دلیل استفاده از توکن‌های کمتر برای انجام یک تسک مشابه، هزینه مؤثر هر عملیات تا ۳۰٪ کاهش یافته است. این بهینه‌سازی در واقع کاهش هزینه عملیاتی در عین افزایش بهره‌وری است که یکی از اهداف اصلی عرضه این نسخه بود. همچنین سرعت تولید خروجی ۳۰٪ بیشتر شده است. این مدل اکنون فراخوانی ابزارها را به‌صورت دسته‌ای (Batch) و مکررتر انجام می‌دهد که تعداد کل مراحلی که برای رسیدن به یک راه حل لازم است را کاهش می‌دهد.

کاربران همچنین می‌توانند از تنظیمات قابل تغییر «میزان تلاش» (Effort) برای تعادل بین سرعت و کیفیت استفاده کنند. در تنظیمات Low یا Medium، سونت ۵.۵ در چندین بنچمارک از بهترین امتیازات سونت ۵ پیشی می‌گیرد، در حالی که هزینه هر تسک حدود یک‌دهم است.

تناقض در تنظیمات استدلال

یک نکته عجیب در مورد تنظیمات «میزان تلاش» وجود دارد. در سطح Max، عملکرد مدل در آزمون FrontierCode (۴۶.۲٪) در واقع ضعیف‌تر از سطح Xhigh (۵۲.۱٪) است.

آنتروپیک توضیح می‌دهد که تلاش حداکثری باعث فعال شدن یک تابع بازبینی کد می‌شود که کار را بین چندین عامل (Agent) فرعی تقسیم می‌کند. در برخی موارد، این فرآیند منجر به اتمام زمان (Timeout) یا ایجاد تغییراتی می‌شود که خارج از محدوده تسک است؛ هر دوی این موارد در بنچمارک FrontierCode جریمه می‌شوند.

امنیت و دسترسی

به دلیل توانایی به‌مراتب بالاتر مدل در حوزه امنیت سایبری، آنتروپیک حفاظ‌های جدیدی را معرفی کرده است. درخواست‌های پرخطر در زمینه امنیت سایبری اکنون به‌طور مشهود به مدل قدیمی‌تر سونت ۵ منتقل می‌شوند. متخصصان واجد شرایط می‌توانند از طریق یک برنامه گسترش‌یافته «تاییدیه سایبری» (Cyber Verification Program) برای دسترسی‌های سطح‌بندی شده درخواست دهند.

همچنین برای جلوگیری از حملات distillation — یعنی تلاش رقیبان برای استخراج دانش مدل و ساخت مدل‌های ارزان‌تر بر اساس آن — طبقه‌بندی‌های ایمنی جدیدی اضافه شده است. این رویکرد یادآور تأکید آنتروپیک بر توازن میان ایمنی و قابلیت‌ها در مدل Opus 5.5 است تا از سوءاستفاده‌های احتمالی جلوگیری شود. این همان اقداماتی است که در قدرتمندترین مدل‌های آنتروپیک استفاده شده و هدف آن جلوگیری از بهره‌برداری آزمایشگاه‌های رقیب، به‌ویژه در چین، برای پر کردن شکاف با آزمایشگاه‌های غربی است.

مدل سونت ۵.۵ هم‌اکنون از طریق Amazon Web Services (AWS)، گوگل کلاود و مایکروسافت آزور در دسترس است. توسعه‌دهندگان می‌توانند از طریق پلتفرم Claude و با استفاده از شناسه مدل claude-sonnet-5-5 به آن دسترسی پیدا کنند. این مدل مانند Opus 5.5 با سیاست «عدم ذخیره‌سازی داده‌ها» (Zero data retention) ارائه می‌شود.

فراتر از بنچمارک‌ها، تسترهای اولیه سونت ۵.۵ را به عنوان یک شریک گفتگو طبیعی‌تر توصیف می‌کنند که درک خوبی از طراحی دارد. این مدل می‌تواند رابط‌های کاربری (UI) را بازطراحی کند و قالب‌های اسلاید را چنان دقیق اجرا کند که نتایج به‌سختی نیاز به اصلاح داشته باشند. همچنین، این نخستین مدل خانواده سونت است که قادر است بازی Pokémon Red را تنها با استفاده از اسکرین‌شات‌ها بازی کند؛ کاری که پیش از این نیازمند الگوریتم‌های سفارشی بود.

برای کسب‌وکارها، این یعنی «کفِ هوشمندی» بالا آمده است. دیگر برای کدنویسی سطح بالا یا کارهای دانشی حرفه‌ای، نیازی به گران‌ترین مدل‌ها نیست و لایه میان‌رده برای تقریباً تمام عملیات‌های استاندارد شرکتی کافی است.

گام بعدی شما

  • اگر از API مدل‌های Opus استفاده می‌کنید، تسک‌های تکراری خود را به Sonnet 5.5 منتقل کنید تا ۳۰٪ در هزینه‌ها صرفه‌جویی کنید.
  • تنظیمات Effort را روی Xhigh تست کنید؛ طبق داده‌ها، لزوماً Max بهترین خروجی را در کدنویسی نمی‌دهد.
  • قابلیت‌های بصری جدید مدل را برای تحلیل نمودارهای پیچیده سازمانی به کار بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار بنچمارک‌های مستقل، ثابت می‌کند که بهره‌وری توکن‌ها می‌تواند جایگزین کاهش قیمت‌های خام شود. این تغییر باعث می‌شود استقرار عامل‌های هوش مصنوعی در مقیاس سازمانی به‌دلیل کاهش هزینه‌های استنتاج، اقتصادی‌تر شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است، اما کاهش هزینه استنتاج در لایه‌های ابری، هزینه نهایی سرویس‌های واسط ایرانی را کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های پرچم‌دار با میان‌رده‌ها نشان می‌دهد که ما به نقطه اشباع در کیفیت استنتاج برای کارهای اداری رسیده‌ایم. حالا رقابت از «چه کسی باهوش‌تر است» به «چه کسی با کمترین هزینه، همان سطح هوشمندی را ارائه می‌دهد» تغییر کرده است. این یعنی مدل‌های فوق‌سنگین به‌زودی فقط برای اکتشافات علمی یا استدلال‌های بسیار پیچیده باقی می‌مانند و بدنه اصلی اقتصاد AI روی مدل‌های بهینه متمرکز می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.