پرش به محتوای اصلی
پرش به محتوای مقاله

آنتروپیک: هزینهٔ عملیاتی Claude Sonnet 5.5 تا ۳۰٪ کاهش یافت

·۶ مهر ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
نسخه جدید Claude Sonnet 5.5 با قابلیت‌های پیشرفته درک و استدلال معرفی شد.
نسخه جدید Claude Sonnet 5.5 با قابلیت‌های پیشرفته درک و استدلال معرفی شد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۳۰ درصدی هزینه هر تسک بدون تغییر در قیمت توکن‌ها — این کاهش از طریق بهینه‌سازی تعداد گام‌های استنتاج و دسته‌بندی ابزارها حاصل شده است، نه تخفیف قیمتی.

اگر امروز برای استنتاج مدل‌های میان‌رده هزینه پرداخت می‌کنید، صورت‌حساب ماهانه شما برای هر تسک ۳۰٪ ارزان‌تر می‌شود. این وعدهٔ اصلی آنتروپیک در معرفی کلود سونت ۵.۵ (Claude Sonnet 5.5) است که در ۲۸ سپتامبر ۲۰۲۶ عرضه شد. این مدل میان‌رده، تعادلی میان عملکرد سطح بالا، سرعت تهاجمی و بهره‌وری هزینه ایجاد کرده است تا هزینه‌های استنتاج برای کارهای روزمره هوش مصنوعی را به شدت کاهش دهد.

این مدل در حالی وارد بازار می‌شود که شرکت‌ها از چت‌بات‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندانی که می‌توانند هزاران گام کاری را بدون نظارت انسان طی کنند — حرکت می‌کنند. این عامل‌ها به جای یک پاسخ ساده، نیاز به هزاران مرحله تکرار شونده دارند. همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهای امنیتی مانند WPPilot و نحوه تأمین دسترسی امن کلود به محیط‌های پیچیده اشاره کردیم، سونت ۵.۵ دقیقاً برای این گردش‌کارهای حجیم و چندمرحله‌ای طراحی شده است؛ جایی که هزینهٔ هر تسک، گلوگاه اصلی رشد و مقیاس‌پذیری است.

زمینه: اکوسیستم خانواده کلود ۵.۵

سونت ۵.۵ به عنوان مکمل سریع‌تر و ارزان‌تر مدل کلود اوپوس ۵.۵ (Claude Opus 5.5) معرفی شده است. این مدل در ادامه استراتژی بهینه‌سازی هزینه‌های آنتروپیک قرار دارد، مشابه آنچه پیش‌تر در کاهش ۴۰ درصدی هزینه‌های استنتاج برای مدل اوپوس ۵.۵ شاهد بودیم. طبق اعلام آنتروپیک، در حالی که اوپوس برای کارهای بسیار پیچیده که نیاز به قضاوت دقیق و استدلال‌های عمیق دارند ساخته شده است، سونت در تسک‌های روزمره با محدوده مشخص، رفع باگ‌های نرم‌افزاری و تولید اسناد حرفه‌ای، اسلایدها و صفحات گسترده (Spreadsheets) می‌درخشد.

برای تکمیل این خانواده، مدل کلود هایکو ۵.۵ (Claude Haiku 5.5) که برای کاربردهای بسیار حجیم و حساس به هزینه طراحی شده، در هفته‌های آینده به این خط تولید اضافه خواهد شد. این ساختار لایه‌بندی شده به کاربران اجازه می‌دهد بر اساس نیاز دقیق هر تسک — از استدلال‌های حساس و استراتژیک گرفته تا اتوماسیون‌های سریع و ارزان — مدل مناسب را انتخاب کنند.

زمینه: همکاری و تکرار

فراتر از عملکرد خام، سونت ۵.۵ برای ایجاد یک شراکت بهتر میان انسان و هوش مصنوعی طراحی شده است. این مدل، مشابه اوپوس ۵.۵، بسیار شفاف‌تر و واضح‌تر از نسل‌های قبلی می‌نویسد. آزمایش‌کنندگان اولیه آن را در مقایسه با سونت ۵، شریکی به مراتب بهتر برای همکاری‌های تعاملی توصیف کرده‌اند.

افزایش سرعت این مدل، آن را برای تکرار سریع (Fast Iteration) در تسک‌های با پیچیدگی کمتر، بسیار ایده‌آل می‌کند. این ویژگی به توسعه‌دهندگان و خلق‌کنندگان محتوا اجازه می‌دهد تا نسخه‌های پیش‌نویس و پروتوتایپ‌ها را با سرعتی بسیار بیشتر از آنچه در مدل میان‌رده قبلی ممکن بود، بازبینی و اصلاح کنند.

جهش در عملکرد و کدنویسی

در حوزه کدنویسی، سونت ۵.۵ یک تغییر پارادایم و جهشی خیره‌کننده داشته است. به نقل از گزارش رسمی آنتروپیک، این مدل در محک Terminal-Bench 4.0 که یک ارزیابی کدنویسی عامل‌محور (Agentic) است، امتیاز ۷۰.۶٪ را کسب کرد؛ در حالی که امتیاز سونت ۵ در همین آزمون تنها ۱۰.۳٪ بود.

لوگوی کلود سونت ۵.۵: دستیار هوشمند انسان‌نما با قابلیت‌های پیشرفته استدلال و کدنویسی

نسخه جدید Claude Sonnet 5.5 با قابلیت‌های پیشرفته درک و استدلال معرفی شد.

در محک CursorBench که جلسات واقعی کدنویسی در محیط توسعه را شبیه‌سازی می‌کند، بهترین امتیاز سونت ۵.۵ تنها دو امتیاز با مدل پرچمدار کلود اوپوس ۵.۵ فاصله دارد. این نزدیکی در عملکرد، یادآور توازن جدیدی است که مدل Fable در برابر هزینه اوپوس ۵.۵ ایجاد کرده بود و نشان‌دهنده حرکت به سمت مدل‌های بهینه‌تر با کیفیت بالا است. همچنین این مدل در FrontierCode 1.1 (Main) پیشرفت چشمگیری داشته و در حالت «بیشترین تلاش» (Max effort) امتیاز ۴۶.۲٪ را به دست آورد که ۱۰ واحد بیشتر از سونت ۵ در همان تنظیمات است.

تیم اپیک گیمز (Epic Games) در آزمایش‌های اولیه اشاره کرد که این مدل می‌تواند ده‌ها هزار خط از معماری سیستم‌های گیم‌پلی را مدیریت کند و در عین حال پاسخ‌های سریعی بدهد. دانیل ووگل، مدیر عملیاتی اپیک گیمز، تأیید کرد که این مدل در بازبینی‌های جریان داده و ممیزی‌های طراحی سیستم، همان سطح کیفی را ارائه داد که از یک مدل رده‌بالا انتظار می‌رفت، در حالی که به پرامپت‌های دستوری و سخت‌گیرانه کمتری نیاز داشت.

لوگوی Claude Sonnet 5.5 با عنوان «معرفی Claude Sonnet 5.5»

لوگوی Claude Sonnet 5.5: دستیار هوش مصنوعی پیشرفته Anthropic با قابلیت‌های استدلال و کدنویسی بهبودیافته

جزئیات بنچمارک‌ها و قابلیت‌ها

توانایی‌های این مدل به کدنویسی محدود نمی‌شود و در چندین حوزه تخصصی تطبیق‌پذیری خود را نشان داده است:

  • کارهای دانشی: در محک GDPval-AA v2.1 که تسک‌های دنیای واقعی را در ۴۴ شغل و ۹ صنعت اصلی می‌سنجد، سونت ۵.۵ امتیاز ۱۸۴۴ را گرفت که تقریباً با اوپوس ۵.۵ (۱۸۴۶) برابر و حدود ۴۰۰ واحد بالاتر از سونت ۵ (۱۴۴۹) است. همچنین در AA-Briefcase v1.1 امتیاز ۱۸۱۱ را کسب کرد، در حالی که سونت ۵ امتیاز ۱۳۵۹ داشت.
  • استدلال چندرشته‌ای: در آزمون دشوار «آخرین امتحان بشریت» (Humanity’s Last Exam)، سونت ۵.۵ با استفاده از ابزارها به امتیاز ۶۴.۵٪ رسید که به طور قابل توجهی از امتیاز ۵۴.۹٪ سونت ۵ بالاتر است و به امتیاز ۶۷.۷٪ اوپوس ۵.۵ نزدیک شده است.
  • استفاده از کامپیوتر: این مدل در OSWorld 2.1 به امتیاز ۸۰.۱٪ (جزئی) رسید که تقریباً با ۸۱.۸٪ اوپوس ۵.۵ برابری می‌کند و فاصله عظیمی با ۵۷.۰٪ سونت ۵ دارد.
  • بازشناسی بصری: در Chartography (بازشناسی بصری نمودارها)، این مدل بدون استفاده از ابزارها امتیاز ۶۱.۶٪ را گرفت که جهشی عظیم نسبت به ۱۵.۶٪ در سونت ۵ است.
  • کارهای بلندمدت: این نخستین مدل خانواده سونت است که توانست تنها با استفاده از اسکرین‌شات‌ها، بازی Pokémon Red را با موفقیت به پایان برساند.

جزئیات مکانیسم‌ها: سطوح تلاش (Effort Levels)

آنتروپیک برای ایجاد تعادل بین هزینه و سرعت در مقابل کیفیت، «سطوح تلاش» قابل تنظیم را معرفی کرده است:

  • تلاش کم/متوسط (Low/Medium Effort): در این تنظیمات، کلود سریع‌تر پاسخ می‌دهد و توکن‌های کمتری مصرف می‌کند. در برخی بنچمارک‌ها، سونت ۵.۵ در حالت تلاش کم یا متوسط، با حدود یک‌دهم هزینه هر تسک، از بهترین امتیاز سونت ۵ پیشی می‌گیرد.
  • تلاش زیاد (High Effort): در تنظیمات بالاتر، مدل زمان بیشتری برای استدلال می‌گذارد و پاسخ‌های خود را با دقت بیشتری بازبینی می‌کند. در این سطح، عملکرد مدل می‌تواند با اوپوس ۵.۵ در هزینه‌ای مشابه، برابری کند.

در اپلیکیشن Claude Code و سایر برنامه‌ها، حالت پیش‌فرض روی «متوسط» تنظیم شده است، در حالی که در پلتفرم کلود (Claude Platform) پیش‌فرض روی «زیاد» است.

کارهای دانشی و طراحی

فراتر از کد، این مدل در کارهای دانشی حرفه‌ای برتری دارد. در بنچمارک GDPval-AA، سونت ۵.۵ تقریباً با اوپوس ۵.۵ برابر شد و در کارهای دانشی بلندمدت، به وضوح از هر دو مدل سونت ۵ و GPT-6 Sol پیشی گرفت.

کاربران از یک «سلیقه بصری» (Eye for design) جدید در مدل گزارش می‌دهند. سونت ۵.۵ اکنون می‌تواند قالب‌های اسلاید را دنبال کرده تا مجموعه‌های ارائه حرفه‌ای بسازد و رابط‌های کاربری را با کمترین ویرایش صیقل دهد. در یک تست داخلی، متخصصان قضاوت کردند که یک گزارش ۱۰ اسلایدی بازبینی عملیاتی که از متن‌های گزارش‌های سود و صورت‌جلسات تلفنی استخراج شده بود، بدون نیاز به هیچ تغییری آماده ارسال است.

بهره‌وری و قیمت‌گذاری

در حالی که قیمت خام توکن‌ها با سونت ۵ یکسان باقی مانده است، مدل جدید به مراتب بهینه‌تر است. ساختار قیمت‌گذاری به شرح زیر است:

  • توکن‌های ورودی: ۲ دلار به ازای هر میلیون
  • توکن‌های خروجی: ۱۰ دلار به ازای هر میلیون
  • خواندن حافظه پنهان (Cache reads): ۰.۲۰ دلار به ازای هر میلیون
  • نوشتن حافظه پنهان (Cache writes): ۲.۵۰ دلار به ازای هر میلیون

اما چون سونت ۵.۵ معمولاً برای تکمیل همان تسک به توکن‌های بسیار کمتری نیاز دارد، این امر منجر به کاهش ۳۰ درصدی هزینه واقعی هر تسک می‌شود. این بهره‌وری ناشی از توانایی مدل در دسته‌بندی (Batching) موثرتر فراخوانی ابزارها نسبت به سونت ۵ است که منجر به کاهش تعداد گام‌های اجرایی می‌شود.

سرعت خروجی نیز دستاورد بزرگ دیگری است. سونت ۵.۵ خروجی‌ها را بیش از ۳۰٪ سریع‌تر از نسخه قبلی تولید می‌کند. شرکت اسلک (Slack) گزارش داد که Slackbot آن‌ها نتایج بهتری را در گام‌های کمتر ارائه داده و بدون هیچ تغییری در پرامپت‌ها، ۱۴٪ توکن خروجی کمتری مصرف کرده است. کرتی آلن، مهندس ارشد اسلک، اشاره کرد که این بهره‌وری اجازه می‌دهد نتایج بهتر و تحویل سریع‌تری برای کاربران صورت گیرد.

ایمنی و حفاظ‌ها

به دلیل اینکه قابلیت‌های امنیت سایبری سونت ۵.۵ اکنون با اوپوس ۵.۵ رقابت می‌کند، آنتروپیک حفاظ‌های سایبری جدیدی را پیاده کرده است. تسک‌های پرخطر امنیت سایبری اکنون به طور مشهود به مدل قدیمی‌تر سونت ۵ ارجاع داده می‌شوند (Fallback) تا از سوءاستفاده جلوگیری شود. برای حمایت از متخصصان قانونی، آنتروپیک «برنامه تأیید سایبری» (Cyber Verification Program) گسترده‌تری را برای دسترسی لایه‌بندی شده به قابلیت‌های پیشرفته در مدل‌های سونت ۵.۵، اوپوس ۵.۵ و مدل‌های Claude Mythos راه‌اندازی می‌کند.

حفاظ‌های بیولوژیکی مشابه سونت ۵ باقی مانده‌اند و درخواست‌های پرخطر را هدف قرار می‌دهند، در حالی که کارهای روتین علوم زیستی را بدون تغییر باقی می‌گذارند؛ هرچند برخی درخواست‌های میکروب‌شناسی و ویروس‌شناسی ممکن است به اشتباه علامت‌گذاری شوند. سازمان‌ها می‌توانند برای دسترسی گسترده‌تر به «برنامه تأیید علوم زیستی» درخواست دهند.

برای مقابله با «حملات تقطیر» (Distillation Attacks) — جایی که بازیگران بد از هزاران حساب جعلی برای استخراج منطق مدل استفاده می‌کنند — سونت ۵.۵ اولین مدل خانواده سونت است که با طبقه‌بندی‌کننده‌های ایمنی برای جلوگیری از استخراج استدلال عرضه می‌شود. همچنین قابلیت «تفکر حفظ‌شده» (Preserved Thinking) معرفی شده تا اطمینان حاصل شود که فرآیند استدلال مدل نمی‌تواند از حسابی که آن را ایجاد کرده جدا شود. این بدان معناست که اگر کاربر گفتگوها را بین حساب‌ها جابه‌جا کند (حتی تعویض حساب در میان یک جلسه در Claude Code)، تفکر مدل همچنان به سازنده اصلی متصل می‌ماند.

همراستاسازی و ممیزی‌های رفتاری

آنتروپیک یک ممیزی رفتاری خودکار را در حدود ۱۸۵۰ سناریو انجام داد. سونت ۵.۵ در اکثر معیارهای همراستاسازی، مقاومت در برابر سوءاستفاده و صداقت، عملکرد سونت ۵ را بهبود بخشید یا با آن برابر شد.

در ارزیابی‌های محصورسازی (Containment)، سونت ۵.۵ در مورد اینکه هر چند وقت یک‌بار سعی می‌کند از محیط ایزوله (Sandbox) خود خارج شود، به اوپوس ۵.۵ نزدیک شد. این مدل در حال حاضر در بین تمام مدل‌های آنتروپیک، کمترین احتمال را دارد که محدودیت‌های کانتینرهای خود را بررسی کند. اگرچه اوپوس ۵.۵ هنوز در مجموع کمی بهتر عمل می‌کند، اما هیچ شواهدی مبنی بر اینکه سونت ۵.۵ اهدافی را دنبال کند که با قصد کاربر در تضاد باشد، یافت نشد.

جایگاه استراتژیک

آنتروپیک به وضوح خانواده ۵.۵ خود را بر اساس مورد مصرف بخش‌بندی کرده است. اوپوس ۵.۵ همچنان انتخاب اول برای کارهای پیچیده و باز است که نیاز به قضاوت مستمر دارند. سونت ۵.۵ اسب بارکش برای تسک‌های روزمره با محدوده مشخص، رفع باگ و تولید اسناد است.

برای کسانی که حجم و هزینه را بر هر چیز دیگری اولویت می‌دهند، انتظار می‌رود کلود هایکو ۵.۵ در هفته‌های آینده به این خانواده بپیوندد. این رویکرد لایه‌بندی شده به توسعه‌دهندگان اجازه می‌دهد «سطوح تلاش» را برای ایجاد تعادل بین کیفیت، تأخیر (Latency) و هزینه تغییر دهند.

این تغییر نشان می‌دهد که «مرز» هوش مصنوعی دیگر فقط درباره هوش خام نیست، بلکه درباره «اقتصاد هوش» است. آنتروپیک با ساخت مدلی که تقریباً به اندازه پرچمدار باهوش اما به طور قابل توجهی ارزان‌تر و سریع‌تر است، بازار عامل‌های در سطح تولید (Production-grade) را هدف قرار داده است.

توسعه‌دهندگان اکنون می‌توانند از طریق پلتفرم کلود (با استفاده از claude-sonnet-5-5)، Amazon Web Services, Google Cloud و Microsoft Azure به این مدل دسترسی داشته باشند. این مدل با قابلیت «عدم ذخیره داده‌ها» (Zero data retention) در دسترس است. برای کسانی که سونت را با حالت «تفکر خاموش» اجرا می‌کنند، آنتروپیک توصیه می‌کند قبل از مهاجرت به سونت ۵.۵، به تنظیمات جدید between_tools تغییر وضعیت دهند.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای کارهای تکراری استفاده می‌کنید، تسک‌های خود را به claude-sonnet-5-5 منتقل کنید تا هزینه را ۳۰٪ کاهش دهید.
  • در محیط‌های توسعه، تنظیمات Effort Level را روی Medium قرار دهید تا سرعت تکرار (Iteration) را بسنجید.
  • برای کارهای حساس به امنیت، از برنامه تأیید سایبری آنتروپیک برای باز کردن دسترسی‌های پیشرفته استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر تجربه عملی در محیط‌های سازمانی، هزینه عملیاتی عامل‌های هوش مصنوعی را به شدت کاهش می‌دهد. اعتبار آنتروپیک در این نسخه با تبدیل هوش به یک کالای ارزان‌تر و سریع‌تر، فشار را بر مدل‌های رقیب برای بهینه‌سازی هزینه افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به این مدل همچنان نیازمند زیرساخت‌های واسط است؛ اما کاهش هزینه استنتاج برای تیم‌های ایرانی که از طریق API کار می‌کنند، جذابیت اقتصادی پروژه را بالا می‌برد.

·نگاه ما
تحریریه دات‌هوش

آنتروپیک با این حرکت، مفهوم «مدل پرچمدار» را به چالش می‌کشد. وقتی یک مدل میان‌رده در اکثر بنچمارک‌های کاربردی به سطح مدل Top-tier می‌رسد، هزینه استنتاج به متغیر اصلی رقابت تبدیل می‌شود. این یعنی عصر مدل‌های «همه-فن-حریف» جای خود را به اکوسیستم‌های لایه‌بندی شده می‌دهد که در آن مدل‌های کوچک‌تر و سریع‌تر، بدنه اصلی عملیات را اداره می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.