پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Claude Haiku 5.5 هزینه استنتاج را ۷۵٪ کاهش داد

·۱۵ مهر ۱۴۰۵۵ دقیقه مطالعه
لوگوی Claude Haiku ۵.۵: نماد ساده و مدرن هوش مصنوعی سریع و کارآمد Anthropic
لوگوی Claude Haiku ۵.۵: نماد ساده و مدرن هوش مصنوعی سریع و کارآمد Anthropic
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۷۵ درصدی هزینه استنتاج در مدل Haiku 5.5 و معرفی قابلیت تنظیم میزان تلاش (Effort) برای اولین بار در مدل‌های کوچک آنتروپیک.

اگر امروز برای اجرای عملیات‌های حجیم هوش مصنوعی هزینه می‌پردازید، صورت‌حساب شما از این لحظه ۷۵٪ ارزان‌تر می‌شود. در ۷ اکتبر ۲۰۲۶، شرکت آنتروپیک (Anthropic) مدل Claude Haiku 5.5 را معرفی کرد تا سریع‌ترین و به‌صرفه‌ترین گزینه در خط تولید این شرکت برای کارهای تکراری و حساس به زمان باشد.

این تحول در حالی رخ می‌دهد که سازمان‌ها از چت‌بات‌های ساده به سمت گردش‌های کاری عامل‌محور (Agentic) — شبیه به داشتن تیمی از دستیاران دیجیتال که هر کدام تکه‌ای از یک پروژه بزرگ را پیش می‌برند — حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی ساخت ابزارهای پیچیده با مدل‌های کلود (مانند ساخت یک JARVIS برای ویندوز) اشاره کردیم، گلوگاه اصلی همیشه هزینه اجرای این عامل‌ها در مقیاس وسیع بود. Haiku 5.5 با ایفای نقش یک «عامل فرعی» (Subagent) ارزان‌قیمت برای مدل‌های بزرگ‌تری مثل Opus 5.5، این مانع را از میان برمی‌دارد. این رویکرد در ادامه استراتژی آنتروپیک برای بهینه‌سازی هزینه‌هاست که پیش‌تر در کاهش هزینه‌های عملیاتی مدل Sonnet 5.5 نیز شاهد آن بودیم.

زمینه و موارد استفاده

به نقل از اعلامیه رسمی anthropic.com، این مدل به‌طور خاص برای خلاصه‌سازی، پرس‌وجو از پایگاه‌داده و طبقه‌بندی (Classification) بهینه شده است. Haiku 5.5 برای حجم بالای درخواست‌ها، کارهای حساس به هزینه و بارهای کاری تکراری، مانند عملیات فشرده‌سازی (Compactions)، طراحی شده است.

به دلیل اینکه این مدل سریع‌ترین مدل تا به امروز است، برای کاربردهای حساس به زمان بسیار مؤثر است. این موارد شامل پشتیبانی زنده مشتریان و تعامل با مرورگر (Browser Use) می‌شود. همچنین، این مدل در کنار Sonnet 5.5 و Opus 5.5 قرار می‌گیرد تا وظایف عامل‌های فرعی را در طول کارهای پیچیده کدنویسی بر عهده بگیرد. این مدل‌ها در کنار هم اکوسیستمی را می‌سازند که در آن عملکرد مدل پرچم‌دار با هزینه‌ای کمتر در دسترس توسعه‌دهندگان قرار می‌گیرد.

یکی از ویژگی‌های کلیدی، معرفی تنظیمات «میزان تلاش» (Adjustable Effort) است که برای نخستین بار در کلاس Haiku اضافه شده است. این قابلیت به کاربران اجازه می‌دهد بر اساس نیازهای خاص هر تسک، تصمیم بگیرند که مدل را برای «کاهش هزینه» یا «افزایش هوشمندی» بهینه کنند.

جزئیات عملکرد و بنچمارک‌ها

بر اساس مستندات فنی، ارزیابی‌ها نشان می‌دهد که Haiku 5.5 در چندین معیار کلیدی، به‌طور قابل‌توجهی از نسخه قبلی خود یعنی Haiku 4.5 پیشی گرفته است:

  • کارهای دانشی: کسب امتیاز ۱۶۲۰ در GDPval-AA v2.1 (در مقابل ۷۳۵ برای Haiku 4.5) و امتیاز ۱۵۷۸ در AA-Briefcase v1.1 (در مقابل ۶۱۴ برای Haiku 4.5).
  • استفاده از کامپیوتر: رسیدن به صحت ۷۲.۴٪ در زیرمجموعه آفلاین OSWorld 2.1، که جهشی عظیم نسبت به ۱۵.۷٪ قبلی است. OSWorld 2.1 توانایی یک عامل را در مدیریت یک کامپیوتر واقعی برای انجام تسک‌های چندمرحله‌ای می‌سنجد.
  • استدلال: کسب امتیاز ۴۵.۹٪ در آزمون Humanity’s Last Exam بدون استفاده از ابزار (در حالی که Haiku 4.5 تنها ۱۰.۲٪ را کسب کرد). با استفاده از ابزارها، این امتیاز به ۵۷.۴٪ رسید.
  • برنامه‌نویسی: کسب امتیاز ۴۶.۴٪ در FrontierCode 1.1 (Main)، که تقریباً با امتیاز ۴۲.۴٪ مدل GPT-6 Luna برابری می‌کند. همچنین امتیاز ۳۹.۲٪ را در Terminal-Bench 4.0 کسب کرد، در حالی که امتیاز Haiku 4.5 در این بخش ۰.۰٪ بود.
  • استدلال بصری: کسب امتیاز ۴۶.۴٪ در Chartography بدون ابزار، در مقایسه با ۶.۴٪ برای Haiku 4.5.

ساختار قیمت‌گذاری

آنتروپیک یک مدل قیمت‌گذاری پلکانی بر اساس طول پرامپت اجرا کرده است. برای پرامپت‌هایی تا ۱۰۰ هزار توکن — که ۹۰٪ درخواست‌های معمول Haiku را تشکیل می‌دهند — هزینه‌ها به این شرح است:

  • توکن‌های ورودی: ۰.۱۰ دلار به ازای هر میلیون
  • توکن‌های خروجی: ۰.۵۰ دلار به ازای هر میلیون
  • خوانش حافظه (Cache Reads): ۰.۰۱ دلار به ازای هر میلیون
  • نوشتن حافظه (Cache Writes): ۰.۱۲۵ دلار به ازای هر میلیون

برای پرامپت‌های بیش از ۱۰۰ هزار توکن، قیمت‌ها افزایش می‌یابد: ۰.۵۰ دلار برای ورودی، ۲.۵۰ دلار برای خروجی، ۰.۰۵ دلار برای خوانش حافظه و ۰.۶۲۵ دلار برای نوشتن حافظه.

فراتر از مدل جدید، آنتروپیک قیمت خوانش حافظه برای Claude Sonnet 5.5 را به نصف کاهش داد و به ۰.۱۰ دلار به ازای هر میلیون توکن رساند (کاهش از ۰.۲۰ دلار). این تغییر هزینه کلی اکثر کارهای عامل‌محور روی Sonnet 5.5 را تقریباً ۲۰٪ کاهش می‌دهد.

ایمنی و دسترسی

Haiku 5.5 دارای حفاظ‌های امنیت سایبری سخت‌گیرانه‌تری نسبت به Haiku 4.5 است تا جلوی تست‌های نفوذ (Penetration Testing) را بگیرد، هرچند برای کارهای دفاعی بازتر از Sonnet 5.5 عمل می‌کند. حفاظ‌های بیولوژیکی در کل خانواده ۵.۵ یکسان باقی مانده‌اند تا درخواست‌های مضر را محدود و تحقیقات مشروع را مجاز کنند.

سازمان‌هایی که به دسترسی گسترده‌تری نیاز دارند می‌توانند برای «برنامه تأیید سایبری» (Cyber Verification Program) یا «برنامه تأیید علوم زیستی» (Life Sciences Verification Program) درخواست دهند.

این مدل هم‌اکنون از طریق پلتفرم کلود (با شناسه claude-haiku-5-5)، Amazon Web Services (AWS)، گوگل کلاود و مایکروسافت آزور در دسترس است. همچنین برای تشویق توسعه‌دهندگان، اعتبارهای ماهانه API برای مشترکان Max و Team در نظر گرفته شده است:

  • کاربران Max 5x: ۱۰۰ دلار در ماه
  • کاربران Max 20x: ۲۰۰ دلار در ماه
  • مشترکان Team: تا ۵۰۰ دلار (به صورت مشترک بین کاربران)

برای یک مدیر کسب‌وکار، این یعنی «هزینه هر نوبت» (Cost per turn) دیگر مانع استقرار عامل‌های هوش مصنوعی نیست. شرکت‌ها می‌توانند کارهای ابتدایی، دسته‌بندی (Triaging) و جست‌وجو را به Haiku 5.5 بسپارند و قدرت استدلال Opus را با هزینه‌ای بسیار کمتر حفظ کنند. این توازن بین قدرت و هزینه، یادآور مقایسه‌ی عملکرد Fable در برابر Opus 5.5 است که استانداردهای جدیدی برای مدل‌های زبانی تعریف کرد.

به عنوان مثال، آرون وین، مهندس نرم‌افزار ارشد در Asana، گزارش داد که استفاده از Haiku 5.5 برای «هم‌تیمی‌های هوش مصنوعی» (AI Teammates) — که وظایفی چون دسته‌بندی باگ‌ها، راه‌اندازی پروژه و جست‌وجوی پورتفولیو را بر عهده دارند — منجر به کاهش ۳۰ درصدی تأخیر (Latency) و افزایش سرعت استنتاج تا ۲.۵ برابر در هر نوبت عامل شده است.

توسعه‌دهندگان باید اکنون خط لوله‌های عامل‌محور خود را ارزیابی کنند. در حالی که Sonnet 5.5 و Opus 5.5 همچنان بهترین انتخاب برای تسک‌های حرفه‌ای پیچیده در رابط خط فرمان (مانند موارد Terminal-Bench 4.0) هستند، تسک‌های با فرکانس بالا را می‌توان برای به حداکثر رساندن سود، به Haiku 5.5 منتقل کرد.

گام بعدی شما

  • خط لوله‌های عامل‌محور خود را بررسی کنید و کارهای تکراری (Triage) را از Sonnet به Haiku 5.5 منتقل کنید.
  • تنظیمات Effort را برای یافتن نقطه بهینه بین هزینه و دقت در هر تسک آزمایش کنید.
  • اگر مشترک Max یا Team هستید، اعتبارهای API جدید را برای تست مدل‌های کوچک‌تر فعال کنید.

اما کاهش هزینه تنها نیمی از داستان است؛ تأثیر این مدل بر معماری‌های چندعاملی را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این اقدام با تکیه بر تخصص آنتروپیک در بهینه‌سازی مدل‌های کوچک، سد مالی استقرار عامل‌های هوش مصنوعی در مقیاس سازمانی را می‌شکند. اکنون اجرای هزاران عامل هم‌زمان برای کارهای اداری، از نظر اقتصادی توجیه‌پذیر شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل‌ها دشوار است، اما کاهش هزینه استنتاج در سطح جهانی، قیمت سرویس‌های واسط (Proxy) را در بازار ایران کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

تمرکز آنتروپیک بر کاهش شدید هزینه استنتاج در مدل‌های کوچک، نشان می‌دهد که رقابت از «جنگ قدرت» به «جنگ بهره‌وری» تغییر مسیر داده است. با تبدیل Haiku به یک عامل فرعی (Subagent) کارآمد، مدل‌های بزرگ‌تر دیگر مجبور نیستند وقت خود را صرف کارهای ساده کنند و این یعنی افزایش چشمگیر توان عملیاتی در سیستم‌های پیچیده.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.