اگر امروز برای پردازشهای حجیم هوش مصنوعی هزینه میپردازید، صورتحساب شما ممکن است به یکدهم مبلغ فعلی برسد. آنتروپیک (Anthropic) با معرفی Claude Haiku 5.5، کف قیمتی مدلهای کوچک را به ۰.۱۰ دلار بهازای هر میلیون توکن رساند. طبق گزارش MarkTechPost در ۷ اکتبر ۲۰۲۶، این اقدام باعث کاهش ۷۵ درصدی هزینه میانگین استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — برای وظایف با حجم بالا شده است. این کاهش هزینهها در واقع تکمیل استراتژی کاهش قیمتهای آنتروپیک است که پیشتر در گزارشات اولیه این مدل به آن اشاره شده بود.
این تحول در حالی رخ میدهد که شرکتها از چتباتهای تکمنظوره و یکپارچه به سمت گردشکارهای پیچیده و عاملمحور (Agentic) حرکت میکنند. در حالی که پیشتر بررسی کردیم چگونه ابزارهایی مانند Codyssey جلسات کدنویسی را به ماجراجوییهای بصری تبدیل میکنند، اکنون کل صنعت به سمت معماری «مرکز و پره» (Hub-and-Spoke) در حال حرکت است. در این ساختار، یک مدل عظیم و قدرتمند استراتژی کلی را میچیند و یک مدل کوچک و ارزان، کارهای تکراری، خستهکننده و عملیاتی (Grunt work) را انجام میدهد.
Claude Haiku 5.5 دقیقاً برای همین نقش طراحی شده است. هدف این مدل، مدیریت حجمهای بالای کاری مانند طبقهبندی دادهها، فشردهسازی متون، تولید خلاصهها و اجرای وظایف مربوط به عاملهای فرعی (Subagent tasks) است. این مدل پنجره متنی (Context Window) — یعنی میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه به میز کاری که جا برای چند ورق دارد — یک میلیون توکنی دارد و تا ۱۲۸ هزار توکن خروجی را پشتیبانی میکند.
مشخصات فنی و قیمتگذاری
آنتروپیک ساختار قیمتی دو لایه را بر اساس طول پرامپت اجرا کرده است. این یک سقوط قیمتی شدید نسبت به Haiku 4.5 است که ۱ دلار برای هر میلیون توکن ورودی و ۵ دلار برای هر میلیون توکن خروجی دریافت میکرد. بر اساس مستندات و یادداشتهای شرکت، تقریباً ۹۰٪ از درخواستهای ارسال شده به Haiku 4.5 زیر ۱۰۰ هزار توکن بودهاند و همین موضوع باعث میشود لایه ارزان جدید تأثیر بسیار زیادی بر هزینههای نهایی توسعهدهندگان داشته باشد:
- پرامپتهای کوتاه (تا ۱۰۰ هزار توکن): ۰.۱۰ دلار برای ورودی / ۰.۵۰ دلار برای خروجی. این نرخ ۹۰٪ پایینتر از نرخهای Haiku 4.5 است.
- پرامپتهای بلند (بالای ۱۰۰ هزار توکن): ۰.۵۰ دلار برای ورودی / ۲.۵۰ دلار برای خروجی.
- بهرهوری حافظه پنهان (Cache): خواندن از کش (Cache reads) هزینه ۰.۰۱ دلار بهازای هر میلیون توکن دارد، در حالی که نوشتنهای ۵ دقیقهای (5-minute writes) هزینه ۰.۱۲۵ دلار دارد.
- پردازش دستهای (Batch Processing): کارهای دستهای در نسخه بتا تا ۳۰۰ هزار توکن خروجی را پشتیبانی میکنند و علاوه بر قیمتهای فوق، ۵۰٪ تخفیف اضافی ارائه میدهند.

سازوکارها و محدودیتهای فنی
این مدل یک تنظیم «تلاش» (Effort) برای تفکر تطبیقی معرفی کرده است که بهصورت پیشفرض فعال بوده و روی حالت «متوسط» (Medium) تنظیم شده است. مدل قادر است متن و تصویر را پردازش کند و تاریخ قطع دانش (Knowledge Cutoff) آن ژوئن ۲۰۲۶ است.
توسعهدهندگان هنگام مهاجرت از نسخههای قبلی باید به دو محدودیت فنی حیاتی دقت کنند:
۱. تغییر توکنساز (Tokenizer): توکنسازی — یعنی تبدیل متن به تکههای کوچک شبیه برشهای کیک که مدل میخورد — تغییر کرده است. توکنساز جدید، یک متن یکسان را تقریباً ۳۰٪ بیشتر از Haiku 4.5 توکنگذاری میکند.
۲. خطای پارامترها: استفاده از مقادیر غیرپیشفرض برای پارامترهای Temperature، top_p یا top_k منجر به بازگشت خطای ۴۰۰ (Bad Request) میشود.
محکهای عملکردی
دادههای گزارش شده در کارت سیستم (System Card) آنتروپیک نشاندهنده جهشی عظیم نسبت به نسل قبلی است. در زیرمجموعه آفلاین آزمون OSWorld 2.1، مدل Haiku 5.5 امتیاز ۷۲.۴٪ را کسب کرد؛ در حالی که Haiku 4.5 تنها ۱۵.۷٪ و مدل GPT-6 Luna امتیاز ۴۸.۹٪ را به دست آورده بودند.
سایر نتایج کلیدی در بنچمارکها عبارتند از:
- Terminal-Bench 4.0: امتیاز ۳۹.۲٪، در مقایسه با ۱۶.۴٪ برای Luna و ۰.۰٪ برای Haiku 4.5.
- FrontierCode 1.1 (Main): امتیاز ۴۶.۴٪ که اندکی از امتیاز ۴۲.۴٪ مدل Luna جلوتر است.
- Humanity’s Last Exam: امتیاز ۴۵.۹٪ بدون استفاده از ابزارها و ۵۷.۴٪ با استفاده از ابزارها.
- GDPval-AA v2.1: امتیاز ۱۶۲۰، در مقابل ۱۴۳۷ برای Luna و ۷۳۵ برای Haiku 4.5.
با وجود این پیشرفتها، مدل Sonnet 5.5 همچنان در تمام ردیفها پیشتاز است، از جمله کسب امتیاز ۷۰.۶٪ در Terminal-Bench 4.0. به همین دلیل، آنتروپیک صراحتاً توصیه میکند که برای کدنویسیهای پیچیده عاملمحور از Sonnet 5.5 یا Opus 5.5 استفاده کنید، زیرا Haiku در این اکوسیستم به عنوان یک بازیگر مکمل (Supporting actor) تعریف شده است و نه نقش اول. این رویکرد در راستای بهینهسازی کلی خانواده مدلهای آنتروپیک است، مشابه آنچه در کاهش هزینههای مدل Opus 5.5 برای بارهای کاری رایج مشاهده کردیم.
تحلیل استراتژیک
این حرکت قیمتی، یک ضربه مستقیم به OpenAI و Google است. اگرچه GPT-6 Luna در نرخهای مربوط به کانتکست کوتاه (۰.۱۰ دلار) با Haiku برابری میکند، اما Luna برای پرامپتهایی بین ۱۰۰ تا ۲۷۲ هزار توکن ارزانتر تمام میشود؛ چرا که لایه بالاتر Luna از ۰.۲۰ دلار برای ورودی و ۰.۷۵ دلار برای خروجی شروع میشود. بنابراین برای یک پرامپت ۱۵۰ هزار توکنی، Luna در قیمت لیست ارزانتر است.
با این حال، آنتروپیک با کاهش ۹۰ درصدی هزینهها برای رایجترین اندازههای درخواست، در حال بهینهسازی برای «اقتصاد عاملهای فرعی» است. مثالهای واقعی از این کاربرد عبارتند از:
- تحلیل مالی: در شرکت Rogo، یک عامل فرعی Haiku 5.5 خطوط مربوط به درآمد را از گزارشهای 10-K استخراج میکند، در حالی که یک مدل بزرگتر، اسلاید نهایی ارائه را میسازد.
- پاسخ به سوالات سازمانی: شرکت AlphaSense این مدل را در قابلیتی تست کرده است که حدود ۸ میلیون فراخوانی در هفته را برای خلاصهسازی اسناد مدیریت میکند.
- تعاملات آنی: کارهای حساس به سرعت مانند پشتیبانی زنده مشتریان و تعامل با مرورگر.
این تغییر، گلوگاه را از «آیا بودجه کافی برای فراخوانی API داریم؟» به «چگونه میتوانیم وظایف را با بیشترین بهرهوری مسیریابی کنیم؟» تغییر میدهد. برنده این رقابت تیمی خواهد بود که بهترین مسیر ارتقا (Escalation path) را بسازد؛ یعنی شروع با Haiku برای کارهای تاییدپذیر و ارجاع به Opus تنها زمانی که استدلال مستمر و عمیق مورد نیاز باشد.
توسعهدهندگان اکنون میتوانند از طریق Claude API، Amazon Bedrock، Google Cloud، Microsoft Foundry و پلتفرم Claude در AWS به این مدل دسترسی داشته باشند. توصیه میشود طول پرامپتهای فعلی خود را ارزیابی کنید تا متوجه شوید در لایه ۰.۱۰ دلاری قرار میگیرید یا در بازه گرانتر پرامپتهای بلند.
گام بعدی شما
- طول پرامپتهای فعلی خود را بررسی کنید تا ببینید در لایه ۰.۱۰ دلاری قرار میگیرید یا لایه بلند.
- وظایف تکراری و حجیم (مثل طبقهبندی دادهها) را از مدلهای گرانقیمت به Haiku 5.5 منتقل کنید.
- ساختار «مرکز و پره» را در معماری عاملهای خود پیادهسازی کنید تا هزینه استنتاج را به شدت کاهش دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو