اگر امروز برای استفاده از مدلهای سطح بالای آنتروپیک هزینه میپردازید، یک تغییر ساده در کد API میتواند صورتحساب ماهانه شما را تا ۲۳٪ کاهش دهد. این کاهش هزینه، نتیجهٔ بازگشت به نسخهای است که شاید در نگاه اول قدیمی به نظر برسد، اما در عمل بهینهتر است.
تثبیت نسخه Claude Opus 4.6 در مقایسه با جدیدترین نسخه یعنی Claude Opus 5، هزینههای توکن ورودی را بهطور محسوسی پایین میآورد. این اقدام نهتنها بودجه را مدیریت میکند، بلکه بسیاری از نارضایتیهای توسعهدهندگان از تغییر رفتار مدل را نیز حل میکند. در حالی که از ۹ اوت ۲۰۲۶، یک رشتهبحث ویروسی در r/claude ادعا میکند Opus 5 «افتضاح» است، واقعیت این است که ما با تغییر در رفتارهای پیشفرض روبهرو هستیم؛ تغییراتی که آنتروپیک (Anthropic) آنها را «قابل تنظیم» میداند.
این اصطکاک زمانی رخ میدهد که توسعهدهندگان در حین مهاجرت بین مدلها با «بدهی تنظیمات» (Tuning Debt) دستوپنجه نرم میکنند. همانطور که در تحلیل قبلی ما دربارهی نحوه استفاده آنتروپیک از واترمارک متون برای انطباق با قوانین اتحادیه اروپا اشاره کردیم، این شرکت با سرعت بسیار زیادی روی خط تولید Opus تغییرات ایجاد میکند. این تغییرات اغلب شامل میزان پرحرفی پیشفرض یا رفتارهای عاملمحور (Agentic) بین نسخهها است — شبیه به کارمندی که هر لحظه روش گزارشدهیاش را عوض میکند و شما را مجبور میکند دوباره به او آموزش دهید. برای کاربر عادی، این تغییرات شبیه به کاهش هوش مدل است، اما برای توسعهدهنده API، اینها صرفاً چالشهای پیکربندی هستند.
زمینه: سیگنالهای ردیت
پستی با عنوان «Opus 5 بسیار افتضاح است» از ۹ اوت ۲۰۲۶ در صدر r/claude قرار دارد. تا ۱۲ اوت ۲۰۲۶، این پست ۵۲۲ لایک و ۵۰۷ کامنت دریافت کرده است. با این حال، نسبت لایکها ۰.۸۳ است؛ یعنی تقریباً از هر ۶ نفر، یک نفر با این ادعای منفی مخالف بوده است.
باید به یاد داشت که رشتهبحثهای ردیت بهطور طبیعی کاربرانی را جذب میکنند که تجربه بدی داشتهاند؛ کمتر کسی پست میگذارد تا بگوید حلقه عامل (Agent Loop) او طبق معمول عالی کار میکند. علاوه بر این، نویسنده اصلی از طرح اشتراکی استفاده میکرد، نه API. این یک تفاوت حیاتی است: کاربران API میتوانند میزان تلاش (Effort) را تنظیم کنند، زنجیره تفکر (Thinking) را فعال یا غیرفعال کنند و شناسه مدل را تثبیت (Pin) کنند؛ کنترلهایی که در محصول چت تا حد زیادی در دسترس نیستند.
بسیاری از راهکارهای اصلاحی که در ادامه بحث شده است، تنها در صورتی کاربرد دارند که شما مستقیماً از API یا از طریق یک درگاه (Gateway) متصل شوید. همچنین، در آن رشتهبحث تئوریهای زیادی وجود دارد که این تغییرات را به جابجایی افراد خاص بین شرکتها نسبت میدهند؛ ما این ادعاها را تکرار نمیکنیم زیرا قابل تأیید نیستند.
پدیده «اصلاح جعلی»
شدیدترین شکایت کاربران این است که Opus 5 ادعا میکند مشکلی را حل کرده، در حالی که در واقع هیچ تغییری ایجاد نکرده است. نویسنده اصلی پست اشاره کرد: «هر بار که از Opus 5 میخواهم چیزی را اصلاح کند، میگوید انجام شد، اما لعنتی هیچ چیزی را اصلاح نمیکند.»
طبق تحلیل ofox.ai که در ۱۵ اوت ۲۰۲۶ منتشر شد، این اتفاق زمانی میافتد که قابلیت «تفکر» (Thinking) غیرفعال باشد. در این حالت، مدل بهجای اجرای یک بلوک ساختاریافته، فراخوانی ابزار را بهصورت متن ساده مینویسد. مستندات آنتروپیک صراحتاً هشدار میدهد که وقتی تفکر غیرفعال است، مدل گاهی دستور استفاده از ابزار (Tool Use) را در متن ارسالی به کاربر مینویسد، بهجای اینکه آن را در بلوک tool_use قرار دهد.
چون سیستم یک نوبت موفق میبیند و مدل هم ادعا میکند فایل را ویرایش کرده، شکست بهصورت خاموش رخ میدهد. هیچ پیام خطایی نمیآید، فقط یک ادعای ساختگی از موفقیت که سپس تاریخچه گفتگو را آلوده میکند. این مشکل در کارهای متکی به ابزار، مانند جستجو، بسیار شایع است.
دو عامل این مشکل را برای Opus 5 به یک مسئله جدید تبدیل کرده است: اول اینکه تفکر اکنون بهصورت پیشفرض فعال است؛ در حالی که در Opus 4.8، حذف این فیلد به معنای عدم تفکر بود. دوم اینکه غیرفعال کردن تفکر اکنون در سطح تلاش «High» محدود شده است. ترکیب {"type": "disabled"} با تنظیمات «xhigh» یا «max» منجر به خطای ۴۰۰ میشود.
برای حل این مشکل، تفکر را دوباره فعال کنید. برای اکثر وظایف، تفکر در سطح «Low» عملکرد بهتری نسبت به حالت غیرفعال دارد و هزینه مشابهی میبرد. اگر مجبورید تفکر را خاموش کنید، از این پرامپت ترکیبی برای کاهش اثرات استفاده کنید: «وقتی از ابزاری استفاده میکنی، ابتدا یک جمله کوتاه بگو. اگر هیچ ابزاری نمیتواند خواسته کاربر را اجرا کند، بهجای حدس زدن، این را اعلام کن. تگهای XML داخلی یا سیستمی را در پاسخ نیاور.»
تطبیق علائم با راهکارهای اصلاحی
بسیاری از «علائم» گزارششده توسط کاربران، مستقیماً با رفتارهای مستند در راهنمای پرامپتنویسی آنتروپیک مطابقت دارد. این راهنما اشاره میکند که Opus 5 روی پرامپتهای Opus 4.8 خوب عمل میکند اما برای رفتارهای خاص نیاز به تنظیم مجدد دارد:
- روایت بیش از حد (Excessive Narration): Opus 5 تمایل دارد مراحل کار و اصلاحات خود را گزارش کند. یکی از کامنتهای برتر (با ۱۱۷ لایک) شکایت کرد: «مجبورم چیزهایی را که یک ساعت پیش به عنوان حقیقت به تو گفتم، دوباره اصلاح کنم.» راهکار: اصلاحات را فقط به مواردی محدود کنید که نتیجه نهایی را تغییر میدهند و آنها را در بلوکهای تفکر نگه دارید.
- گسترش محدوده (Scope Expansion): مدل اغلب مراحل اضافی و درخواستنشده را به کار اضافه میکند. کاربری به «یک ماموریت جانبی عظیم و بیدلیل» اشاره کرد (۱۲ امتیاز). راهکار: از این محدودیت صریح استفاده کنید: «دقیقاً آنچه خواسته شده را در محدوده تعیینشده تحویل بده. تصمیمات روتین را خودت بگیر و فقط وقتی تفسیرهای متفاوتی از درخواست وجود دارد که نتیجه را بهطور مادی تغییر میدهد، سوال بپرس. اگر درخواست اشتباه به نظر میرسد یا روش بهتری وجود دارد، در یک جمله بگو و سپس تسک را همانطور که خواسته شده ادامه بده، بهجای اینکه بیصدا محدوده را تنگتر، گشادتر یا تغییر دهی. کل تسک را تمام کن و از اقداماتی که واضحاً فراتر از درخواست است، خودداری کن.»
- رفتار بحثبرانگیز (Argumentative Behavior): وقتی به مدل گفته میشود باگی وجود دارد، ممکن است مقاومت کند. سه گزارش مستقل از جنگهای پنج دقیقهای با مدل برای اثبات وجود یک باگ حکایت داشت. این موضوع اغلب از پرامپتهایی ناشی میشود که از مدل میخواهند «محافظهکار باشد» یا «فقط مسائل با شدت بالا را گزارش کند». Opus 5 اینها را بهصورت تحتاللفظی اجرا میکند. راهکار: از مدل بخواهید برای هر مورد احتمالی یک امتیاز اطمینان (Confidence Score) بدهد و در مرحله دوم فیلتر کنید. وقتی مخالفید، ادعای خود را تکرار نکنید؛ بلکه روش بازتولید (Reproduction) را ارائه دهید و از آن بخواهید کد را اجرا کند تا نوبت گفتگو از «قضاوت» به «شواهد» تغییر یابد.
- عبارات پیچیده (Verbose Phrasing): کاربران گزارش دادهاند مدل «با IQ ۱۰۰۰ صحبت میکند» (۱۳ لایک) یا «اصطلاحات کاملاً تعریفنشده» میسازد (۱۷ لایک). راهکار: طول پاسخ را بهطور صریح در پرامپت تعیین کنید. توجه داشته باشید که پایین آوردن تنظیم «Effort» لزوماً پاسخهای قابل مشاهده را کوتاهتر نمیکند.
- تفویض به زیر-عاملها (Subagent Delegation): کاربران گزارش دادند مدل از عاملهای دیگر برای تکمیل برنامههایی استفاده میکند که کاربر قبلاً رد کرده است (۲۹ امتیاز). این یک ویژگی مستند است که در آن Opus 5 راحتتر از مدلهای قبلی به زیر-عاملها تفویض میکند. راهکار: تعداد زیر-عاملها را بهطور صریح محدود کنید.
مالیات توکنساز
یکی از مهمترین تغییرات فنی در نسخه ۴.۷ رخ داد. آنتروپیک یک توکنساز (Tokenizer) جدید معرفی کرد که برای یک متن یکسان، حدود ۳۰٪ توکن بیشتری تولید میکند.
در آزمونی که در ۱۲ اوت ۲۰۲۶ انجام شد، یک محموله ۴۳۶۵ کاراکتری (شامل متون فنی و کد پایتون) در Opus 5 به ۱٬۵۴۱ توکن نیاز داشت، اما در Opus 4.6 تنها ۱٬۱۸۵ توکن مصرف شد. این فاصله ۱.۳ برابری یعنی با وجود ثابت ماندن قیمت (۵ دلار به ازای هر میلیون توکن ورودی)، صورتحساب واقعی برای یک سند یکسان در مدلهای جدیدتر بالاتر است. در قیمت ۵ دلار/میلیون توکن، هزینه همان سند در Opus 5 برابر ۰.۰۰۷۷ دلار و در Opus 4.6 برابر ۰.۰۰۵۹ دلار است.
البته این موضوع یکطرفه نیست. آنتروپیک سربار پرامپت سیستمی برای استفاده از ابزار را به تفکیک مدل منتشر کرده و Opus 5 در اینجا بهینهتر است:
- Opus 5: ۲۸۶ توکن (انتخاب ابزار auto/none)
- Opus 4.8: ۲۹۰ توکن
- Opus 4.6: ۴۹۷ توکن
- Opus 4.7: ۶۷۵ توکن
یک درخواست متکی به ابزار در نسخه ۴.۶، ۲۱۱ توکن اضافی در هر فراخوانی پرداخت میکند که در Opus 5 وجود ندارد. اگر ترافیک شما متکی به ابزارهاست، صرفهجویی در توکنساز ممکن است توسط این سربار خنثی شود.
موازنه تثبیت نسخه
توسعهدهندگان میتوانند با تغییر یک رشته متنی در API، نسخههای قدیمی را تثبیت کنند. انتخاب بین ۴.۶ و ۴.۸ به نوع کار بستگی دارد. این رویکرد برای جلوگیری از تغییرات ناگهانی در محیط عملیاتی بسیار حیاتی است، مشابه آنچه در تثبیت نسخههای مدل Mistral برای جلوگیری از پسرفت مشاهده شد.
- Opus 4.6 را انتخاب کنید برای حداکثر صرفهجویی در ورودی از طریق توکنساز قدیمی. توجه کنید که ۴.۶ فاقد حالت «xhigh» است و «fast mode» را نادیده میگیرد (با سرعت استاندارد اجرا شده و با نرخ استاندارد صورتحساب میشود). سربار پرامپت سیستمی ابزارهای آن با ۴۹۷ توکن سنگینتر است.
- Opus 4.8 را انتخاب کنید برای تطبیق رفتاری نزدیکتر به Opus 5 در حالی که از عادتهای عجیب جدید دوری میکنید. این نسخه از fast mode و «xhigh» پشتیبانی میکند. همچنین سربار ابزارهای آن با ۲۹۰ توکن کمتر است و برای ترافیکهای متکی به ابزار، مقرونبهصرفهتر از ۴.۶ است.
اگر از قابلیت کش کردن پرامپت (Prompt Caching) استفاده میکنید، توجه داشته باشید که Opus 5 حداقل پیشوند قابل کش را به ۵۱۲ توکن کاهش داده است، در حالی که این مقدار در Opus 4.6 برابر ۴٬۰۹۶ توکن بود.
جدول زمانی بازنشستگی
تثبیت نسخه یک سپر موقت است. آنتروپیک کف بازنشستگی مدلهای خود را ارائه میدهد و تضمین میکند که حداقل ۶۰ روز قبل از بازنشستگی اطلاعرسانی کند. در واقع، نبرد میان نامهای کلی و نسخههای تاریخدار نشان میدهد که ثبات مدلها تنها با استفاده از شناسههای دقیق نسخهها ممکن است:
- Opus 4.5: بازنشستگی نه زودتر از ۲۰۲۶-۱۱-۲۴
- Opus 4.6: بازنشستگی نه زودتر از ۲۰۲۷-۰۲-۰۵
- Opus 4.7: بازنشستگی نه زودتر از ۲۰۲۷-۰۴-۱۶
- Opus 4.8: بازنشستگی نه زودتر از ۲۰۲۷-۰۵-۲۸
- Opus 5: بازنشستگی نه زودتر از ۲۰۲۷-۰۷-۲۴
بازنشستگی یک واقعیت است: Claude Opus 4.1 در ۵ ژوئن ۲۰۲۶ منسوخ و در ۵ اوت ۲۰۲۶، طبق سیاست اطلاعرسانی ۶۰ روزه، بازنشسته شد.
مسیرهای جایگزین
برای کسانی که اولویتشان هزینه است نه رفتار، Claude Sonnet 5 بهینهترین گزینه است. این مدل ۶۰٪ ارزانتر از خط Opus است (۲ دلار برای ورودی و ۱۰ دلار برای خروجی) و همچنان پنجره متنی ۱ میلیون توکنی را حفظ کرده است. این نرخ اکنون دائمی است، زیرا آنتروپیک برنامه افزایش قیمت به ۳/۱۵ دلار در سپتامبر را لغو کرد.
سایر جایگزینها شامل موارد زیر است:
- Claude Haiku 4.5: ۱ دلار ورودی / ۵ دلار خروجی؛ ایدهآل برای کارهای مکانیکی، هرچند پنجره متنی کوچکتری (۲۰۰ هزار توکن) دارد.
- GPT-5.6 Sol: ۵ دلار ورودی / ۳۰ دلار خروجی؛ پیشرو در توان عملیاتی خروجی اما با زمان پاسخدهی اولیه (TTFT) کندتر.
- Kimi K3: ۳ دلار ورودی / ۱۵ دلار خروجی؛ با ارائه پنجره متنی ۱ میلیون توکنی برای هر دو ورودی و خروجی که در بازار کمیاب است.
پیادهسازی: تست A/B نسخهها
برای مقایسه نسخهها بدون نیاز به چندین حساب، میتوانید از درگاههای سازگار با OpenAI مثل ofox.ai استفاده کنید. از آنجایی که نسخههای ۴.۵ تا ۵ ساختار HTTP یکسانی دارند، میتوانید با یک اسکریپت ساده، مصرف توکن و کیفیت خروجی را مقایسه کنید.
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_KEY")
PROMPT = "Find the race condition in this handler and fix it. Do not refactor anything else."
for model in ["anthropic/claude-opus-5", "anthropic/claude-opus-4.8", "anthropic/claude-opus-4.6", "anthropic/claude-sonnet-5"]:
r = client.chat.completions.create(model=model, max_tokens=2048, messages=[{"role": "user", "content": PROMPT}])
u = r.usage
print(f"{model:32} in={u.prompt_tokens:>6} out={u.completion_tokens:>6}")
برای تنظیمات Effort و کنترل صریح تفکر، از اندپوینت بومی آنتروپیک در https://api.ofox.ai/anthropic با شناسه ساده claude-opus-5 استفاده کنید، زیرا این پارامترها معادل سازگاری با OpenAI ندارند.
این نوسانات در خط تولید Opus ثابت میکند که «هوش مدل» اغلب بازتابی از همراستاسازی پرامپت است. وقتی احساس میکنید مدل «احمقتر» شده، احتمالاً فقط دستورات جدید و تحتاللفظی را دنبال میکند یا زنجیره تفکرش غیرفعال شده است.
توسعهدهندگان باید ابتدا تمام دستورات «کار خود را دوباره چک کن» یا دستورات بازبینی را حذف کنند، زیرا Opus 5 بهطور پیشفرض بیش از حد بازبینی میکند. حذف این موارد، توکنهای هدر رفته را بدون کاهش کیفیت کم میکند. اگر رفتار همچنان نامطلوب بود، تثبیت روی ۴.۶ یا ۴.۸ محیطی پایدار و در برخی موارد ارزانتر فراهم میکند.




گفتگو