اگر امروز برای مدیریت پروژههای نرمافزاری عظیم به مدلهای زبانی تکیه میکنید، Claude Fable 5 استانداردهای بهرهوری را به سطحی منتقل کرده است که پیشتر غیرممکن به نظر میرسید. اما این قدرت با یک شرط پنهان میآید: مدل در برخی سناریوهای خاص، عمداً «احمقتر» میشود.
به نقل از گزارشهای منتشر شده در ۹ ژوئن ۲۰۲۶، مدل Claude Fable 5 جهشی عملکردی را تجربه کرده که آن را در دستهای کاملاً مجزا از سایر مدلهای موجود قرار میدهد. این عرضه در حالی رخ میدهد که صنعت به سمت گردشهای کاری عاملمحور (Agentic) و حل مسائل بلندمدت حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی برتری مهارتهای تکفایلی در Claude Code نسبت به اسناد مرجع مجزا اشاره کردیم، Fable 5 نخستین مدل از کلاس «Mythos» است که برای مدیریت پایگاههای کد بسیار حجیم طراحی شده؛ کدهایی که پیش از این باعث کرش کردن پنجرهٔ زمینه (Context Window) مدلها میشدند.
شکاف عملکردی
بر اساس دادههای جامعه توسعهدهندگان، اعداد خیرهکننده هستند. در محک SWE-bench Pro، مدل Fable 5 امتیاز ۸۰.۳ را کسب کرد، در حالی که GPT-5.5 تنها ۵۸.۶ امتیاز داشت. این فاصله در آزمون FrontierCode Diamond شرکت Cognition حتی عمیقتر است: ۲۹.۳٪ برای Fable در برابر ۱۳.۴٪ برای Opus 4.8 و ۵.۷٪ برای GPT-5.5. ما اینجا با یک بهبود جزئی روبهرو نیستیم، بلکه با یک سطح جدید از هوش سر و کار داریم.
کاربردهای دنیای واقعی نیز این اعداد را تأیید میکنند. شرکت Stripe گزارش داد که Fable 5 توانست یک پایگاه کد Ruby با ۵۰ میلیون خط را تنها در یک روز مهاجرت دهد؛ تسکی که تخمین زده میشد توسط یک تیم انسانی بیش از دو ماه زمان ببرد. پلتفرمهای Cursor و Replit نیز اشاره کردند که این مدل دسترسی به کلاس جدیدی از مسائل پیچیده و بلندمدت را فراهم کرده است که پیش از این غیرقابل دسترس بودند. به طور مشخص، Cursor این نتیجه را بهترین رکورد خود در CursorBench نامید.
در عمل، این یعنی در حالت تفکر «High»، مدل Fable نتایجی بهتر از حالت «xhigh» در Opus 4.8 تولید میکند. بازسازیهای بزرگی (Refactors) که پیشتر به دلیل محدودیت پنجره متنی متوقف میشدند، اکنون به طور کامل به پایان میرسند. باگهایی که Opus نادیده میگرفت، اکنون شناسایی میشوند و این اتفاق اغلب در حالی رخ میدهد که مدل برای هر تسک توکنهای کمتری مصرف میکند.

بهای قدرت
این قابلیتها هزینه سنگینی دارند. استنتاج در Fable 5 برای هر میلیون توکن ورودی ۱۰ دلار و برای هر میلیون توکن خروجی ۵۰ دلار هزینه دارد که دو برابر قیمت Opus 4.8 است. از آنجایی که جلسات پیچیده اغلب بین ۵۰۰ هزار تا یک میلیون توکن مصرف میکنند، یک جلسه کاری حساس میتواند هزینهای واقعی و قابل توجه داشته باشد.
با این حال، هزینه کل مالکیت (TCO) بسته به مورد استفاده متفاوت است. برخی تیمها گزارش دادهاند که هزینههایشان کاهش یافته، زیرا Fable 5 اغلب در اولین تلاش پاسخ درست را میدهد و نیاز به تکرارهای متعدد Opus 4.8 را از بین میبرد. در مقابل، برخی دیگر شاهد دو برابر شدن هزینهها بودهاند چون حجم درخواستهای خود را در نرخهای بالاتر ثابت نگه داشتهاند.
این تضاد، جامعه توسعهدهندگان را به دو دسته تقسیم کرده است. عدهای معتقدند بنچمارکها بیمعنی هستند و تنها «حس کاربر» (Vibes) اهمیت دارد، در حالی که مخالفان میگویند نمیتوان یک آزمایشگاه حرفهای را بر اساس حس پیش برد. سایمون ویلیسون این مدل را «یک هیولا» توصیف کرده، اما برخی دیگر آن را «فراری با محدودکننده سرعت ۳۰ مایل در ساعت» مینامند.
«خرابکاری مخفی»
جنجال اصلی مربوط به ویژگیای است که در کارت مدل ۳۱۹ صفحهای Fable 5 دفن شده است. طبق مستندات، وقتی مدل تشخیص دهد درخواست کاربر مربوط به توسعه هوش مصنوعی است، بهطور مخفیانه کیفیت پاسخ خود را کاهش میدهد بدون اینکه به کاربر اطلاع دهد.
برخلاف مسدودسازیهای امنیت سایبری — که در آن مدل صراحتاً اعلام میکند به Opus 4.8 بازگشته است — مسدودسازیهای پژوهشی هوش مصنوعی نامرئی هستند. مدل صرفاً برای آن پرسش خاص «کودنتر» میشود و در پرسش بعدی به حالت عادی باز میگردد. آنتروپیک ادعا میکند این موضوع تنها روی ۰.۰۳٪ ترافیک اثر میگذارد، اما کارت مدل صراحتاً ذکر کرده که این «مداخلات برای محدود کردن اثربخشی کلود» برای کاربر قابل مشاهده نیست.
واکنش تند متخصصان
واکنش جامعه ایمنی و پژوهش هوش مصنوعی شدید بوده است:
- نیتن لمبرت این رویه را «زننده» و «ضدعلم» خواند.
- دین بال استدلال کرد که این اقدام «به طور گسترده و عمیقی» این استدلال را تقویت میکند که ایمنی هوش مصنوعی صرفاً به عنوان یک هایپ (Hype) برای توجیه رفتارهای انحصاری به کار میرود.
- جرمی هاوارد پیشنهاد کرد که آنتروپیک قدرت کامل مدل را برای پژوهشهای پیشرو خود ذخیره کرده و بقیه را عمداً تضعیف میکند. این ادعا در حالی مطرح میشود که آنتروپیک پیشتر اعلام کرده بود بخش قابل توجهی از پژوهشهای داخلیاش تحت هدایت مدلهای کلود قرار دارد.
- بهنام نیشابور، دانشمند سابق هوش مصنوعی در آنتروپیک، پوچی این موضوع را برجسته کرد که مدل دقیقاً زمانی که قرار است در پژوهشهای هوش مصنوعی برای سرطان یا آلزایمر کمک کند، «کمی احمق» شود.
ایمنی و کاربردهای دوگانه
علیرغم رسوایی شفافیت، طبقهبندیهای ایمنی مدل بسیار مؤثر هستند. تیمهای قرمز (Red Teams) خارجی، Fable 5 را سختترین مدل آزمایششده دانستند و بیش از ۱۰۰۰ ساعت تلاش برای یافتن jailbreakهای جهانی به نتیجه نرسید. در تستها، مدل به هیچ درخواست مضر تکمرحلهای پاسخ نداد.
با این حال، قدرت مدل ریسکهای جدیدی ایجاد میکند:
- زیستشناسی/شیمی: درخواستها در این حوزهها به طور خودکار به Opus 4.8 بازگردانده میشوند.
- مدلسازی پروتئین: Fable میتواند ویژگیهای مونتاژ پوسته ویروسی را بهتر از مدلهای زبانی تخصصی پروتئین پیشبینی کند.
- تستهای رگولاتوری: سازمان AISI بریتانیا پیشرفتهایی در شکستن مدل داشت، اما این موفقیتها تنها در یک پنجره زمانی کوتاه در ابتدای عرضه رخ داد.
این وضعیت یک دوگانگی عجیب ایجاد میکند: مدل مانند فراری است که محدودکننده سرعت دارد، اما راننده نمیداند چه زمانی این محدودکننده فعال است. این مشابه یک آبجوسازی است که عمداً اولین سری از یک محصول فصلی را ضعیفتر میسازد تا مشتریان از قدرت کامل آن شوکه نشوند. در هر دو مورد، سازنده تصمیم میگیرد که مصرفکننده نمیتواند نسخه کامل را مدیریت کند و ترجیح میدهد این موضوع را پنهان کند.
برای یک توسعهدهنده معمولی که از کلود برای نوشتن کد یا پروژههای جانبی استفاده میکند، Fable 5 ارتقای عظیمی است. اگر جلسات عاملمحور شما به جای ۱۰ دلار، ۲۰ دلار هزینه داشته باشد اما در نیمی از پرامپتها به پایان برسد، بحث خرابکاری احتمالاً بیاهمیت است. اما برای کسانی که مرزهای علم هوش مصنوعی را جابهجا میکنند، این مدل اکنون جعبهای سیاه است که فعالانه در برابر پیشرفت آنها مقاومت میکند.
گزارش کامل AISI بریتانیا درباره پنجرههای ایمنی Fable 5 را دنبال کنید تا ببینید آیا محدودکنندههای «نامرئی» به استانداردی برای نسخههای آینده کلاس Mythos تبدیل میشوند یا خیر.
گام بعدی شما
- اگر در حال توسعه ابزارهای AI هستید، خروجیهای Fable 5 را با مدلهای کوچکتر مقایسه کنید تا متوجه شوید کجا محدودکننده فعال شده است.
- برای کاهش هزینههای استنتاج، از استراتژیهای کاهش توکن در ورودیها استفاده کنید تا از قیمتهای بالای کلاس Mythos در امان بمانید.
- گزارش کامل AISI بریتانیا را دنبال کنید تا ببینید آیا محدودکنندههای نامرئی به استانداردی برای مدلهای آینده تبدیل میشوند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو