پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Claude Fable 5 بازدهی مهاجرت کد را از دو ماه به یک روز رساند؟

·۲۰ خرداد ۱۴۰۵۹ دقیقه مطالعه
کلود فیبل ۵ و کلود میتوس ۵
کلود فیبل ۵ و کلود میتوس ۵
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی ردِ سختِ درخواست‌های پرخطر با یک سازوکار مسیریابی خودکار به مدل‌های قدیمی‌تر و امن‌تر؛ این اولین بار است که ایمنی به عنوان یک مسئله ترافیکی در مدل‌های زاینده مدیریت می‌شود.

اگر مدیریت یک پایگاه کد عظیم را بر عهده دارید، کاری که پیش‌تر دو ماه زمان یک تیم مهندسی می‌گرفت، اکنون در ۲۴ ساعت به پایان می‌رسد. این ادعای اصلی شرکت آنتروپیک (Anthropic) هنگام معرفی Claude Fable 5 و برادر محدودشده‌اش، Claude Mythos 5 در ۹ ژوئن ۲۰۲۶ است.

این عرضه در حالی رخ می‌دهد که آزمایشگاه‌های هوش مصنوعی از رابط‌های سادهٔ چت به سمت عامل‌های خودگردان (Autonomous Agents) حرکت می‌کنند که قادر به انجام کارهای با افق زمانی بلند هستند. در حالی که مدل‌های قبلی در اجرای گام‌به‌گام و پیچیده دچار مشکل بودند، مدل‌های کلاس Mythos به‌گونه‌ای طراحی شده‌اند که برای دوره‌های زمانی طولانی‌تر از هر نسخهٔ قبلی کلود به‌صورت خودگردان فعالیت کنند. Fable 5 در تقریباً تمام بنچمارک‌های تست‌شده از قابلیت‌های هوش مصنوعی، در سطح state-of-the-art (پیشروترین سطح) قرار دارد و عملکرد استثنایی در مهندسی نرم‌افزار، کارهای دانشی، بینایی، پژوهش‌های علمی و بسیاری از زمینه‌های دیگر نشان می‌دهد. هرچه وظیفه طولانی‌تر و پیچیده‌تر باشد، برتری Fable 5 نسبت به سایر مدل‌های ما بیشتر می‌شود.

پیشرفت‌های مهندسی نرم‌افزار

طبق اعلام آنتروپیک، مدل Claude Fable 5 در حال حاضر در اکثر معیارهای سنجش، استاندارد جدید را تعریف کرده است. هرچه تسک پیچیده‌تر و زمان‌برتر باشد، فاصله Fable 5 با مدل‌های قبلی بیشتر می‌شود. خیره‌کننده‌ترین مثال از شرکت Stripe می‌رسد؛ جایی که این مدل یک مهاجرت جامع در یک پایگاه کد ۵۰ میلیون خطی با زبان Ruby را تنها در یک روز انجام داد. این تسک خاص پیش از این نیازمند تلاش دستی یک تیم کامل طی دو ماه بود.

علاوه بر سرعت خام، این مدل در مصرف توکن (Token) — تکه‌های کوچکی از متن که مدل آن‌ها را پردازش می‌کند — بهینه‌تر است. در ارزیابی FrontierCode شرکت Cognition، که توانایی مدل در رعایت استانداردهای کدنویسی سطح تولید (Production-grade) را می‌سنجد، Fable 5 حتی در حالت «تلاش متوسط» (medium effort)، بالاترین امتیاز را میان تمام مدل‌های پیشرو کسب کرد.

کارهای دانشی و بینایی

برای متخصصان تحلیل مالی و تحلیل‌گران، این مدل پیشرفت‌های چشمگیری در استدلال‌های مبتنی بر سند نشان می‌دهد. در بنچمارک مالی Hebbia برای استدلال‌های سطح ارشد، Fable 5 بالاترین امتیاز تاریخ را میان تمام مدل‌ها گرفت. شرکت IMC اشاره کرد که این مدل تقریباً در تمام ارزیابی‌های تحلیل معاملات موفق بود؛ این موفقیت شامل جستجوی واقع‌گرایانه (factual lookup)، استدلال مفهومی، تحلیل ریشه‌ای (root-cause analysis) و تحلیل ارزش مورد انتظار (expected-value analysis) می‌شود.

در حوزه بینایی، Fable 5 اکنون پیشتاز است. این مدل می‌تواند اعداد دقیق را از شکل‌های علمی مفصل استخراج کند و تسک‌های پیچیده مبتنی بر بینایی، مانند بازسازی کد منبع یک اپلیکیشن وب تنها از روی اسکرین‌شات‌ها را انجام دهد. همچنین استدلال فضایی آن بهبود یافته است؛ در حالی که مدل‌های قبلی برای بازی Pokémon FireRed به ابزارهای پیچیده نیاز داشتند، Fable 5 تنها با استفاده از اسکرین‌شات‌های خام و یک رابط (harness) حداقلی و مبتنی بر بینایی، بازی را به پایان رساند.

تصویر Claude Fable 5 و Claude Mythos 5

حافظه و پژوهش‌های علمی

مدل Fable 5 از یک سیستم حافظهٔ مبتنی بر فایل و پایدار (persistent file-based memory) استفاده می‌کند تا در میان میلیون‌ها توکن متمرکز بماند و خروجی‌های خود را با استفاده از یادداشت‌های شخصی‌اش بهبود بخشد. در تست‌های بازی Slay the Spire (یک بازی استراتژیک کارت‌سازی)، این حافظه باعث شد Fable 5 سه برابر بیشتر از Opus 4.8 به مرحلهٔ نهایی برسد و عملکرد کلی آن را سه برابر بیشتر از Opus 4.8 بهبود ببخشد.

در مورد مدل محدودشدهٔ Claude Mythos 5، بیشترین اثر در علوم زیستی دیده می‌شود. متخصصان داخلی آنتروپیک از این مدل برای تسریع فرآیندهای طراحی دارو، تقریباً ۱۰ برابر سریع‌تر از قبل، استفاده کردند. در یک مطالعه، مدل بدون کمک انسان، تمام وظایفی که به‌طور معمول توسط یک دانشمند انجام می‌شود را به عهده گرفت، از جمله:

  • انتخاب سایت‌های اتصال (binding sites)
  • انتخاب و اجرای ابزارهای طراحی پروتئین
  • بازیابی و اصلاح مسیر پس از شکست‌های احتمالی در طول فرآیند

۹ مورد از ۱۴ هدف پروتئینی این مطالعه، کاندیداهای قدرتمندی برای طراحی دارو شدند که اکنون در حال بررسی هستند. این اهداف شامل نقاط بازرسی ایمنی (immune checkpoints)، سیگنال‌دهی گیرنده‌ها و فاکتور رشد، بیماری‌های عصبی (neurodegeneration)، بیماری‌های عضلانی و اهداف ساختاری سخت‌تر است.

تصویر مربوط به Claude Fable 5 و Claude Mythos 5

مدل Mythos 5 همچنین به‌طور مستمر فرضیات علمی بدیع و متقاعدکننده‌ای تولید می‌کند. در مقایسه‌های کور (blinded) چهره‌به‌چهره با مدل‌های کلاس Opus، دانشمندان در حدود ۸۰٪ موارد فرضیات زیست‌شناسی مولکولی Mythos را ترجیح دادند. یک فرضیه خاص دربارهٔ یک مکانیسم جدید برای یک پروتئین E. coli توسط یک آزمایشگاه مستقل تأیید و corroborated شد.

علاوه بر این، Mythos 5 یک هفته پژوهش ژنومیک را به‌صورت تقریباً خودگردان پیش برد. این مدل داده‌های تک‌سلولی میلیون‌ها سلول از ۱۳۸ گونه جانوری را جمع‌آوری کرد و یک مدل یادگیری ماشین سفارشی برای شناسایی سلول‌هایی که نقش یکسانی در موجودات دور-نسبت دارند، طراحی و آموزش داد. این مدل با وجود اینکه ۱۰۰ برابر کوچک‌تر بود، از مطالعه‌ای که اخیراً در مجله Science چاپ شده، عملکرد بهتری داشت. آنتروپیک قصد دارد این نتایج را در ماه‌های آینده منتشر کند.

معماری جدید ایمنی

به دلیل احتمال سوءاستفاده از این قابلیت‌ها برای حملات سایبری یا ساخت سلاح‌های بیولوژیک، آنتروپیک یک سیستم ایمنی لایه‌بندی‌شده را پیاده کرد. Fable 5 از مجموعه‌ای از طبقه‌بندی‌کننده‌های هوش مصنوعی (AI classifiers) — سیستم‌های مجزایی که مانند نگهبان‌های ورودی عمل می‌کنند — برای شناسایی سوءاستفاده‌های احتمالی، از جمله تلاش‌های «جیل‌بریک»، استفاده می‌کند تا از پاسخ دادن مدل اصلی به این درخواست‌ها جلوگیری کند.

وقتی یک طبقه‌بندی‌کننده فعال می‌شود، سیستم به‌جای رد کردن مطلق درخواست، آن را به‌طور خودکار به Claude Opus 4.8 ارجاع می‌دهد. طبق گزارش شرکت، این محافظ‌ها به‌طور میانگین در کمتر از ۵٪ جلسات فعال می‌شوند. این جایگزینی (fallback) برای ایجاد تجربه بهتر طراحی شده است تا کاربر با یک پاسخ منفی خشک روبرو نشود و در هر بار وقوع این اتفاق، کاربر مطلع خواهد شد.

کلود فابل ۵ و کلود میتوس ۵

مقایسه کلود فیبل ۵ و کلود میتوس ۵

جزئیات مکانیزم‌های حفاظتی

آنتروپیک سه حوزه تمرکز اصلی برای این طبقه‌بندی‌کننده‌ها تعریف کرده است:

  • امنیت سایبری: مدل‌های کلاس Mythos در کشف آسیب‌پذیری‌های نرم‌افزاری و هک‌های عامل‌محور (شامل شناسایی، کشف و حرکت عرضی یا lateral movement) عالی هستند. طبقه‌بندی‌کننده‌ها مانع پیشروی Fable در این وظایف تهاجمی می‌شوند. ارزیابی‌های داخلی نشان می‌دهد Fable 5 در برابر جیل‌بریک‌ها مقاوم‌تر از مدل‌های قبلی است. یک شریک خارجی دریافت که Fable 5 در برابر هیچ‌کدام از درخواست‌های مضر تک‌مرحله‌ای مربوط به برنامه‌ریزی حملات، توسعه اکسپلویت یا دور زدن دفاعات، حتی با استفاده از ۳۰ تکنیک مختلف جیل‌بریک عمومی، تسلیم نشد.
  • زیست‌شناسی و شیمی: برای جلوگیری از ارتقای توانایی‌های بازیگران بدخواه در پژوهش‌های زیستی پرخطر، Fable در اکثر درخواست‌های این حوزه به Opus 4.8 ارجاع داده می‌شود. در تست‌ها، مدل‌های کلاس Mythos در پیش‌بینی اثرات تغییرات ژنتیکی بر مونتاژ پوسته ویروسی یک ویروس مرتبط با آدنو (AAV)، از مدل‌های تخصصی «زبان پروتئین» پیشی گرفتند؛ قابلیتی که برای ژن‌درمانی مفید اما در صورت سوءاستفاده خطرناک است.
  • تقطیر (Distillation): برای جلوگیری از استخراج قابلیت‌ها جهت آموزش مدل‌های رقیب در کشورهای استبدادی، درخواست‌هایی که به عنوان تلاش برای تقطیر شناسایی شوند، به Opus 4.8 هدایت می‌شوند.

برای اطمینان بیشتر، آنتروپیک یک برنامه «پاداش باگ» (bug bounty) خارجی اجرا کرد که طی آن بیش از ۱۰۰۰ ساعت تست بدون یافتن یک جیل‌بریک جهانی طی شد. با این حال، شرکت پذیرفت که AISI بریتانیا در یک بازه کوتاه تست اولیه، پیشرفت‌هایی در یافتن یک مورد داشته است. هدف این است که جیل‌بریک‌های باقی‌مانده به‌قدری کند و هزینه‌بر باشند که پیش از استفاده در مقیاس وسیع، شناسایی شوند.

نگهداری داده‌ها و هم‌ترازی

آنتروپیک سیاست جدیدی برای نگهداری داده‌ها در Fable 5، Mythos 5 و مدل‌های پرقدرت آینده معرفی کرد. تمام ترافیک مدل‌های کلاس Mythos، چه در سطوح اول و چه در سطوح شخص ثالث، نیازمند نگهداری ۳۰ روزه داده‌ها خواهد بود. این داده‌ها برای آموزش مدل‌های جدید استفاده نمی‌شوند، بلکه برای دفاع در برابر حملات پیچیده و کاهش مثبت‌های کاذب (false positives) به کار می‌روند. حفاظت‌های حریم خصوصی جدید شامل ثبت تمام دسترسی‌های انسانی به داده‌ها و اطمینان از حذف آن‌ها پس از ۳۰ روز در تقریباً تمام موارد است.

در مورد هم‌ترازی (Alignment)، ارزیابی‌های خودکار نشان داد که سطح رفتارهای ناهماهنگ در Mythos 5 — از جمله فریب‌کاری و همکاری در سوءاستفاده — پایین و مشابه Opus 4.8 است. از آنجا که Fable 5 از همان مدل پایه استفاده می‌کند، انتظار می‌رود هم‌ترازی آن نیز مشابه باشد. جزئیات بیشتر در کارت سیستم (system card) مدل موجود است.

قیمت‌گذاری و دسترسی

هر دو مدل Fable 5 و Mythos 5 با قیمت ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی عرضه شده‌اند. این یعنی کاهش بیش از ۵۰ درصدی هزینه نسبت به نسخه پیش‌نمایش Claude Mythos.

مدل Fable 5 از امروز به‌صورت جهانی از طریق API در دسترس است. Mythos 5 فعلاً محدود به شرکای Project Glasswing (همکاری با دولت آمریکا) است، هرچند برنامه‌ای برای یک «برنامه دسترسی مورد اعتماد» گسترده‌تر برای سازمان‌های امنیت سایبری در راه است. برنامه زیست‌شناسی نیز دسترسی به Fable 5 را با حذف محافظ‌های زیست‌شناسی و شیمی، اما با حفظ محافظ‌های سایبری، فراهم می‌کند. این برنامه تعداد کمی از پژوهشگران سازمان‌های علوم زیستی در زمینه‌های پژوهش‌های بنیادی و کاربردی را شامل می‌شود.

برای کاربران اشتراکی (Pro, Max, Team و Enterprise مبتنی بر صندلی)، مدل Fable 5 از امروز تا ۲۲ ژوئن ۲۰۲۶ بدون هزینه اضافی در دسترس است. از ۲۳ ژوئن، Fable 5 از این طرح‌ها حذف شده و نیاز به خرید اعتبار (usage credits) خواهد داشت تا زمانی که ظرفیت سرورها اجازه بازگشت آن به عنوان یک ویژگی استاندارد اشتراک را بدهد.

تحلیل: چرخش به سمت بازگشت سرمایهٔ عامل‌محور

این عرضه نشان‌دهنده گذار از «چت‌بات‌ها» به سمت «کارمندان دیجیتال» است. بازخوردهای اولیه مشتریان این تغییر را تأیید می‌کند:

  • CursorBench: کاربران گزارش می‌دهند که حالا کلاس جدیدی از مشکلات با افق زمانی بلند، که پیش‌تر غیرقابل حل بودند، باز شده‌اند.
  • GitHub: تست‌کنندگان سطح استقلال و قابلیت اعتمادی را می‌بینند که از بنچمارک‌های قبلی فراتر است و به آینده‌ای اشاره دارد که توسعه‌دهندگان به عامل‌ها در کل چرخه حیات نرم‌افزار اعتماد کنند.
  • تجربه توسعه‌دهنده: برخی کاربران می‌گویند اپلیکیشن‌هایی که سال پیش نیاز به صدها پرامپت داشتند، اکنون با یک دستور (One-shot) ساخته می‌شوند.
  • سطح پژوهشی: یک کاربر اشاره کرد Fable 5 در سطح «پژوهشگر ارشد» عمل می‌کند و قادر است مسیرهای تحقیق را انتخاب کند، منابع را تخصیص دهد و باورهای غلط را حذف کند.
  • حقوق و مالی: وکلا دریافتند تصحیحات متنی (redlines) مدل با نسخه‌های فعلی برابری یا از آن‌ها بهتر است. کاربران مالی نیز گزارش داده‌اند که این قوی‌ترین مدل مالی است که تا کنون تست شده و نمرات بنچمارک‌های تحلیل هسته را ۱۰ امتیاز نسبت به Opus افزایش داده و از ۹۰٪ عبور کرده است.
  • فیزیک و صفحات گسترده: این مدل در پژوهش‌های پیشرو فیزیک با GPT-5.5 برابری می‌کند و پیشرفتی که برای GPT-5.5 چهار روز زمان برد را در ۳۶ ساعت و با یک‌سوم توکن‌های استدلالی به دست آورد. در مجموعه‌های صفحه گسترده (spreadsheet)، اجراها را ۲۵ تا ۳۰ درصد سریع‌تر از Opus 4.8 به پایان می‌رساند.
  • کدنویسی حسی (Vibe-Coding): در ViBench، این مدل با کمترین توکن و در سریع‌ترین زمان، اپلیکیشن‌ها را می‌سازد و تقریباً تمام موارد استفاده پایه را اشباع کرده است.

آنتروپیک با تبدیل «دو ماه کار انسانی» به «یک روز کار هوش مصنوعی»، بحث را از هزینه توکن به ارزش جایگزینی نیروی کار تغییر داده است. برای کاربر، مهم‌ترین تغییر مکانیزم «جایگزین» است. ارجاع درخواست‌های پرخطر به مدل Opus 4.8 به‌جای رد مطلق، اصطکاک مدل‌های سخت‌گیر را کاهش می‌دهد.

با این حال، سیاست نگهداری ۳۰ روزه داده‌ها برای تمام ترافیک کلاس Mythos ممکن است برای مشتریان سازمانی حساس به حریم خصوصی چالش‌برانگیز باشد. معامله شفاف است: استقلال و قدرت بیشتر، نظارت بیشتر برای جلوگیری از فجایع را می‌طلبد.

منتظر انتشار مقاله پژوهشی ژنومیک و گسترش برنامه دسترسی مورد اعتماد باشید تا ببینیم آیا قابلیت‌های بیولوژیکی Mythos 5 به درمان‌های واقعی در دنیای واقعی تبدیل می‌شوند یا خیر.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، از امروز تا ۲۲ ژوئن Fable 5 را در اشتراک خود تست کنید تا نیازهای کدنویسی بلندمدت خود را شناس کنید.
  • برای سازمان‌های مالی، بنچمارک‌های جدید Hebbia را بررسی کنید تا متوجه شوید کجاها می‌توانید تحلیل‌های انسانی را با مدل جایگزین کنید.
  • اگر با API کار می‌کنید، ساختار درخواست‌های خود را برای بهره‌برداری از کاهش ۵۰ درصدی هزینه‌ها بهینه‌سازی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد به دلیل تخصص Anthropic در همراستاسازی، استاندارد جدیدی برای تعامل با مدل‌های پرخطر ایجاد می‌کند. انتقال از «رد درخواست» به «مسیریابی هوشمند»، بهره‌وری عامل‌های هوش مصنوعی را در محیط‌های سازمانی به شدت افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به قابلیت‌های عامل‌محور Fable 5 همچنان دشوار است و احتمالا نیازمند واسط‌های پرداختی خارجی خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما این است که Anthropic با تبدیل ایمنی از یک سد (Filter) به یک مسیریاب (Router)، در حال بازتعریف مفهوم «مدل امن» است. این رویکرد نشان می‌دهد که شرکت‌ها دیگر به دنبال حذف کامل ریسک نیستند، بلکه می‌خواهند ریسک را به لایه‌های کنترل‌شده‌تر منتقل کنند تا تجربه کاربری فدای امنیت نشود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.