پرش به محتوای اصلی
پرش به محتوای مقاله

برتری Claude Mythos در اکسپلویت‌های مرورگر؛ بهای ۱۲ برابری برای قدرت بیشتر

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه
برتری Claude Mythos در اکسپلویت‌های مرورگر؛ بهای ۱۲ برابری برای قدرت بیشتر
اشتراک‌گذاری

تصور کنید ابزاری دارید که نه تنها باگ‌ها را پیدا می‌کند، بلکه به‌طور خودکار کد تخریبی برای اجرای آن‌ها می‌نویسد. این دیگر یک سناریوی تخیلی نیست؛ Claude Mythos Preview اکنون می‌تواند اکسپلویت‌های واقعی مرورگر را توسعه دهد و از شناسایی ساده‌ی خطاها به مرحله‌ی اجرای کد برسد.

این پیشرفت در حالی رخ می‌دهد که صنعت در حال ارزیابی سقف استدلال عامل‌محور (Agentic) است. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش ۴۶ درصدی خطاهای سازمانی در GPT-5.5 اشاره کردیم، به نظر می‌رسید بهره‌وری در حال افزایش است، اما داده‌های جدید نشان می‌دهند که در وظایف حساس امنیتی، عملکرد خام بیشتر به میزان هزینه محاسباتی وابسته است تا کارایی معماری. تمرکز این آزمایش‌ها بر موتور جاوااسکریپت V8 بود که هسته اصلی مرورگرهای کروم و اج است.

به نقل از گزارش ExploitBench که در ۱۶ مه ۲۰۲۶ منتشر شد، شکاف عملکردی میان دو مدل بسیار عمیق است:

  • Claude Mythos Preview (با راهنمایی انسان): میانگین نمره ۹.۹۰ از ۱۶ و دستیابی به بالاترین سطح (T1) در ۲۱ مورد از ۴۱ آسیب‌پذیری.
  • GPT-5.5 (از طریق Codex): میانگین نمره ۵.۵۱ از ۱۶ و رسیدن به سطح T1 تنها در دو مورد.
  • حالت خودگردان (Autonomous Mode): نمره Mythos در ۹.۵۵ باقی ماند، در حالی که GPT-5.5 به ۴.۳۰ سقوط کرد.

طبق گزارش این بنچمارک، تفاوت هزینه‌ها تکان‌دهنده است. اجرای کامل تست‌های Mythos در ۱۲۲ اپیزود حدود ۳۶,۴۲۸ دلار هزینه داشت، در حالی که هزینه مشابه برای ۱۲۳ اپیزود GPT-5.5 تنها ۳,۰۷۵ دلار بود.

این نتایج یک تقابل حیاتی را در مدل‌های پیشرو نشان می‌دهد: OpenAI احتمالاً می‌تواند شکاف توانمندی را صرفاً با افزایش بودجه محاسباتی برای عامل‌های خود پر کند. تکان‌دهنده‌ترین بخش این گزارش، بازتولید آسیب‌پذیری CVE-2024-0519 توسط Mythos است؛ حفره‌ای که پژوهشگران انسانی بیش از یک سال برای شکستن آن تلاش کردند و شکست خوردند. این یعنی هوش مصنوعی اکنون در سطح یک پژوهشگر امنیتی «کاملاً توانمند» عمل می‌کند و قادر است مسائلی را حل کند که پیش‌تر برای اتوماسیون بیش از حد پیچیده می‌نمودند.

گام بعدی شما

  • مخازن GitHub و مقالات arXiv مربوط به ExploitBench را برای رصد وصله‌های خودکار (Automated Patches) دنبال کنید.
  • استراتژی‌های دفاعی خود را از «شناسایی باگ» به «پیش‌بینی مسیر اکسپلویت» تغییر دهید.
  • هزینه‌های استنتاج (Inference) مدل‌های استدلالی را در مقیاس عملیاتی بازبینی کنید.

اما این نبرد توانمندی‌ها تنها بخشی از داستان است؛ اثر این مدل‌ها بر آینده امنیت زیرساخت‌های ابری را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این تحول، مرز بین «یافتن باگ» و «بهره‌برداری از آن» را از بین می‌برد و ریسک‌های امنیتی را به سطح جدیدی می‌برد. اعتبار این یافته‌ها بر اساس داده‌های سخت ExploitBench است که نشان می‌دهد اتوماسیون در سطح پیشرفته امنیتی اکنون یک واقعیت است.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.