پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک CVE-Bench: نرخ موفقیت GPT-5.5 در رفع آسیب‌پذیری‌های امنیتی ۵۰٪ است

·۸ خرداد ۱۴۰۵۲ دقیقه مطالعه
اشتراک‌گذاری

اگر امروز برای وصله کردن حفره‌های امنیتی کد خود به عامل‌های (Agents) هوش مصنوعی تکیه می‌کنید، در واقع با احتمال ۵۰٪ ریسک شکست را پذیرفته‌اید. این عدد، مرز فعلی توانایی پیشرفته‌ترین مدل‌های جهان در مواجهه با تهدیدات واقعی است.

طبق تحلیل جیოვანი گاتی (Giovanni Gatti) در ۲۹ مه ۲۰۲۶، مدل gpt-5.5 در بنچمارک جدید CVE-Bench تنها به نرخ موفقیت ۵۰ درصدی در حل کلی آسیب‌پذیری‌ها دست یافت. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، شکاف میان «شناسایی» یک باگ و «رفع» مطمئن آن، همچنان بزرگ‌ترین چالش صنعت است.

این ارزیابی روی ۲۰ مورد واقعی از آسیب‌پذیری‌های پایتون (CVEs) و پنج مدل مختلف، از جمله gpt-5.4-mini و مدل laguna-m.1 متعلق به شرکت Poolside انجام شد. بر اساس مستندات این پژوهش، مدل‌ها در سه وضعیت مختلف تست شدند:

  • Advisory: ارائه توصیف کامل آسیب‌پذیری (بهترین عملکرد).
  • Diagnose: ارائه توصیف رفتاری باگ.
  • Locate: ارائه تنها نام فایل و تابع (ضعیف‌ترین عملکرد).

به گزارش این مطالعه، مدل‌های OpenAI به‌طور آماری برتر از خانواده Laguna بودند، اما نکته کلیدی در مدل gpt-5.4-mini نهفته است؛ این مدل برای رسیدن به نتایج مشابه، ۴ برابر توکن کمتری نسبت به نسخه‌های بزرگ‌تر مصرف کرد و بهینه‌ترین گزینه بود.

تحلیل داده‌ها نشان می‌دهد که در وضعیت Locate، عملکرد مدل‌ها به‌شدت سقوط می‌کند. این یعنی مدل‌ها به‌جای استدلال درباره‌ی کد خطرناک، صرفاً در حال تطبیق الگو با متن‌های توصیفی (Advisory) هستند. در واقع، «تخصص امنیتی» این مدل‌ها بیشتر شبیه به پیروی پیشرفته از دستورالعمل‌هاست تا درک عمیق معماری کد. همچنین پدیده‌هایی مثل «انحراف در جست‌وجو» (wrong-search drift) نشان می‌دهد که مدل‌ها در برنامه‌ریزی بلندمدت برای وصله‌های پیچیده شکست می‌خورند.

گام بعدی شما

  • برای وصله‌های تولید شده توسط AI، بازبینی انسانی را اولویت قرار دهید؛ حتی اگر تست‌های رگرسیون (Regression Tests) پاس شده باشند.
  • از مخزن بازمتن CVE-Bench برای ارزیابی مدل‌های داخلی خود در محیط‌های عملیاتی استفاده کنید.
  • در پیاده‌سازی‌های حساس، به جای تکیه بر مدل‌های غول‌پیکر، کارایی مدل‌های کوچک‌تر مثل gpt-5.4-mini را در وظایف تکراری بسنجید.

اما داستان سخت‌افزاری این تحول و هزینه‌ی استنتاج این مدل‌های استدلالی حتی پیچیده‌تر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها اعتبار ادعاهای شرکت‌هایی چون Anthropic درباره‌ی برتری AI بر انسان در یافتن باگ‌ها را به چالش می‌کشد. اعتماد به وصله‌های خودکار بدون نظارت انسانی، ریسک امنیتی سازمان‌ها را به‌طور غیرقابل‌قبولی افزایش می‌دهد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.