امتیاز ۱۰۰٪؛ این عددِ بینقص در محک Cybench است که OrcaCyber Zero 1.5 به آن دست یافته است. این مدل پیشرو که در ۱۰ اکتبر ۲۰۲۶ منتشر شد، بهطور اختصاصی برای پژوهشهای مجاز در زمینه آسیبپذیری طراحی شده تا شکاف میان تشخیص ساده خطا و اعتبارسنجی واقعی اکسپلویت را پر کند.
هوش مصنوعی در حوزه امنیت سایبری مدتهاست با «نویز» گزارشهای مثبت کاذب در گزارشهای آسیبپذیری دستوپنجه نرم میکند. OrcaRouter با تمرکز بر بازتولید خطا و تست نفوذ، قصد دارد گردش کار امنیتی را از مدیریت گزارشهای بیپایان به رفع آسیبپذیریهای تأییدشده تغییر دهد. این مدل در واقع جایگزین نسخه Zero 1.0 است که در ۱۷ سپتامبر ۲۰۲۶ عرضه شده بود.
اهداف طراحی و معماری
مدل OrcaCyber Zero 1.5 یک مدل پسآموزشدیده (Post-trained) از خانواده Orca است که برای مهندسی امنیت بهینهسازی شده است. تیم توسعه برای عبور از تشخیصهای ابتدایی، سه هدف اصلی را دنبال کرده است:
- یافتن نقصهای پنهان: شناسایی آسیبپذیریهای ناشناختهای که ابزارهای دیگر نادیده میگیرند؛ بهویژه در حوزههای اجرای کد از راه دور (RCE)، فرار از سندباکس، دور زدن احراز هویت، افزایش سطح دسترسی (Privilege Escalation) و زنجیرههای پیچیده حمله.
- استدلال پیشرفته: توانایی تحلیل مسیرهای حمله، به چالش کشیدن فرضیات داخلی خود و رتبهبندی نقصهای کشفشده بر اساس قابلیت اکسپلویت واقعی و قابل اثبات.
- خودمختاری عاملمحور: به لطف پنجره زمینه (Context Window) عظیم و قابلیت بومی فراخوانی ابزار، این مدل برای عاملهای (Agents) خودمختاری که در کدهای حجیم و پیچیده جستوجو میکنند، بهینه شده است.

جزئیات فنی و عملکرد
مشخصات فنی این مدل بر کاربرد در محیطهای کدنویسی مقیاسبزرگ تأکید دارد:
- پنجره زمینه: ۱ میلیون توکن
- حداکثر خروجی: ۱۲۸ هزار توکن
- قابلیتها: فراخوانی تابع (Function Calling) بومی و خروجیهای ساختاریافته
- دسترسی: محدود به سطح پژوهشهای امنیتی (Security Research tier) که نیازمند تعامل با شرکت، داشتن یک Passkey و پذیرش شرایط و ضوابط است. این رویکرد دسترسی محدود، مشابه استراتژیهای سختگیرانه شرکتهای دیگر است؛ برای مثال، برنامه احراز هویت سهسطحی Anthropic نیز برای مدیریت دسترسی تحلیلگران به مدلهای پیشرفته Claude طراحی شده است.
- استقرار: فقط از طریق API شرکت OrcaRouter؛ هیچ وزنهای باز (Open Weights) یا نسخه کوانتیده منتشر نشده است.
به نقل از گزارش marktechpost.com، عملکرد این مدل در چندین محک که آخرین بار در ۱۰ اکتبر ۲۰۲۶ ارزیابی شدهاند، بسیار تهاجمی است. این مدل در Cybench، که شامل ۴۰ تسک حرفهای CTF است، به امتیاز ۱۰۰٪ (۳۹ از ۳۹ تسک) رسید. همچنین در یک زیرمجموعه ۲۴ تسکی از CVE-Bench، که بر اساس ۴۰ مورد CVE با شدت بحرانی در وب ساخته شده است، امتیاز ۹۵.۸٪ را کسب کرد. علاوه بر این، مدل در HumanEval+ به امتیاز ۹۳.۹٪ رسید. با این حال، پایینترین امتیاز منتشرشده برای آن ۷۶.۵٪ در SWE-bench Pro V2 بود.

همانطور که در تحلیلهای پیشین ما دربارهی مدلهای تخصصی امنیت اشاره کردیم، تمرکز بر بازتولید آسیبپذیری، مدل را از یک ابزار تشخیص به یک ابزار عملیاتی تبدیل میکند.
چشمانداز رقابتی و هزینه
از نظر هزینه، این مدل رقبای سطح بالا را به چالش میکشد. قیمت استنتاج آن ۳ دلار برای هر ۱ میلیون توکن ورودی و ۷.۵ دلار برای هر ۱ میلیون توکن خروجی است. همچنین هزینه خواندن از حافظه پنهان (Cache reads) مبلغ ۰.۷۵ دلار برای هر ۱ میلیون توکن است. برای مقایسه، مدل Claude Mythos Preview قیمتی در حدود ۲۵ دلار برای ورودی و ۱۲۵ دلار برای خروجی به ازای هر ۱ میلیون توکن دارد که OrcaCyber Zero 1.5 را برای ممیزیهای مقیاسبزرگ، یک مرتبه ارزانتر میکند.
در مقایسه با مدلهای دیگر مانند GPT-5.5-Cyber یا Sakana Fugu-Cyber، تمرکز این مدل بر توسعه اکسپلویت و بازتولید آسیبپذیری متمایز است. در حالی که نسخه Zero 1.0 پیشتر ادعای امتیاز ۹۸.۰۷٪ در CyberGym (در حالت pass@1) را در محیط تست داخلی Orca داشت، نسخه ۱.۵ مرزها را به سمت اجرای بدون محدودیت عاملها جابهجا کرده است.

بر اساس بررسی منابع فنی، یک نکته حیاتی وجود دارد: تمام این اعداد توسط خود فروشنده گزارش شده است. بدون یک گزارش فنی مستقل یا بازتولید توسط شخص ثالث، ادعای ۱۰۰٪ در Cybench بیشتر یک معیار ارائه شده توسط فروشنده است تا یک استاندارد تأییدشده صنعتی.
این چرخش به سمت مدلهای «تنظیمشده برای سایبر» نشان میدهد که مدلهای زبانی بزرگ (LLM) عمومی دیگر برای مهندسی عمیق امنیت کافی نیستند. پنجره متنی ۱ میلیون توکنی اجازه میدهد مدل کل زنجیره حمله و فرارهای سندباکس را در حافظه نگه دارد؛ مواردی که معمولاً از ظرفیت حافظه مدلهای کوچکتر فراتر میرفت.
توسعهدهندگان میتوانند در حال حاضر از طریق API سازگار با OpenAI و با تنظیم base_url روی https://api.orcarouter.ai/v1 و فراخوانی مدل orca/orcacyber-zero-1.5 به این مدل دسترسی یابند. طبق گزارشها، زمان تا نخستین توکن (p50) در یک نمونه کوچک از ترافیک ۱.۳ هزار توکنی، حدود ۵۰۰ میلیثانیه بوده است، در حالی که مقدار p95 برابر با ۲.۳۶ ثانیه گزارش شده است. این یک پیشرفت نسبت به Zero 1.0 است که در یک بازه ترافیکی بزرگتر، مقدار p50 را ۳.۴۳ ثانیه ثبت کرده بود.
منتظر انتشار یک گزارش فنی مستقل باشید تا مشخص شود آیا این سقفهای بنچمارک تحت نظارت خارجی نیز پابرجا میمانند یا خیر.
گام بعدی شما
- اگر پژوهشگر امنیت هستید، مدل را در محیطهای ایزوله برای تست بازتولید CVEهای قدیمی آزمایش کنید.
- هزینههای استنتاج خود را با مدلهای Claude مقایسه کنید تا بهینهترین مسیر ممیزی کد را بیابید.
- منتظر انتشار گزارش فنی مستقل (Technical Report) باشید تا صحت ادعای ۱۰۰٪ بنچمارکها مشخص شود.
اما تأثیر این مدل بر امنیت زیرساختهای ابری حتی پیچیدهتر است — به تحلیل ما دربارهی تهدیدات مدلهای عاملمحور مراجعه کنید.




گفتگو