پرش به محتوای اصلی
پرش به محتوای مقاله

آیا OrcaCyber Zero 1.5 جایگزین مدل‌های گران‌قیمت امنیتی می‌شود؟

·۱۹ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل امنیت سایبری OrcaCyber Zero 1.5 با پنجره زمینه یک میلیون توکن معرفی شد
مدل امنیت سایبری OrcaCyber Zero 1.5 با پنجره زمینه یک میلیون توکن معرفی شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب پنجره متنی ۱ میلیون توکنی با قیمت استنتاجی که یک مرتبه ارزان‌تر از رقبای پیشرو است؛ این مدل از تشخیص ساده به سمت اتوماسیون بازتولید اکسپلویت حرکت کرده است.

امتیاز ۱۰۰٪؛ این عددِ بی‌نقص در محک Cybench است که OrcaCyber Zero 1.5 به آن دست یافته است. این مدل پیشرو که در ۱۰ اکتبر ۲۰۲۶ منتشر شد، به‌طور اختصاصی برای پژوهش‌های مجاز در زمینه آسیب‌پذیری طراحی شده تا شکاف میان تشخیص ساده خطا و اعتبارسنجی واقعی اکسپلویت را پر کند.

هوش مصنوعی در حوزه امنیت سایبری مدت‌هاست با «نویز» گزارش‌های مثبت کاذب در گزارش‌های آسیب‌پذیری دست‌وپنجه نرم می‌کند. OrcaRouter با تمرکز بر بازتولید خطا و تست نفوذ، قصد دارد گردش کار امنیتی را از مدیریت گزارش‌های بی‌پایان به رفع آسیب‌پذیری‌های تأییدشده تغییر دهد. این مدل در واقع جایگزین نسخه Zero 1.0 است که در ۱۷ سپتامبر ۲۰۲۶ عرضه شده بود.

اهداف طراحی و معماری

مدل OrcaCyber Zero 1.5 یک مدل پس‌آموزش‌دیده (Post-trained) از خانواده Orca است که برای مهندسی امنیت بهینه‌سازی شده است. تیم توسعه برای عبور از تشخیص‌های ابتدایی، سه هدف اصلی را دنبال کرده است:

  • یافتن نقص‌های پنهان: شناسایی آسیب‌پذیری‌های ناشناخته‌ای که ابزارهای دیگر نادیده می‌گیرند؛ به‌ویژه در حوزه‌های اجرای کد از راه دور (RCE)، فرار از سندباکس، دور زدن احراز هویت، افزایش سطح دسترسی (Privilege Escalation) و زنجیره‌های پیچیده حمله.
  • استدلال پیشرفته: توانایی تحلیل مسیرهای حمله، به چالش کشیدن فرضیات داخلی خود و رتبه‌بندی نقص‌های کشف‌شده بر اساس قابلیت اکسپلویت واقعی و قابل اثبات.
  • خودمختاری عامل‌محور: به لطف پنجره زمینه (Context Window) عظیم و قابلیت بومی فراخوانی ابزار، این مدل برای عامل‌های (Agents) خودمختاری که در کدهای حجیم و پیچیده جست‌وجو می‌کنند، بهینه شده است.

جزئیات فنی و عملکرد

مشخصات فنی این مدل بر کاربرد در محیط‌های کدنویسی مقیاس‌بزرگ تأکید دارد:

  • پنجره زمینه: ۱ میلیون توکن
  • حداکثر خروجی: ۱۲۸ هزار توکن
  • قابلیت‌ها: فراخوانی تابع (Function Calling) بومی و خروجی‌های ساختاریافته
  • دسترسی: محدود به سطح پژوهش‌های امنیتی (Security Research tier) که نیازمند تعامل با شرکت، داشتن یک Passkey و پذیرش شرایط و ضوابط است. این رویکرد دسترسی محدود، مشابه استراتژی‌های سخت‌گیرانه شرکت‌های دیگر است؛ برای مثال، برنامه احراز هویت سه‌سطحی Anthropic نیز برای مدیریت دسترسی تحلیلگران به مدل‌های پیشرفته Claude طراحی شده است.
  • استقرار: فقط از طریق API شرکت OrcaRouter؛ هیچ وزن‌های باز (Open Weights) یا نسخه کوانتیده منتشر نشده است.

به نقل از گزارش marktechpost.com، عملکرد این مدل در چندین محک که آخرین بار در ۱۰ اکتبر ۲۰۲۶ ارزیابی شده‌اند، بسیار تهاجمی است. این مدل در Cybench، که شامل ۴۰ تسک حرفه‌ای CTF است، به امتیاز ۱۰۰٪ (۳۹ از ۳۹ تسک) رسید. همچنین در یک زیرمجموعه ۲۴ تسکی از CVE-Bench، که بر اساس ۴۰ مورد CVE با شدت بحرانی در وب ساخته شده است، امتیاز ۹۵.۸٪ را کسب کرد. علاوه بر این، مدل در HumanEval+ به امتیاز ۹۳.۹٪ رسید. با این حال، پایین‌ترین امتیاز منتشرشده برای آن ۷۶.۵٪ در SWE-bench Pro V2 بود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های تخصصی امنیت اشاره کردیم، تمرکز بر بازتولید آسیب‌پذیری، مدل را از یک ابزار تشخیص به یک ابزار عملیاتی تبدیل می‌کند.

چشم‌انداز رقابتی و هزینه

از نظر هزینه، این مدل رقبای سطح بالا را به چالش می‌کشد. قیمت استنتاج آن ۳ دلار برای هر ۱ میلیون توکن ورودی و ۷.۵ دلار برای هر ۱ میلیون توکن خروجی است. همچنین هزینه خواندن از حافظه پنهان (Cache reads) مبلغ ۰.۷۵ دلار برای هر ۱ میلیون توکن است. برای مقایسه، مدل Claude Mythos Preview قیمتی در حدود ۲۵ دلار برای ورودی و ۱۲۵ دلار برای خروجی به ازای هر ۱ میلیون توکن دارد که OrcaCyber Zero 1.5 را برای ممیزی‌های مقیاس‌بزرگ، یک مرتبه ارزان‌تر می‌کند.

در مقایسه با مدل‌های دیگر مانند GPT-5.5-Cyber یا Sakana Fugu-Cyber، تمرکز این مدل بر توسعه اکسپلویت و بازتولید آسیب‌پذیری متمایز است. در حالی که نسخه Zero 1.0 پیش‌تر ادعای امتیاز ۹۸.۰۷٪ در CyberGym (در حالت pass@1) را در محیط تست داخلی Orca داشت، نسخه ۱.۵ مرزها را به سمت اجرای بدون محدودیت عامل‌ها جابه‌جا کرده است.

بر اساس بررسی منابع فنی، یک نکته حیاتی وجود دارد: تمام این اعداد توسط خود فروشنده گزارش شده است. بدون یک گزارش فنی مستقل یا بازتولید توسط شخص ثالث، ادعای ۱۰۰٪ در Cybench بیشتر یک معیار ارائه شده توسط فروشنده است تا یک استاندارد تأییدشده صنعتی.

این چرخش به سمت مدل‌های «تنظیم‌شده برای سایبر» نشان می‌دهد که مدل‌های زبانی بزرگ (LLM) عمومی دیگر برای مهندسی عمیق امنیت کافی نیستند. پنجره متنی ۱ میلیون توکنی اجازه می‌دهد مدل کل زنجیره حمله و فرارهای سندباکس را در حافظه نگه دارد؛ مواردی که معمولاً از ظرفیت حافظه مدل‌های کوچک‌تر فراتر می‌رفت.

توسعه‌دهندگان می‌توانند در حال حاضر از طریق API سازگار با OpenAI و با تنظیم base_url روی https://api.orcarouter.ai/v1 و فراخوانی مدل orca/orcacyber-zero-1.5 به این مدل دسترسی یابند. طبق گزارش‌ها، زمان تا نخستین توکن (p50) در یک نمونه کوچک از ترافیک ۱.۳ هزار توکنی، حدود ۵۰۰ میلی‌ثانیه بوده است، در حالی که مقدار p95 برابر با ۲.۳۶ ثانیه گزارش شده است. این یک پیشرفت نسبت به Zero 1.0 است که در یک بازه ترافیکی بزرگ‌تر، مقدار p50 را ۳.۴۳ ثانیه ثبت کرده بود.

منتظر انتشار یک گزارش فنی مستقل باشید تا مشخص شود آیا این سقف‌های بنچمارک تحت نظارت خارجی نیز پابرجا می‌مانند یا خیر.

گام بعدی شما

  • اگر پژوهشگر امنیت هستید، مدل را در محیط‌های ایزوله برای تست بازتولید CVEهای قدیمی آزمایش کنید.
  • هزینه‌های استنتاج خود را با مدل‌های Claude مقایسه کنید تا بهینه‌ترین مسیر ممیزی کد را بیابید.
  • منتظر انتشار گزارش فنی مستقل (Technical Report) باشید تا صحت ادعای ۱۰۰٪ بنچمارک‌ها مشخص شود.

اما تأثیر این مدل بر امنیت زیرساخت‌های ابری حتی پیچیده‌تر است — به تحلیل ما درباره‌ی تهدیدات مدل‌های عامل‌محور مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش هزینه‌ها و افزایش پنجره متنی، دسترسی به ابزارهای سطح بالای تحلیل آسیب‌پذیری را دموکراتیزه می‌کند. اعتبار این پیشرفت به انتشار گزارش‌های مستقل وابسته است تا مشخص شود آیا واقعاً مرزهای استدلال امنیتی جابه‌جا شده یا خیر.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و نیاز به Passkey برای دسترسی به لایه پژوهشی، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل محدود است.

·نگاه ما
تحریریه دات‌هوش

ادعای امتیاز ۱۰۰٪ در بنچمارک‌های تخصصی معمولاً نشان‌دهنده نشت داده (Data Leakage) یا بیش‌برازش روی تسک‌های خاص است، نه لزوماً برتری مطلق. با این حال، کاهش شدید هزینه استنتاج در کنار پنجره متنی ۱ میلیون توکنی، مدل‌های عمومی را در حوزه ممیزی کد به حاشیه می‌راند و امنیت را به سمت اتوماسیون کاملِ زنجیره حمله می‌برد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.