۰.۲۰۹ در برابر ۰.۱۸۶؛ این تفاوت اندک در امتیاز F1 فایلها، نشاندهنده تغییری بنیادین در بازدهی است. اکنون یک مدل ۱.۶ میلیارد پارامتری در مکانیابی دقیق آسیبپذیریها، غولی با ۷۵۳ میلیارد پارامتر را شکست داده است. این پیشرفت از طریق Antares حاصل شده است؛ خانوادهای از مدلهای زبانی کوچک (SLM) که توسط Cisco Foundation AI برای پیوند دادن دانش خارجی آسیبپذیریها به مخازن کد داخلی طراحی شدهاند. طبق گزارش فنی منتشر شده در وبسایت marktechpost.com، مدل Antares-1B توانست در این وظیفه تخصصی، مدل ۷۵۳ میلیارد پارامتری GLM-5.2 را با موفقیت پشت سر بگذارد.
فرآیند تریاژ امنیتی بهطور سنتی یک عملیات دستی و پرهزینه است. چالش اصلی در اینجا، متصل کردن دانش خارجی — که در پایگاههای داده عمومی، توصیهها (Advisories) و طبقهبندیهای Common Weakness Enumerations (CWEs) یافت میشود — به کدهای منبع داخلی است. این کدها معمولاً در مخازنی قرار دارند که بسیار حجیم، ماژولار و دارای وابستگیهای غنی و پیچیدهای هستند.
توسعهدهندگان مجبورند در کدهایی ناآشنا جستوجو کنند، قراردادهای نامگذاری را تحلیل نمایند و مسیرهای فراخوانی (Call Paths) را بررسی کنند تا متوجه شوند یک نقطه ضعف (CWE) دقیقاً در کجا ظاهر شده است. رویکرد سیسکو این است که اولین گام تریاژ، جایی است که بیشترین هزینهها در آن متمرکز شده است. با این حال، Antares قرار نیست جایگزین کل زنجیره ابزارهای امنیت اپلیکیشن شود. سیسکو صراحتاً اعلام کرده است که تیمها همچنان به اسکن وابستگیها، بررسی Secrets، تستهای پویا، بررسی کانتینرها، مدلسازی تهدیدات و بررسیهای متخصصی نیاز دارند.
در حالی که صنعت بر تحلیل ایستا تکیه دارد، دادههای سیسکو نشان میدهد ابزارهای فعلی فاقد بستر تطبیقی (Adaptive Context) لازم برای مکانیابی پیچیده هستند. برای مثال، ابزار Semgrep امتیاز ۰.۰۸۶ در File F1 در بنچمارک جدید کسب کرد، در حالی که CodeQL امتیاز ۰.۰۲۳ و Horusec امتیاز ۰.۰۲۰ را به دست آوردند. این نتایج نشان میدهد که این ابزارهای سنتی در برابر استدلال تطبیقی مدلهای زبانی کوچک (SLM) شکست خوردهاند.
معماری Antares بر پایه سه ترنسفورمر (Transformer) فقط-رمزگشا بنا شده که از نقاط بازرسی IBM Granite 4.0 آغاز شدهاند. این مدلها دارای یک توکنایزر مشترک هستند و معماری آنها ویژگیهایی چون توجه پرسوجوی گروهی (Grouped-query attention)، لایههای SwiGLU MLP، نرمالسازی RMSNorm، رمزگذاری موقعیتی (RoPE) و جاسازیهای (Embeddings) مشترک برای ورودی و خروجی را شامل میشود:
- Antares-350M: ۳۵۰ میلیون پارامتر؛ پنجره زمینه ۳۲ هزار توکن؛ ۲۸ لایه / ۱۰۲۴ واحد پنهان / ۴ سر KV؛ وزنهای باز (Apache 2.0).
- Antares-1B: ۱.۶ میلیارد پارامتر؛ پنجره زمینه ۱۲۸ هزار توکن؛ ۴۰ لایه / ۲۰۴۸ واحد پنهان / ۴ سر KV؛ وزنهای باز (Apache 2.0).
- Antares-3B: ۳ میلیارد پارامتر؛ پنجره زمینه ۱۲۸ هزار توکن؛ بر پایه Granite 4.0 Micro؛ هنوز منتشر نشده است.
مدل Antares برخلاف مدلهای متوالی استاندارد، در یک حلقه عاملمحور (Agentic) محدود با استفاده از سه ابزار عمل میکند. مدل تنها توصیف دسته CWE را دریافت میکند و هیچ متن توصیهای، راهنمایی درباره فایلها یا جزئیات مربوط به شدت آسیبپذیری را دریافت نمیکند. این مدل دستورات ترمینالی فقط-خواندنی را در یک محیط ایزولهی Docker که دسترسی شبکه در آن غیرفعال است، اجرا میکند. خروجی دستورات پیش از ورود به متن گفتگو (Transcript) تا ۲,۰۰۰ کاراکتر کوتاه میشود. مدل در هر تسک محدود به ۱۵ فراخوانی ترمینال است. برای پایان کار، مدل باید تابع submit_vulnerable_files را با یک لیست رتبهبندی شده یا تابع submit_no_vulnerability_found را فراخوانی کند. این ارسال نهایی جزو بودجه ۱۵ تایی فراخوانیها محاسبه نمیشود. خروجی نهایی شامل یک لیست رتبهبندی شده از مسیر فایلها و ردپای اکتشاف (Exploration Trace) است.
برای ارزیابی این عملکرد، سیسکو بنچمارک Vulnerability Localization Benchmark (VLoc Bench) را منتشر کرد؛ یک ارزیابی عاملمحور با ۵۰۰ تسک تحت لایسنس Apache 2.0. این بنچمارک تسکهای خود را از ۲۹۰ مخزن واقعی و منحصربهفرد در ۶ اکوسیستم مختلف شامل npm، pip، Maven، Go، Rust و Composer استخراج کرده است.
این محک ۱۴۷ دسته منحصربهفرد از CWE را پوشش میدهد و ۷۸٪ از ورودیهای آن دارای شناسههای CVE تخصیصیافته هستند. حقیقت زمینی (Ground Truth) از روی وصلههای امنیتی استخراج شده است؛ فایلهایی که در اصلاحیه تغییر کردهاند به عنوان برچسب (Label) در نظر گرفته شدهاند، در حالی که تستها، مستندات و تنظیمات حذف شدهاند. ارزیابی در دو فاز انجام میشود:
- فاز A: مدل یک کپی (Snapshot) آسیبپذیر را دریافت کرده و بر اساس File F1 امتیاز میگیرد.
- فاز B: مدل کپی اصلاحشده (Patched) را دریافت میکند تا نرخ منفی واقعی (True Negative Rate) اندازهگیری شود و هشدارهای کاذب روی کدهای اصلاحشده سنجیده شود.
نتایج نشان میدهد که ما با یک «پرتگاه توانمندی» روبرو هستیم، نه یک منحنی مقیاسپذیری ساده. نقاط بازرسی خام Granite 4.0 تقریباً امتیاز صفر در File F1 کسب کردند (به ترتیب ۰.۰۰۱، ۰.۰۰۰ و ۰.۰۰۰ برای سه اندازه). اگرچه آنها توانایی فراخوانی ابزار را داشتند، اما در حلقه عاملمحور خروجیهای تخریبی و بیمعنی تولید میکردند. بخش اصلی توانmندی از طریق تنظیم نظارتشده (SFT) به دست آمد که امتیازات را به ترتیب به ۰.۱۰۸، ۰.۱۸۸ و ۰.۱۹۸ رساند. مجموعه داده SFT از ترکیبهای زیر ساخته شده بود:
- ۷۱.۵٪ استدلال امنیت سایبری
- ۱۵.۴٪ مسیرهای جستوجوی کد
- ۱۳.۱٪ پژوهشهای عمیق و استدلال عمومی
تمام این ردپاها (Traces) از یک مدل معلم واحد یعنی GPT-OSS-120B تولید شدند تا از جابهجایی توزیع دادهها بین معلمان مختلف جلوگیری شود. بهکارگیری روش بهینهسازی سیاست نسبی گروهی (GRPO) عملکرد مدلها را ۱۱٪ تا ۲۵٪ بهبود بخشید، که بیشترین سود نسبی در مدل ۳۵۰ میلیون پارامتری دیده شد. پاداشها بهصورت برنامهنویسی شده از متن مسیرها محاسبه شدند (بدون استفاده از مدل پاداش یادگیریشده) و کیفیت مکانیابی، رعایت قوانین استفاده از ابزار و کیفیت اکتشاف را پوشش دادند.
روش GRPO همچنین انحراف معیار بین اجراها را ۴۲٪ تا ۶۵٪ کاهش داد و باعث شد یک اجرای ارزیابی واحد، قابلاعتمادتر از یک اجرای SFT تکگانه باشد. این امر منجر به یک تفکیک استراتژیک وابسته به مقیاس شد: مدلهای ۳۵۰ میلیون و ۱ میلیارد پارامتری از ۸۷-۸۹٪ دستورات جستوجو استفاده کرده و فایلهای بیشتری را ارسال کردند، در حالی که مدل ۳ میلیارد پارامتری ۵۲٪ از دستورات جستوجو و ۳۷٪ از دستورات خواندن را به کار برد و فایلهای کمتری را با دقت (Precision) بالاتر ارسال کرد.
در نهایت، تخصصی کردن آموزش بر مقیاس پارامترها غلبه کرد. مدل Antares-3B با امتیاز ۰.۲۲۳ به GPT-5.5 (۰.۲۲۹) نزدیک شد. در این میان، رقابت میان مدلهای پیشرفته امنیتی شدت یافته است و برای مثال مدل GPT-5.5-Cyber نیز در محکهای مشابه توانمندیهای خود را در برابر رقبایی چون آنتروپیک به رخ کشیده است. Antares-1B با امتیاز ۰.۲۰۹، مدل GLM-5.2 (۷۵۳ میلیارد پارامتر) با امتیاز ۰.۱۸۶ و همچنین Gemini 3 Pro را شکست داد. مدل Antares-350M با امتیاز ۰.۱۳۵ توانست بر Gemma-4-31B (۰.│۰۱) و Gemini 2.5 Flash (۰.۱۰۲) پیروز شود. نکته قابل توجه این است که Antares-1B بالاترین نرخ فراخوانی (Recall) را در بین تمام سیستمهای ارزیابی شده با مقدار ۰.۲۲۴ ثبت کرد.
این تغییر باعث شده مکانیابی با دقت بالا از نظر اقتصادی توجیهپذیر شود. هزینه اجرای کامل ۵۰۰ تسک در Antares روی یک GPU H100 کمتر از ۱ دلار است، در حالی که این هزینه برای GLM-5.2 معادل ۱۲.۵ دلار و برای GPT-5.5 حدود ۱۴۱ دلار است.
کاربران اکنون میتوانند به نسخههای وزنباز در Hugging Face دسترسی داشته باشند. نقاط مورد علاقه بعدی، انتشار نسخه Antares-3B و انتشار دادههای مربوط به هشدارهای کاذب فاز B خواهد بود.
گام بعدی شما
- اگر توسعهدهنده یا متخصص امنیت هستید، نسخههای وزنباز Antares را در Hugging Face بررسی کنید تا سرعت تریاژ کدهای خود را بسنجید.
- منتظر انتشار نسخه Antares-3B و دادههای مربوط به هشدارهای کاذب (فاز B) باشید تا درک بهتری از دقت واقعی مدل به دست آورید.
- استراتژی GRPO را برای کاهش واریانس در مدلهای کوچک خود پیادهسازی کنید.
اما تأثیر این مدلها بر کاهش هزینههای عملیاتی مراکز داده حتی خیرهکنندهتر است — به تحلیل ما درباره بهینهسازی هزینه استنتاج مراجعه کنید.




گفتگو