پرش به محتوای اصلی
پرش به محتوای مقاله

«ساختار عامل‌محور»؛ کلید پیروزی مدل‌های کوچک Antares در تحلیل کدهای حجیم

·۳۱ تیر ۱۴۰۵۵ دقیقه مطالعه
انتشار مدل‌های متن‌باز آنتارس توسط سیسکو: شناسایی آسیب‌پذیری‌های شناخته‌شده در کدهای واقعی
انتشار مدل‌های متن‌باز آنتارس توسط سیسکو: شناسایی آسیب‌پذیری‌های شناخته‌شده در کدهای واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین نمایش عملی از برتری یک مدل ۱.۶ میلیارد پارامتری بر مدلی با ۷۵۳ میلیارد پارامتر در حوزه مکان‌یابی کد؛ جایی که آموزش تخصصی و حلقه عامل‌محور، جایگزین مقیاس سخت‌افزاری شده است.

۰.۲۰۹ در برابر ۰.۱۸۶؛ این تفاوت اندک در امتیاز F1 فایل‌ها، نشان‌دهنده تغییری بنیادین در بازدهی است. اکنون یک مدل ۱.۶ میلیارد پارامتری در مکان‌یابی دقیق آسیب‌پذیری‌ها، غولی با ۷۵۳ میلیارد پارامتر را شکست داده است. این پیشرفت از طریق Antares حاصل شده است؛ خانواده‌ای از مدل‌های زبانی کوچک (SLM) که توسط Cisco Foundation AI برای پیوند دادن دانش خارجی آسیب‌پذیری‌ها به مخازن کد داخلی طراحی شده‌اند. طبق گزارش فنی منتشر شده در وب‌سایت marktechpost.com، مدل Antares-1B توانست در این وظیفه تخصصی، مدل ۷۵۳ میلیارد پارامتری GLM-5.2 را با موفقیت پشت سر بگذارد.

فرآیند تریاژ امنیتی به‌طور سنتی یک عملیات دستی و پرهزینه است. چالش اصلی در اینجا، متصل کردن دانش خارجی — که در پایگاه‌های داده عمومی، توصیه‌ها (Advisories) و طبقه‌بندی‌های Common Weakness Enumerations (CWEs) یافت می‌شود — به کدهای منبع داخلی است. این کدها معمولاً در مخازنی قرار دارند که بسیار حجیم، ماژولار و دارای وابستگی‌های غنی و پیچیده‌ای هستند.

توسعه‌دهندگان مجبورند در کدهایی ناآشنا جست‌وجو کنند، قراردادهای نام‌گذاری را تحلیل نمایند و مسیرهای فراخوانی (Call Paths) را بررسی کنند تا متوجه شوند یک نقطه ضعف (CWE) دقیقاً در کجا ظاهر شده است. رویکرد سیسکو این است که اولین گام تریاژ، جایی است که بیشترین هزینه‌ها در آن متمرکز شده است. با این حال، Antares قرار نیست جایگزین کل زنجیره ابزارهای امنیت اپلیکیشن شود. سیسکو صراحتاً اعلام کرده است که تیم‌ها همچنان به اسکن وابستگی‌ها، بررسی Secrets، تست‌های پویا، بررسی کانتینرها، مدل‌سازی تهدیدات و بررسی‌های متخصصی نیاز دارند.

در حالی که صنعت بر تحلیل ایستا تکیه دارد، داده‌های سیسکو نشان می‌دهد ابزارهای فعلی فاقد بستر تطبیقی (Adaptive Context) لازم برای مکان‌یابی پیچیده هستند. برای مثال، ابزار Semgrep امتیاز ۰.۰۸۶ در File F1 در بنچمارک جدید کسب کرد، در حالی که CodeQL امتیاز ۰.۰۲۳ و Horusec امتیاز ۰.۰۲۰ را به دست آوردند. این نتایج نشان می‌دهد که این ابزارهای سنتی در برابر استدلال تطبیقی مدل‌های زبانی کوچک (SLM) شکست خورده‌اند.

معماری Antares بر پایه سه ترنسفورمر (Transformer) فقط-رمزگشا بنا شده که از نقاط بازرسی IBM Granite 4.0 آغاز شده‌اند. این مدل‌ها دارای یک توکنایزر مشترک هستند و معماری آن‌ها ویژگی‌هایی چون توجه پرس‌وجوی گروهی (Grouped-query attention)، لایه‌های SwiGLU MLP، نرمال‌سازی RMSNorm، رمزگذاری موقعیتی (RoPE) و جاسازی‌های (Embeddings) مشترک برای ورودی و خروجی را شامل می‌شود:

  • Antares-350M: ۳۵۰ میلیون پارامتر؛ پنجره زمینه ۳۲ هزار توکن؛ ۲۸ لایه / ۱۰۲۴ واحد پنهان / ۴ سر KV؛ وزن‌های باز (Apache 2.0).
  • Antares-1B: ۱.۶ میلیارد پارامتر؛ پنجره زمینه ۱۲۸ هزار توکن؛ ۴۰ لایه / ۲۰۴۸ واحد پنهان / ۴ سر KV؛ وزن‌های باز (Apache 2.0).
  • Antares-3B: ۳ میلیارد پارامتر؛ پنجره زمینه ۱۲۸ هزار توکن؛ بر پایه Granite 4.0 Micro؛ هنوز منتشر نشده است.

مدل Antares برخلاف مدل‌های متوالی استاندارد، در یک حلقه عامل‌محور (Agentic) محدود با استفاده از سه ابزار عمل می‌کند. مدل تنها توصیف دسته CWE را دریافت می‌کند و هیچ متن توصیه‌ای، راهنمایی درباره فایل‌ها یا جزئیات مربوط به شدت آسیب‌پذیری را دریافت نمی‌کند. این مدل دستورات ترمینالی فقط-خواندنی را در یک محیط ایزوله‌ی Docker که دسترسی شبکه در آن غیرفعال است، اجرا می‌کند. خروجی دستورات پیش از ورود به متن گفتگو (Transcript) تا ۲,۰۰۰ کاراکتر کوتاه می‌شود. مدل در هر تسک محدود به ۱۵ فراخوانی ترمینال است. برای پایان کار، مدل باید تابع submit_vulnerable_files را با یک لیست رتبه‌بندی شده یا تابع submit_no_vulnerability_found را فراخوانی کند. این ارسال نهایی جزو بودجه ۱۵ تایی فراخوانی‌ها محاسبه نمی‌شود. خروجی نهایی شامل یک لیست رتبه‌بندی شده از مسیر فایل‌ها و ردپای اکتشاف (Exploration Trace) است.

برای ارزیابی این عملکرد، سیسکو بنچمارک Vulnerability Localization Benchmark (VLoc Bench) را منتشر کرد؛ یک ارزیابی عامل‌محور با ۵۰۰ تسک تحت لایسنس Apache 2.0. این بنچمارک تسک‌های خود را از ۲۹۰ مخزن واقعی و منحصر‌به‌فرد در ۶ اکوسیستم مختلف شامل npm، pip، Maven، Go، Rust و Composer استخراج کرده است.

این محک ۱۴۷ دسته منحصر‌به‌فرد از CWE را پوشش می‌دهد و ۷۸٪ از ورودی‌های آن دارای شناسه‌های CVE تخصیص‌یافته هستند. حقیقت زمینی (Ground Truth) از روی وصله‌های امنیتی استخراج شده است؛ فایل‌هایی که در اصلاحیه تغییر کرده‌اند به عنوان برچسب (Label) در نظر گرفته شده‌اند، در حالی که تست‌ها، مستندات و تنظیمات حذف شده‌اند. ارزیابی در دو فاز انجام می‌شود:

  • فاز A: مدل یک کپی (Snapshot) آسیب‌پذیر را دریافت کرده و بر اساس File F1 امتیاز می‌گیرد.
  • فاز B: مدل کپی اصلاح‌شده (Patched) را دریافت می‌کند تا نرخ منفی واقعی (True Negative Rate) اندازه‌گیری شود و هشدارهای کاذب روی کدهای اصلاح‌شده سنجیده شود.

نتایج نشان می‌دهد که ما با یک «پرتگاه توانمندی» روبرو هستیم، نه یک منحنی مقیاس‌پذیری ساده. نقاط بازرسی خام Granite 4.0 تقریباً امتیاز صفر در File F1 کسب کردند (به ترتیب ۰.۰۰۱، ۰.۰۰۰ و ۰.۰۰۰ برای سه اندازه). اگرچه آن‌ها توانایی فراخوانی ابزار را داشتند، اما در حلقه عامل‌محور خروجی‌های تخریبی و بی‌معنی تولید می‌کردند. بخش اصلی توانmندی از طریق تنظیم نظارت‌شده (SFT) به دست آمد که امتیازات را به ترتیب به ۰.۱۰۸، ۰.۱۸۸ و ۰.۱۹۸ رساند. مجموعه داده SFT از ترکیب‌های زیر ساخته شده بود:

  • ۷۱.۵٪ استدلال امنیت سایبری
  • ۱۵.۴٪ مسیرهای جست‌وجوی کد
  • ۱۳.۱٪ پژوهش‌های عمیق و استدلال عمومی

تمام این ردپاها (Traces) از یک مدل معلم واحد یعنی GPT-OSS-120B تولید شدند تا از جابه‌جایی توزیع داده‌ها بین معلمان مختلف جلوگیری شود. به‌کارگیری روش بهینه‌سازی سیاست نسبی گروهی (GRPO) عملکرد مدل‌ها را ۱۱٪ تا ۲۵٪ بهبود بخشید، که بیشترین سود نسبی در مدل ۳۵۰ میلیون پارامتری دیده شد. پاداش‌ها به‌صورت برنامه‌نویسی شده از متن مسیرها محاسبه شدند (بدون استفاده از مدل پاداش یادگیری‌شده) و کیفیت مکان‌یابی، رعایت قوانین استفاده از ابزار و کیفیت اکتشاف را پوشش دادند.

روش GRPO همچنین انحراف معیار بین اجراها را ۴۲٪ تا ۶۵٪ کاهش داد و باعث شد یک اجرای ارزیابی واحد، قابل‌اعتمادتر از یک اجرای SFT تک‌گانه باشد. این امر منجر به یک تفکیک استراتژیک وابسته به مقیاس شد: مدل‌های ۳۵۰ میلیون و ۱ میلیارد پارامتری از ۸۷-۸۹٪ دستورات جست‌وجو استفاده کرده و فایل‌های بیشتری را ارسال کردند، در حالی که مدل ۳ میلیارد پارامتری ۵۲٪ از دستورات جست‌وجو و ۳۷٪ از دستورات خواندن را به کار برد و فایل‌های کمتری را با دقت (Precision) بالاتر ارسال کرد.

در نهایت، تخصصی کردن آموزش بر مقیاس پارامترها غلبه کرد. مدل Antares-3B با امتیاز ۰.۲۲۳ به GPT-5.5 (۰.۲۲۹) نزدیک شد. در این میان، رقابت میان مدل‌های پیشرفته امنیتی شدت یافته است و برای مثال مدل GPT-5.5-Cyber نیز در محک‌های مشابه توانمندی‌های خود را در برابر رقبایی چون آنتروپیک به رخ کشیده است. Antares-1B با امتیاز ۰.۲۰۹، مدل GLM-5.2 (۷۵۳ میلیارد پارامتر) با امتیاز ۰.۱۸۶ و همچنین Gemini 3 Pro را شکست داد. مدل Antares-350M با امتیاز ۰.۱۳۵ توانست بر Gemma-4-31B (۰.│۰۱) و Gemini 2.5 Flash (۰.۱۰۲) پیروز شود. نکته قابل توجه این است که Antares-1B بالاترین نرخ فراخوانی (Recall) را در بین تمام سیستم‌های ارزیابی شده با مقدار ۰.۲۲۴ ثبت کرد.

این تغییر باعث شده مکان‌یابی با دقت بالا از نظر اقتصادی توجیه‌پذیر شود. هزینه اجرای کامل ۵۰۰ تسک در Antares روی یک GPU H100 کمتر از ۱ دلار است، در حالی که این هزینه برای GLM-5.2 معادل ۱۲.۵ دلار و برای GPT-5.5 حدود ۱۴۱ دلار است.

کاربران اکنون می‌توانند به نسخه‌های وزن‌باز در Hugging Face دسترسی داشته باشند. نقاط مورد علاقه بعدی، انتشار نسخه Antares-3B و انتشار داده‌های مربوط به هشدارهای کاذب فاز B خواهد بود.

گام بعدی شما

  • اگر توسعه‌دهنده یا متخصص امنیت هستید، نسخه‌های وزن‌باز Antares را در Hugging Face بررسی کنید تا سرعت تریاژ کدهای خود را بسنجید.
  • منتظر انتشار نسخه Antares-3B و داده‌های مربوط به هشدارهای کاذب (فاز B) باشید تا درک بهتری از دقت واقعی مدل به دست آورید.
  • استراتژی GRPO را برای کاهش واریانس در مدل‌های کوچک خود پیاده‌سازی کنید.

اما تأثیر این مدل‌ها بر کاهش هزینه‌های عملیاتی مراکز داده حتی خیره‌کننده‌تر است — به تحلیل ما درباره بهینه‌سازی هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این موفقیت با تکیه بر اعتبار داده‌های تخصصی و معماری عامل‌محور، هزینه مکان‌یابی آسیب‌پذیری‌ها را تا بیش از ۱۴۰ برابر کاهش می‌دهد. این تغییر باعث می‌شود تحلیل امنیتی از یک فرآیند گران‌قیمت و کند به یک عملیات آنی و اقتصادی تبدیل شود.

تأثیر برای ایران

به دلیل وزن‌های باز (Apache 2.0)، توسعه‌دهندگان ایرانی می‌توانند این مدل‌ها را به‌صورت محلی و بدون نیاز به APIهای گران‌قیمت یا تحریم‌شده، روی سخت‌افزارهای موجود مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد ثابت می‌کند که در کاربردهای هایپرسپشالایزد (Hyper-specialized)، مقیاس پارامترها دیگر تنها معیار موفقیت نیستند. انتقال تمرکز از مدل‌های عمومی غول‌پیکر به مدل‌های کوچکِ آموزش‌دیده با داده‌های سنتتیکِ باکیفیت (مانند خروجی‌های GPT-OSS-120B)، پارادایم استقرار هوش مصنوعی در محیط‌های حساس امنیتی را به سمت مدل‌های محلی و ارزان‌قیمت می‌برد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.