پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های وزن‌باز در ۴ تا ۷ ماه به سطح توانمندی‌های سایبری مدل‌های پیشرو رسیدند

·۲۷ تیر ۱۴۰۵۴ دقیقه مطالعه
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش چشم‌بگیر فاصله زمانی (از ۱۰ ماه به ۴-۷ ماه) بین مدل‌های باز و بسته در حوزه سایبری، در حالی که هزینه استنتاج در برخی مدل‌ها تا ۹۹٪ سقوط کرده است.

اگر یک مدیر امنیت شبکه هستید، باید بدانید که ابزارهای رایگان و باز، اکنون تقریباً هم‌تراز با گران‌ترین سیستم‌های بسته در اجرای حملات پیشرفته هستند. مدل‌های وزن‌باز اکنون توانمندی‌های سایبری سیستم‌های تجاری برتر را که تنها چهار تا هفت ماه پیش عرضه شده بودند، به دست آورده‌اند. طبق گزارش مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) که در ۱۸ جولای ۲۰۲۶ منتشر شد، این شکاف زمانی در مقایسه با تأخیری بین ۶ تا ۱۰ ماه که در بیشتر سال ۲۰۲۵ مشاهده می‌شد، به سرعت در حال کاهش است.

این تغییر موجودیتی متناقض و تنش‌زایی را در صنعت ایجاد کرده است. در حالی که مدل‌های بسته محیط‌های کنترل‌شده‌ای را ارائه می‌دهند، مدل‌های وزن‌باز به کاربران اجازه می‌دهند هوش مصنوعی را به‌صورت خصوصی میزبانی کرده و بدون اینکه داده‌ها به تامین‌کننده بازگردد، آن‌ها را شخصی‌سازی کنند. در این حالت، کاربران می‌توانند بر روی بنیادی تکیه کنند که ارائه‌دهندگان نمی‌توانند به‌طور ناگهانی آن را تغییر داده یا متوقف کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، این استقلال بهایی دارد: ریسک سوءاستفاده‌ای که «پایدار و بازگشت‌ناپذیر» است. چون وزن‌های مدل قابل دانلود هستند و می‌توانند روی سیستم‌های خصوصی، خارج از کنترل هر نهادی اجرا شوند، کاربران می‌توانند به‌سادگی حفاظ‌ها (Guardrails) — یا همان نرده‌های ایمنی که مانع از تولید پاسخ‌های مخرب می‌شوند — را حذف کرده و نسخه‌های تغییریافته را آزادانه به اشتراک بگذارند.

به نقل از مستندات AISI، برای اندازه‌گیری این همگرایی عملکرد از دو متدولوژی متمایز استفاده شده است:

تکالیف سایبری محدود

این محک ۷۰ تکلیف را در چهار سطح دشواری، از کارهای غیرفنی تا چالش‌های سطح خبره، بررسی می‌کند. این بخش به‌طور خاص حوزه‌های پژوهش آسیب‌پذیری، مهندسی معکوس، اکسپلویت‌های وب (Web Exploitation) و رمزنگاری را پوشش می‌دهد.

  • مدل GLM-5.2 (منتشر شده در ژوئن ۲۰۲۶) با عملکرد مدل Opus 4.6 در فوریه ۲۰۲۶ برابر شد و تنها ۴ ماه فاصله داشت.
  • مدل DeepSeek V4-Pro در سطح عملکرد Opus 4.5 قرار گرفت که در نوامبر ۲۰۲۵ عرضه شده بود.

مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر

محیط‌های شبیه‌سازی‌شده (Cyber Ranges)

در این روش، توانمندی‌های خودمختار مدل در شبکه‌های شبیه‌سازی‌شده از طریق سناریویی به نام "The Last Ones" آزمایش شد. این یک شبیه‌سازی حمله به شبکه شرکتی در ۳۲ مرحله است که شامل چهار زیرشبکه و تقریباً ۲۰ میزبان (Host) می‌شود. AISI تخمین می‌زند که یک متخصص انسانی برای تکمیل این مسیر به Roughly ۲۰ ساعت زمان نیاز داشته باشد.

  • GLM-5.2 به سطحی مشابه Opus 4.5 رسید.
  • DeepSeek V4-Pro عملکردی پایین‌تر از Sonnet 4.5 داشت.
  • مدل‌های تجاری GPT-5.6-Sol (بهترین عملکرد) و Claude Mythos 5 همچنان پیشتازند و تقریباً کل شبیه‌سازی را به پایان رساندند.
  • در این سناریوی پیچیده، مدل‌های باز حدود ۷ ماه از لبه تکنولوژی عقب‌تر هستند.

مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر

بر اساس بررسی‌های AISI، نتایج محیط‌های شبیه‌سازی‌شده به عنوان شواهد ضعیف‌تری تلقی می‌شوند زیرا سناریوهای تست کمتری را شامل می‌شوند. این دیدگاه در راستای پژوهش‌های پیشین این مؤسسه است که در آن اشاره شد بودجه‌های توکن در برخی محک‌ها ممکن است توانایی واقعی عوامل هوش مصنوعی را پنهان کند. علاوه بر این، این تست‌ها نمی‌توانند تعیین کنند که آیا شکست مدل به دلیل فقدان توانمندی‌های سایبری است یا ناتوانی در حفظ برنامه‌ریزی در یک حمله طولانی و پیچیده. AISI همچنین اشاره می‌کند که نتایج ممکن است توانایی مدل‌های باز را کمی کمتر از حد واقعی تخمین زده باشند، زیرا این مدل‌ها به‌طور خاص برای ارزیابی‌ها تنظیم (Tune) نشده بودند و شبیه‌سازی فاقد مدافعان فعال در دنیای واقعی است.

فراتر از عملکرد، شکاف اقتصادی خیره‌کننده است. هزینه یک تست ۱۰۰ میلیون توکن (Token) در محیط Cyber Range با استفاده از مدل‌های Opus 4.5/4.6 حدود ۸۵ دلار بود، در حالی که برای GLM-5.2 مبلغ ۴۶ دلار و برای DeepSeek V4-Pro تنها ۱.۱۹ دلار هزینه داشت.

برای تکالیف منفرد که هر دو مدل به‌طور قابل‌اطمینانی آن‌ها را حل کردند، تفاوت قیمت تکان‌دهنده‌تر است:

  • مدل Opus 4.6: ۱۵ دلار برای هر تکلیف
  • مدل Opus 4.5: ۱۲.۵۰ دلار
  • مدل GLM-5.2: ۶ دلار
  • مدل DeepSeek V4-Pro: ۲۸ سنت

طبق گزارش AISI، سیستم‌های ایمنی در مدل‌های باز تقریباً ناکارآمد بودند. برای مثال، AISI دریافت که پاسخ‌های منفی DeepSeek V4-Pro برای تکالیف مهندسی معکوس، تنها با تلاش مجدد برای ارسال پرامپت (Prompt) دور زده می‌شوند. از آنجا که حفاظ‌هایی مانند نظارت، طبقه‌بندی‌کننده‌ها (Classifiers) و محدودیت‌های کاربر به کنترل دسترسی به مدل وابسته هستند، در مدل‌های وزن‌باز عملاً به‌طور قابل‌اطمینانی قابل اجرا نیستند.

این آسیب‌پذیری مختص مدل‌های باز نیست؛ یک مطالعه مجزا اخیراً نشان داد گروه‌های تروریستی حتی چت‌بات‌های تجاری را برای برنامه‌ریزی حملات جیل‌بریک (Jailbreak) می‌کنند. اما دسترسی آزاد به وزن‌های مدل، یک لایه ریسک دائمی و همیشگی اضافه می‌کند.

این شتاب، پنجره زمانی مدافعان سایبری را برای آماده‌سازی می‌بندد. در آوریل ۲۰۲۶، انتشار Mythos Preview و GPT-5.5 برخی از بزرگ‌ترین جهش‌ها در توانمندی‌های سایبری AI را از زمان شروع تست‌های AISI نشان داد. این موضوع باعث شد مرکز ملی امنیت سایبری بریتانیا هشدارهای بین‌المللی صادر کند که چشم‌انداز تهدیدات به سرعت در حال تغییر است.

برای کسب‌وکارها، این یعنی هزینه استقرار ابزارهای سایبری مبتنی بر AI سقوط می‌کند، اما ریسک حملات غیرمجاز و در مقیاس بالا افزایش می‌یابد. توانایی اجرای این مدل‌ها روی سخت‌افزارهای خصوصی، «کلید قطع اضطراری» (Kill Switch) را که شرکت‌های تجاری معمولاً در اختیار داشتند، از بین می‌برد.

AISI قصد دارد چشم‌انداز را با آزمایش مدل Kimi-K3 که انتظار می‌رود وزن‌های آن در اواخر جولای ۲۰۲۶ منتشر شود، بیشتر ارزیابی کند. بنچمارک‌های اولیه کدنویسی نشان می‌دهند که این مدل احتمالاً شکاف توانمندی‌ها را باز هم کمتر می‌کند، هرچند احتمالاً هزینه آن بیشتر از سایر جایگزین‌های باز باشد.

گام بعدی شما

  • اگر از مدل‌های وزن‌باز برای کارهای حساس استفاده می‌کنید، فرض کنید حفاظ‌های داخلی آن‌ها کار نمی‌کند و لایه‌های امنیتی خارجی را پیاده کنید.
  • هزینه‌های استنتاج را با DeepSeek V4-Pro مقایسه کنید تا بهینه‌ترین مسیر برای اتوماسیون تکالیف فنی را بیابید.
  • گزارش کامل AISI را برای شناسایی نقاط ضعف مدل‌های باز در برنامه‌ریزی بلندمدت مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با استناد به داده‌های AISI، نشان می‌دهد که مدل‌های باز اکنون تهدیدی واقعی برای زیرساخت‌های امنیتی هستند. اعتبار این یافته‌ها از آن جهت است که بر اساس تست‌های عملی در محیط‌های شبیه‌سازی‌شده (Cyber Ranges) به دست آمده است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت API مدل‌های تجاری، توسعه‌دهندگان ایرانی بیشتر به مدل‌های وزن‌باز متکی هستند؛ لذا کاهش هزینه‌ها و افزایش توانایی این مدل‌ها فرصتی برای ارتقای ابزارهای داخلی است، هرچند ریسک‌های امنیتی آن‌ها را افزایش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

دسترسی ارزان‌قیمت به توانمندی‌های سطح پیشرو، مدل‌های زبانی را از «دستیار» به «سلاح» تبدیل می‌کند. وقتی هزینه هر تکلیف فنی از ۱۵ دلار به ۲۸ سنت می‌رسد، اقتصاد حملات سایبری به‌طور کامل تغییر می‌کند و مهاجمان می‌توانند حملات پیچیده را در مقیاس میلیونی اجرا کنند. این وضعیت، برتریِ مدل‌های تجاری را از «توان پردازشی» به «کنترل دسترسی» منتقل کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.