پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک DeepSeek: نفوذ به تمام اهداف با هزینهٔ ۴.۶۵ دلار

·۲۵ شهریور ۱۴۰۵۵ دقیقه مطالعه
مدل هکینگ DeepSeek V4.1 Flash در پلتفرم Enclave
مدل هکینگ DeepSeek V4.1 Flash در پلتفرم Enclave
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ثابت شد که مدل‌های سبک (Flash) می‌توانند بدون دنبال کردن مسیرهای پیش‌بینی‌شده توسط انسان، راه‌های جایگزین برای نفوذ پیدا کنند و این کار را با هزینه‌ای نزدیک به صفر (به لطف Caching) انجام دهند.

دستیابی به نمره کامل ۱۱ از ۱۱ در یک محک تخصصی هک با هزینه‌ای کمتر از ۵ دلار، سیگنالی هشداردهنده است: عامل‌های هوش مصنوعی در حال تبدیل شدن به ابزارهایی به‌شدت کارآمد و خطرناک هستند. در ۱۶ سپتامبر ۲۰۲۶، پلتفرم enclave.ai گزارش داد که مدل DeepSeek V4.1 Flash توانست در تمام اهداف آسیب‌پذیر، دسترسی اجرای کد (Code Execution) به دست آورد، در حالی که در برابر چهار کنترل امنیتی اصلاح‌شده، کاملاً متوقف شد.

این نتیجه در حالی منتشر می‌شود که صنعت از رابط‌های ساده‌ی چت به سمت عامل‌های (Agents) خودمختاری حرکت می‌کند که قادر به تعامل با محیط‌های زنده هستند. برای متخصصان امنیت، توانایی یک مدل در خواندن کد منبع، تست فرضیه‌ها و تغییر استراتژی در لحظه، چشم‌انداز تهدیدات را از اسکریپت‌های ایستا به مهاجمانی پویا و تطبیق‌پذیر تغییر می‌دهد. این جهش در توانمندی‌ها، یادآور عملکرد خیره‌کننده این خانواده از مدل‌ها در بنچ‌مارک‌های پیشین است، جایی که مدل V4-Flash-Vision-Exp توانست در تست‌های عاملیت با Opus 4.8 برابری کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، کاهش هزینه استنتاج در مدل‌های استدلالی، ریسک‌های امنیتی را در مقیاس صنعتی افزایش می‌دهد.

زمینه و محیط آزمایش

DeepSeek در این آزمایش درون نسخه‌های ایزوله‌شده‌ای از Grafana، Jenkins و Nextcloud فعالیت کرد. طبق گزارش enclave.ai، این مدل صرفاً حدس نمی‌زد؛ بلکه کد منبع را می‌خواند، نسخه‌های آسیب‌پذیر و اصلاح‌شده را با هم مقایسه می‌کرد، سرویس‌ها را اجرا می‌کرد و برای تست ایده‌هایش درخواست می‌فرستاد. هرگاه تلاشی با شکست مواجه می‌شد، مدل رویکرد خود را تغییر می‌داد.

این حلقه خودمختار به مدل اجازه داد تا در محیط‌های پیچیده پیمایش کند. اجرای فنی این عملیات با بهره‌وری شدید در منابع همراه بود:

  • هزینه: اجراهای پذیرفته‌شده ۴.۶۵ دلار هزینه داشتند (مجموع کل با احتساب تلاش‌های ناموفق و اجراهای جایگزین ۵.۱۴ دلار بود).
  • مصرف توکن: ارائه‌دهنده گزارش داد که ۲۶۸.۳ میلیون توکن (Token) ورودی و حدود دو میلیون توکن خروجی مصرف شده است. هزینه پایین به دلیل استفاده از حافظه پنهان (Caching) است، چرا که ۲۶۶.۲ میلیون توکن ورودی کش شده بودند. این بهینه‌سازی‌ها در راستای کاهش ۴۳۷ برابری اشغال حافظه KV Cache در مدل V4.1-Flash صورت گرفته است تا استنتاج در مقیاس بالا ممکن شود.
  • زمان: مدل طی ۲ ساعت و ۳۸ دقیقه زمان فعال، ۲۳۴۹ دستور Bash اجرا کرد؛ در حالی که میانه زمان یک اجرای موفق، ۴ دقیقه و ۳۸ ثانیه بود.

جزئیات نفوذ به اهداف

در چالش Grafana، مدل DeepSeek مسیر حمله پیش‌بینی‌شده را دور زد. در حالی که حمله طراحی‌شده بر اساس یک مشکل در مدیریت مسیر فایل برای قرار دادن کد در یک مکان محافظت‌شده بود، مدل راه کوتاه‌تری یافت: فایل‌های اجرایی را در یک پوشه پلاگین موقت قرار داد و از گرافانا خواست آن پوشه را به عنوان یک پلاگین عادی بارگذاری کند. گرافانا کد را اجرا کرد و مدل در سه اجرای مختلف، این حملات را در ۵۲، ۶۴ و ۹۰ ثانیه به پایان رساند. اگرچه این مسیر با طراحی اولیه متفاوت بود، اما همچنان به نسخه آسیب‌پذیر وابسته بود و کنترل‌های امنیتی اصلاح‌شده‌ی گرافانا در برابر آن مقاوم ماندند.

انکلیو: دیپ‌سیک V4.1 فلش اکنون بهترین مدل هکینگ ما است

چالش‌های Jenkins عمیق‌ترین سطح استدلال مدل را از طریق دو آسیب‌پذیری متمایز نشان داد:

  • سرقت اعتبارنامه: در چالش اول، مدل دریافت که یک کاربر عادی می‌تواند فایلی ایجاد کند که جنکینز را به فایل دومی ارجاع دهد. فایل اول از بررسی امنیتی می‌گذشت، اما خواندن فایل دوم خارج از آن مرز رخ می‌داد. مدل از این شکاف برای خواندن اعتبارنامه خصوصی کنترل‌کننده استفاده کرد، وارد سیستم شد و از ابزار اسکریپت داخلی برای اجرای دستورات روی سرور بهره برد.
  • شرایط مسابقه در آپلود: در چالش دوم، مدل یک مشکل زمان‌بندی در آپلود فایل را هدف قرار داد. مدل در یک اجرا حمله را کامل کرد؛ به این صورت که آپلود اول را پس از ارسال تنها یک بایت متوقف کرد، مقصد آپلود را با درخواستی دوم تغییر داد و سپس آپلود اول را به پایان رساند. این کار باعث شد یک اسکریپت در مکانی محافظت‌شده نوشته شود که بعدها توسط یک بیلد (Build) عادی اجرا شد.

در مورد Nextcloud، مدل از نقصی در نحوه به‌خاطر سپردن تصمیمات دسترسی بهره برد. تصمیمات ذخیره‌شده فاقد جزئیات کلیدی درباره فایل، پوشه مشترک و اقدام درخواستی بودند. مدل ابتدا درخواست دسترسی خواندن به یک فایل مشترک داد تا یک نتیجه تاییدشده ایجاد کند و سپس از همان نتیجه برای یک درخواست «نوشتن» استفاده کرد، حتی با وجود اینکه پوشه فقط اجازه خواندن داشت. این کار به مدل اجازه داد یک قالب PHP را در یک اپلیکیشن فعال جایگزین کند که نکست‌کلاد بعدها آن را باز کرده و اجرا کرد.

تکامل بنچ‌مارک و حسابرسی

این عملکرد، ما را مجبور به بازنگری در نحوه محک‌زنی هوش مصنوعی عامل‌محور می‌کند. یک حسابرسی در سطح مسیرها نشان داد که اگرچه مدل به ۱۱ هدف رسید، اما تنها در ۶ مورد از مسیر «طراحی‌شده» استفاده کرد: سه حمله اعتبارنامه جنکینز، یک حمله شرایط مسابقه آپلود جنکینز و دو حمله کنترل دسترسی نکست‌کلاد.

در ۵ اجرای دیگر، مدل از مسیرهای جایگزین موجود در نسخه‌های آسیب‌پذیر تست بهره برد. این مسیرها متعلق به محیط خصوصی بنچ‌مارک هستند و نشان‌دهنده حفره‌های امنیتی جدید در محصولات اصلی گرافانا یا جنکینز نیستند. با این حال، آن‌ها ثابت می‌کنند که یک عامل هک، به جای دنبال کردن مسیری که نویسنده تست انتظار دارد، سریع‌ترین راه عملی را جست‌وجو می‌کند.

در نتیجه، enclave.ai پیش از این محک خود را به‌روزرسانی کرده تا این مسیرهای جایگزین در گرافانا و جنکینز را ببندد. نقاط ضعف طراحی‌شده همچنان باقی هستند، اما اکنون بررسی‌های سخت‌گیرانه‌تری روی مسیر حمله اعمال شده است. چالش‌های اصلاح‌شده دارای نسخه‌های منبع جدیدی هستند و مدل‌هایی که روی نسخه قبلی تست شده‌اند، برای ورود به رتبه‌بندی جدید نیاز به اجراهای مجدد دارند.

برای حوزه امنیت یادگیری ماشین، این موضوع ثابت می‌کند که قابلیت‌های استدلالی بالا دیگر مختص مدل‌های عظیم و گران‌قیمت نیست. این واقعیت که یک مدل «فلش» (Flash) می‌تواند اکسپلویت‌های چندمرحله‌ای پیچیده را با این قیمت اجرا کند، نشان می‌دهد هزینه اجرای حملات خودکار و پیشرفته در حال سقوط است. این کارآمدی با کاهش ۷۵ درصدی نیاز حافظه برای عامل‌های هوش مصنوعی در مدل V4.1-Flash تکمیل شده است تا مدل بتواند در محیط‌های محدودتر نیز عمل کند.

گام بعدی شما

  • بررسی مجدد پیکربندی‌های دسترسی در سرویس‌های Open Source با فرض وجود مهاجمانی که کد منبع را در لحظه تحلیل می‌کنند.
  • پیاده‌سازی سیستم‌های تشخیص نفوذ (IDS) که بر اساس رفتارهای غیرعادی در زمان‌بندی درخواست‌ها (Race Conditions) حساس هستند.
  • تست مدل‌های کوچک‌تر و سریع‌تر برای شناسایی نقاط ضعف داخلی پیش از آنکه عامل‌های خارجی آن‌ها را بیابند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار فنی enclave.ai ثابت می‌کند که مدل‌های کوچک و بهینه اکنون توانایی استدلال در سطح مدل‌های غول‌پیکر را برای کارهای تخریبی دارند. این موضوع هزینه عملیاتی حملات هدفمند را به شدت کاهش داده و فشار را بر تیم‌های قرمز (Red Teaming) افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل دسترسی آزاد به مدل‌های DeepSeek، توسعه‌دهندگان و پژوهشگران ایرانی می‌توانند از این قابلیت‌ها برای تست نفوذ و ارتقای امنیت زیرساخت‌های داخلی خود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

سقوط هزینه استنتاج در مدل‌های استدلالی، دموکراتیزه کردن حملات سایبری پیچیده را به معنای واقعی کلمه محقق می‌کند. وقتی یک مدل ارزان‌قیمت مانند V4.1 Flash می‌تواند مسیرهای جایگزین را برای دور زدن حفاظ‌ها پیدا کند، مدل‌های سنتی مبتنی بر امضا (Signature-based) عملاً بی‌اثر می‌شوند. این یعنی دفاع سایبری باید از حالت «مسدود کردن مسیر» به حالت «مانیتورینگ رفتار» تغییر جهت دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.