پرش به محتوای اصلی
پرش به محتوای مقاله

«اتوماسیون Red-Teaming»؛ راهکار جدید OpenAI برای شناسایی حفره‌های امنیتی

·۲۴ تیر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
هکر هوش مصنوعی GPT-Red شرکت OpenAI برای افزایش امنیت مدل‌ها ساخته شد.
هکر هوش مصنوعی GPT-Red شرکت OpenAI برای افزایش امنیت مدل‌ها ساخته شد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی تست‌های دستی تیم قرمز با یک حلقه «بازی با خود» (Self-play) برای کشف خودکار بردارهای حمله. این اولین بار است که یک مدل زبانی به‌طور سیستماتیک برای تخریب مدل دیگر آموزش دیده تا نرخ موفقیت حملات را در نسخه جدید به زیر ۲۳٪ برساند.

تصور کنید یک «ابر-هکر» دیجیتال داشته باشید که تنها هدفش پیدا کردن نقاط ضعف در معماری خودش است؛ این دقیقاً همان کاری است که GPT-Red انجام می‌دهد. این ابزار با عمل کردن به عنوان یک شریک تمرینی داخلی، آسیب‌پذیری‌های بحرانی را پیش از آنکه بازیگران بدخواه بتوانند از آن‌ها سوءاستفاده کنند، شناسایی می‌کند. اگر امروز یک محصول هوش مصنوعی را روانه بازار می‌کنید، باید بدانید که دیگر تکیه بر تست‌های انسانی کافی نیست و شما با ارتش‌های خودکارِ مهاجم روبرو هستید.

بر اساس مستندات OpenAI، این سامانه به‌تازگی در توسعه GPT-5.6 به‌کار گرفته شد. GPT-5.6 آخرین نسخه از مدل پرچم‌دار این شرکت و مقاوم‌ترین نسخه‌ای است که تا به امروز منتشر شده است. این پیشرفت در امنیت مدل‌ها، تداوم مسیر OpenAI در بهینه‌سازی دفاعی است که پیش از این نیز در پیروزی مدل GPT-5.5-Cyber در رقابت امنیتی با رقیبش آنتروپیک مشاهده شد.

ربات هکر GPT-Red شرکت OpenAI برای افزایش امنیت مدل‌های هوش مصنوعی ساخته شده است.

زمینه و بستر تیم قرمز در هوش مصنوعی

تست‌های ایمنی در هوش مصنوعی معمولاً بر عهده «تیم قرمز» (Red Teaming) است؛ یعنی گروهی از متخصصان انسانی که به‌صورت دستی به دنبال راه‌هایی برای ربودن یا دور زدن سیستم می‌گردند. هدف این است که تا حد ممکن روش‌های مختلف برای شکست دادن یا تسخیر سیستم شناسایی شود تا نقاط ضعف پیش از انتشار نهایی نرم‌افزار وصله و اصلاح گردند.

اما با تکامل مدل‌های زبانی بزرگ (LLM) و تبدیل آن‌ها به «عامل‌های خودکار» (Autonomous Agents) که می‌توانند با فایل‌های کامپیوتری، وب‌سایت‌ها، کدهای شخص ثالث و سایر عامل‌ها تعامل داشته باشند — قابلیت‌هایی که ما در پوشش خبری خود درباره مرکز فرماندهی OpenAI x Work Louder بررسی کردیم — «شعاع انفجار» (Blast Radius) یک حمله هکری بیش از آن است که انسان‌ها به‌تنهایی بتوانند آن را مدیریت کنند. نیکیل کاندپال، دانشمند پژوهشی OpenAI و یکی از خالقان GPT-Red، اشاره می‌کند که با گسترش سطح ریسک، شعاع انفجار نیز به‌طور متناظر رشد می‌کند.

طبق گزارشی که MIT Technology Review در ۱۵ ژوئیه ۲۰۲۶ منتشر کرد، OpenAI برای آینده‌نگری در فرآیندهای ایمنی خود، GPT-Red را ایجاد کرد. دیلان هان، یکی دیگر از سازندگان این سیستم، توضیح می‌دهد که با طراحی سیستمی که بتواند همین حالا روش‌های جدید حمله را کشف کند، OpenAI برای رویارویی با مدل‌های توانمندتر در آینده آماده می‌شود. این مدل به‌طور تخصصی روی «تزریق پرامپت» (Prompt Injection) تمرکز دارد؛ جایی که دستورات پنهان، هوش مصنوعی را فریب می‌دهند تا داده‌های محرمانه را لو دهد، پایگاه کدهای یک شرکت را تخریب کند یا خروجی‌های مضر و شرم‌آور تولید کند. این دستورات مخفی می‌توانند در هر متنی که مدل با آن مواجه می‌شود، از جمله کدهای برنامه‌نویسی یا وب‌سایت‌ها، جاسازی شده باشند.

دوجوی آموزشی

برای ایجاد این قابلیت، پژوهشگران از یک «حلقه بازی با خود» (Self-play loop) استفاده کردند. آن‌ها مدلی را که در ابتدا به‌عنوان هکر آموزش ندیده بود، در یک «دوجوی دیجیتال» در کنار چندین مدل دیگر قرار دادند. در این محیط رقابتی، هدف GPT-Red حمله کردن بود، در حالی که مدل‌های هدف بر دفاع متمرکز بودند. طی دورهای متعدد بازی، هر دو طرف (مهاجم و مدافع) پیشرفت کردند.

این دوجو به‌گونه‌ای طراحی شده بود تا سناریوهای استقرار در دنیای واقعی را شبیه‌ساز کند، از جمله:

  • وب‌گردی در اینترنت
  • خواندن اپلیکیشن‌های تقویم
  • دسترسی به ایمیل‌ها
  • ویرایش کدهای برنامه‌نویسی

وقتی GPT-Red یک حمله جدید را کشف می‌کرد، نسخه‌های متعددی از آن را بررسی می‌کرد تا کارآمدترین روش را برای سناریوهای خاص بیابد. هان خاطرنشان می‌کند که این مدل «بسیار سمج» است و در حفاری برای یافتن دقیق‌ترین و مؤثرترین روش‌های حمله، به‌مراتب بهتر از تیم‌های قرمز انسانی عمل می‌کند.

پیشرفت‌های فنی و بنچمارک‌ها

سرمایه فنی GPT-Red منجر به کشف روش‌های حمله‌ای شد که پیش از این برای پژوهشگران انسانی ناشناخته بود؛ برجسته‌ترین آن‌ها «زنجیره تفکر جعلی» (Fake Chain of Thought) است. در این حمله، مدل یک ورودی جعلی در دفترچه یادداشت استدلال داخلی مدل هدف — یعنی همان زنجیره تفکری که هوش مصنوعی نتایج جزئی را در آن ردیابی می‌کند — وارد می‌کند. این عمل، مدل هدف را فریب می‌دهد تا بر اساس اطلاعات جعلی عمل کند.

کریس چوکت-چو، دانشمند پژوهشی این تیم، آن را با این مثال توصیف می‌کند: شبیه این است که به کسی بگویید «۱+۱ می‌شود ۳» و ادعا کنید که این موضوع قبلاً تأیید شده است. مدل هدف به‌سادگی این فرض را می‌پذیرد و خروجی را ۳ اعلام می‌کند.

OpenAI کارایی این سیستم را از طریق چندین مقایسه رودررو آزمایش کرد:

  • پایه انسانی (Human Baseline): هنگام اجرای مجدد آزمایشی از سال ۲۰۲۵ برای یافتن نقاط ضعف در نسخه‌های اولیه GPT-5، مدل GPT-Red در یافتن حملات مؤثر موفق‌تر از تسترهای انسانی بود.
  • تست خارجی: این مدل با موفقیت Vendy (یک عامل فروش خودکار از Andon Labs) را هک کرد و آن را مجبور کرد سفارشات مشتریان را لغو کرده و قیمت کالاهای مورد فروش را تغییر دهد.
  • استواری مدل (Robustness): نتایج تفاوت شدیدی را در رفتار دفاعی نسخه‌ها نشان داد. بیش از ۹۰٪ از قوی‌ترین حملات GPT-Red روی GPT-5 (که در اوت ۲۰۲۵ منتشر شد) اثر داشت، اما کمتر از ۲۳٪ از این حملات روی GPT-5.6 جدید کارساز بودند.

محدودیت‌ها و نظارت انسانی

با وجود قدرت زیاد، این سیستم محدودیت‌هایی دارد. پژوهشگران اشاره می‌کنند که GPT-Red در گفتگوهای چندمرحله‌ای (Multi-turn) بین هکر و هدف دچار مشکل می‌شود و هنوز در استفاده از تصاویر برای انتقال متن در حملات تزریق پرامپت مهارت کافی ندارد. این‌ها حوزه‌هایی هستند که در آن‌ها تخصص انسانی همچنان ضروری است.

استراتژی فعلی یک رویکرد ترکیبی (Hybrid) است: انسان‌ها یک «بذر» یا الگوی اولیه حمله را پیدا می‌کنند و GPT-Red تمام تغییرات و نسخه‌های ممکن از آن را تولید می‌کند. جسیکا جی، تحلیلگر ارشد پژوهشی در مرکز امنیت و فناوری‌های نوظهور دانشگاه جورج‌تاون (CSET)، معتقد است این یک رویکرد نویدبخش است، هرچند تأکید می‌کند که برای تشخیص اینکه تست‌های دستی در کجا بیشترین نیاز را دارند، تخصص انسانی لازم است.

برای کاربران تجاری، این تغییر سیگنالی است مبنی بر اینکه «عصر عامل‌ها» نیازمند یک پارادایم امنیتی متفاوت است. شما دیگر نمی‌توانید به‌سادگی کلمات کلیدی را فیلتر کنید؛ بلکه برای دفاع در برابر هوش مصنوعی مهاجم، به هوش مصنوعی تقابلی نیاز دارید. این حرکت نشان می‌دهد که استواری مدل اکنون به‌جای بنچمارک‌های ایستا، با «نرخ بقا» در برابر هکرهای خودکار اندازه‌گیری می‌شود.

OpenAI قصد ندارد GPT-Red را برای عموم منتشر کند. پژوهشگران بیش از یک سال روی این مدل کار کرده‌اند و از منابع محاسباتی عظیمی بهره گرفته‌اند. چوکت-چو تأکید می‌کند که آموزش یک «ابر-مهاجم» با این روش، «کار ساده‌ای» نیست که توسط تقلیدکنندگان به‌راحتی تکرار شود.

اینکه آیا این «رقابت تسلیحاتی» می‌تواند با سرعت هکرهای مستقل پیش برود یا خیر، پرسش مرکزی امنیت هوش مصنوعی است. باید منتظر ظهور ابزارهای خودکار تیم قرمز از سوی شرکت‌های ثالث بود که ممکن است مزیت دسترسی بسته OpenAI را به چالش بکشند.

گام بعدی شما

  • اگر از عامل‌های هوش مصنوعی در کسب‌وکار خود استفاده می‌کنید، تست‌های امنیتی را از فیلترینگ ساده به مدل‌های تقابل‌گونه تغییر دهید.
  • بررسی کنید که آیا سیستم‌های شما در برابر «تزریق پرامپت» در داده‌های ورودی (مثل ایمیل‌ها و وب‌سایت‌ها) مقاوم هستند یا خیر.
  • منتظر ظهور ابزارهای متفرقه «تیم قرمز خودکار» باشید که احتمالاً جایگزین محدودیت‌های OpenAI می‌شوند.

اما این رقابت تسلیحاتی تنها یک روی سکه است؛ بررسی کنیم که چگونه تراشه‌های Blackwell مدل‌های دفاعی را سریع‌تر می‌کنند تا در تحلیل ما درباره سخت‌افزارهای جدید با ما همراه باشید.

چرا این موضوع مهم است؟

این سیستم تخصص OpenAI را در زمینه ایمنی با جایگزینی تست‌های انسانی کند با شبیه‌سازی‌های سریع ماشینی ارتقا می‌دهد. این تغییر باعث می‌شود مدل‌های تجاری در برابر نفوذهای پیچیده، قابل‌اعتمادتر شوند.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی فعلاً به ابزارهای متن‌باز برای تست نفوذ وابسته‌اند. اما ظهور متدهای «زنجیره تفکر جعلی» هشدار می‌دهد که سیستم‌های امنیتی داخلی باید برای حملات پیچیده‌تر آماده شوند.

·نگاه ما
تحریریه دات‌هوش

دسترسی به GPT-Red به این معناست که OpenAI اکنون معیاری برای «استواری» دارد که از هر بنچمارک عمومی‌تری دقیق‌تر است. این رویکرد، امنیت را از یک چک‌لیست استاتیک به یک فرآیند تکاملی تبدیل می‌کند. به نظر ما، این حرکت نشان می‌دهد که در آینده نزدیک، مدل‌ها نه بر اساس هوش، بلکه بر اساس «ضریب مقاومت» در برابر حملات توزیع می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.