پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: شناسایی حفره‌های امنیتی در ۸۴٪ موارد با ابزار GPT-Red

·۲۵ تیر ۱۴۰۵۱ دقیقه مطالعه
OpenAI از هوش مصنوعی برای حمله به هوش مصنوعی خود استفاده می‌کند و نتیجه بهتر از انسان‌هاست.
OpenAI از هوش مصنوعی برای حمله به هوش مصنوعی خود استفاده می‌کند و نتیجه بهتر از انسان‌هاست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل تیم‌های قرمز انسانی با یک مدل تخصصی (GPT-Red) که نرخ شناسایی آسیب‌پذیری را از ۱۳٪ به ۸۴٪ رسانده است.

تصور کنید یک سیستم امنیتی دارید که هر لحظه توسط باهوش‌ترین هکر جهان مورد حمله قرار می‌گیرد تا نقاط ضعفش را پیدا کند. اوپن‌ای‌آی دقیقاً همین کار را با مدل جدید خود به نام GPT-Red انجام داده است تا قبل از اینکه مهاجمان واقعی دست به کار شوند، حفره‌های امنیتی مدل‌هایش را ببندد.

طبق گزارش the-decoder.com در ۱۵ ژوئیه ۲۰۲۶، GPT-Red در ۸۴٪ سناریوهای آزمایشی توانست به موفقیت در حمله دست یابد. این عدد در مقایسه با تیم‌های قرمز انسانی — که تنها در ۱۳٪ موارد موفق شدند — یک جهش خیره‌کننده است. این سیستم در واقع یک تیم قرمز (Red Teaming) — شبیه به یک گروه نفوذی که برای تست استحکام قلعه، سعی می‌کند از هر دری وارد شود — اما در مقیاس مدل‌های زبانی است. این رویکرد در واقع تکامل یافتگی اتوماسیون Red-Teaming است که اوپن‌ای‌آی برای شناسایی سریع‌تر حفره‌های امنیتی به کار گرفته است.

همان‌طور که در تحلیل قبلی ما درباره‌ی سخت‌افزارهای هوشمند اوپن‌ای‌آی اشاره کردیم، این شرکت حالا تمرکز خود را بر استواری نرم‌افزاری گذاشته تا جلوی تزریق پرامپت (Prompt Injection) — مثل لغزاندن یک دستور مخفی در متن ایمیل برای تغییر رفتار مدل — را بگیرد. مکانیزم کار GPT-Red بر پایه یادگیری تقویتی از طریق بازی با خود (Self-play Reinforcement Learning) است؛ یعنی مدل در نقش مهاجم قرار می‌گیرد و مدل‌های مدافع سعی می‌کنند او را متوقف کنند. در یکی از تست‌های داخلی، این مدل توانست با تغییر قیمت‌ها و لغو سفارش‌ها، یک دستگاه فروش خودکار اداری را به طور کامل دستکاری کند.

اثرات امنیتی بر GPT-5.6 Sol

بر اساس مستندات داخلی، یافته‌های این حملات مستقیماً در آموزش مدل‌های پرچم‌دار جدید اثر گذاشته است:

  • مدل GPT-5.6 Sol در برابر تزریق‌های مستقیم پرامپت، ۶ برابر کمتر از بهترین مدل چهار ماه پیش شکست می‌خورد.
  • نرخ موفقیت حملات تزریق پرامپت از نسخه GPT-5.3 تا GPT-5.6 Sol به‌طور مستمر کاهش یافته است.
  • تنها ۳.۸٪ از حملات «سخت» هنوز موفق می‌شوند، عددی که با عملکرد Claude Opus 4.5 برابری می‌کند.

حمله هوش مصنوعی به خود: روش جدید OpenAI برای بهبود امنیت مدل‌ها

جایگزینی انسان با یک «ابر-هکر» مبتنی بر مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا می‌داند هر کجای کتابخانه سوراخ است — امنیت را از یک بازرسی دستی به یک چرخه مقیاس‌پذیر تبدیل می‌کند. برای کاربران تجاری، این یعنی فاصله میان توقعات و واقعیت در مورد پایداری مدل‌ها در حال بسته شدن است. با این حال، موفقیت ۳.۸٪ حملات پیچیده ثابت می‌کند که امنیت مطلق یک هدف غیرممکن است و هیچ مدلی را نباید کاملاً «مصون» دانست.

اوپن‌ای‌آی فعلاً قصد دارد GPT-Red را داخلی نگه دارد. در ادامه باید منتظر انتشار یک مقاله فنی باشیم که جزئیات رسیدن به نرخ ۸۴٪ موفقیت در کشف آسیب‌پذیری‌ها را توضیح می‌دهد.

گام بعدی شما

  • اگر از API برای اتوماسیون‌های حساس استفاده می‌کنید، استراتژی «لایه‌های دفاعی» را جایگزین اعتماد مطلق به مدل کنید.
  • در گزارش‌های فنی آتی اوپن‌ای‌آی، به دنبال الگوریتم‌های «بازی با خود» برای بهبود استواری مدل‌های شخصی خود باشید.
  • رفتارهای غیرعادی مدل‌های خود را در سناریوهای پیچیده رصد کنید تا الگوهای احتمالی تزریق پرامپت را شناسایی کنید.

اما تأثیر این سطح از امنیت بر رقابت با مدل‌های بازمتن حتی پیچیده‌تر است — به تحلیل ما درباره‌ی استراتژی‌های مدل‌های Open Weights مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار متدولوژی‌های RLHF و یادگیری تقویتی، استاندارد ایمنی هوش مصنوعی را از «تست دوره‌ای» به «پایش مستمر» تغییر می‌دهد. نتیجه آن، کاهش چشم‌گیر ریسک‌های تجاری برای سازمان‌هایی است که AI را در محیط‌های حساس عملیاتی می‌کنند.

تأثیر برای ایران

این تحول در لایه‌های داخلی OpenAI رخ داده و دسترسی به GPT-Red برای توسعه‌دهندگان ایرانی (و جهانی) ممکن نیست؛ لذا اثر مستقیم آن تنها از طریق استفاده از نسخه‌های به‌روزرسانی‌شده GPT-5.6 Sol حس خواهد شد.

·نگاه ما
تحریریه دات‌هوش

تغییر رویکرد از Red Teaming انسانی به خودکار، نشان می‌دهد که OpenAI دیگر به سرعت تحلیل انسان برای یافتن باگ‌ها تکیه نمی‌کند. این یعنی امنیت مدل‌ها حالا با سرعت رشد خودِ محاسبات (Compute) پیش می‌رود، نه با سرعت یادگیری انسان. احتمالاً در آینده شاهد مدل‌های «تدافعی» خواهیم بود که به صورت لحظه‌ای در برابر هر پرامپت، یک شبیه‌ساز حمله داخلی اجرا می‌کنند تا پاسخ را تأیید کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.