پرش به محتوای اصلی
پرش به محتوای مقاله

پروژه Hollis & Pine: محیطی برای شکار نقاط ضعف بات‌های پشتیبانی

·۱۲ مهر ۱۴۰۵۱ دقیقه مطالعه
لطفاً سعی کنید ربات پشتیبانی هوشمند فروشگاه جعلی من را هک کنید!
لطفاً سعی کنید ربات پشتیبانی هوشمند فروشگاه جعلی من را هک کنید!
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل تست نفوذ به یک محیط بازی‌گونه (Gamified) و عمومی برای مدل‌های زبانی؛ به جای وصله‌های پنهانی، از شفافیت در شکست‌ها برای بهبود استواری مدل استفاده شده است.

تصور کنید یک فروشگاه آنلاین دارید که بات پشتیبانی‌اش با چند جمله ساده، تمام تخفیف‌های مخفی را لو می‌دهد یا کالاهای گران‌قیمت را رایگان می‌فرستد. این کابوس برای بسیاری از کسب‌وکارهاست، اما برای پژوهشگران جدید، یک معدن داده است.

در ۴ اکتبر ۲۰۲۶، محیط آزمایشی جدیدی به نام Hollis & Pine راه‌اندازی شد تا کاربران را به چالش بکشد تا حفاظ‌ها (Guardrails) — شبیه به نرده‌های ایمنی در کنار یک پل که مانع سقوط عابران می‌شود — را در بات پشتیبانی این فروشگاه خیالی به نام Pip بشکنند. هدف این پروژه، جمع‌آوری داده درباره نحوه شکست مدل‌ها در برابر مهندسی اجتماعی خصمانه است. این در حالی است که برخی شرکت‌ها مانند پیمجو توانسته‌اند با استخراج سخت‌گیرانه مستندات، حجم تیکت‌های پشتیبانی را به شدت کاهش دهند، اما امنیت این سیستم‌ها همچنان یک چالش جدی است.

بسیاری از شرکت‌ها با تزریق پرامپت (Prompt Injection) — یعنی تلاش برای تغییر دستورات مدل با ورودی‌های فریبنده، مثل کسی که به یک نگهبان می‌گوید «فراموش کن که من را نباید داخل کنی» — به صورت خاموش و با وصله‌زدن حفره‌ها مقابله می‌کنند. اما این پروژه رویکرد را تغییر داده و از عموم مردم می‌خواهد در یک محیط کنترل‌شده، فعالانه به دنبال نقاط ضعف بگردند. همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، درک نحوه شکست مدل، برای رسیدن به استواری واقعی ضروری است. این آسیب‌پذیری‌ها زمانی خطرناک‌تر می‌شوند که دسترسی‌های گسترده API در عامل‌های هوش مصنوعی به حفره‌های امنیتی تبدیل شوند و امکان نفوذ به سیستم‌های داخلی را فراهم کنند.

به نقل از گزارش dev.to، شرکت‌کنندگان باید چهار مأموریت مشخص را اجرا کنند:

  • دست‌کاری مالی: فریب دادن بات برای اعطای تخفیف‌ها یا بازپرداخت‌های غیرمجاز.
  • افشای دستورالعمل‌ها: مجبور کردن بات به لو دادن پرامپت سیستمی (System Prompt) یا کدهای داخلی.
  • خروج از محدوده: سوق دادن بات به انجام کارهایی که هیچ ارتباطی به پشتیبانی فروشگاه ندارد.
  • تست استرس شخصیت: استفاده از خشم یا سناریوهای پیچیده برای شکستن سیاست‌های رفتاری.

طبق اعلام تیم توسعه، موفقیت‌ها از طریق یک شمارنده عمومی رصد می‌شوند تا تفاوت بین «نقش‌آفرینی ساده» و «شکست واقعی سیاست‌ها» مشخص شود. پژوهشگران به‌ویژه روی «شکست‌ها» تمرکز کرده‌اند؛ یعنی دقیقاً کدام عبارت باعث شد بات درخواست را رد کند تا ببینند آیا این «ترک» در جلسات مختلف تکرار می‌شود یا خیر. در این راستا، بررسی تله‌های مجوزدهی در پروتکل‌هایی مانند MCP نشان می‌دهد که چگونه دسترسی به داده‌های حساس می‌تواند تسهیل و در عین حال ریسک‌برانگیز شود.

برای یک کاربر عادی، این یک درس عملی است که نشان می‌دهد حفاظ‌های هوش مصنوعی چقدر شکننده هستند. این پروژه ثابت می‌کند دستورات سیستمی اغلب فقط «پیشنهاداتی» هستند که یک کاربر مصمم می‌تواند با اهرم‌های روان‌شناختی آن‌ها را دور بزند.

گام بعدی شما

  • اگر از Claude استفاده می‌کنید، محیط این پروژه را از طریق Artifacts بررسی کنید تا قدرت مهندسی پرامپت خود را بسنجید.
  • در صورت توسعه بات‌های تجاری، از متدهای Red Teaming برای شناسایی حفره‌های مالی پیش از انتشار استفاده کنید.
  • مستندات مربوط به Prompt Leaking را مطالعه کنید تا متوجه شوید مدل‌ها چگونه دستورات پنهان خود را افشا می‌کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تجربه جمعی (Crowdsourcing)، سرعت شناسایی آسیب‌پذیری‌ها را نسبت به تیم‌های کوچک امنیتی افزایش می‌دهد. اعتبار این متد در تبدیل «باگ‌ها» به «داده‌های آموزشی» برای همراستاسازی بهتر مدل‌هاست.

تأثیر برای ایران

این پروژه به دلیل ماهیت آموزشی و باز بودن محیط تست، فرصتی عالی برای برنامه‌نویسان ایرانی است تا بدون نیاز به APIهای گران‌قیمت، مهارت‌های Red Teaming را تمرین کنند.

·نگاه ما
تحریریه دات‌هوش

این پروژه نشان می‌دهد که رویکرد «تیم قرمز» (Red Teaming) در حال تبدیل شدن به یک بازی اجتماعی برای جمع‌آوری داده است. به نظر ما، تکیه بر حفاظ‌های متنی برای امنیت مالی در بات‌ها یک استراتژی شکست‌خورده است و تنها راه حل، جداسازی لایه تصمیم‌گیری مالی از لایه تولید متن است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.