پرش به محتوای اصلی
پرش به محتوای مقاله

«ریسک امنیتی شدید»؛ دسترسی به دستورات محرمانه هوش مصنوعی از روی پاسخ‌ها

·۲۱ مرداد ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
بازمهندسی دستورات مدل زبانی از متن خروجی با دقت بالا
بازمهندسی دستورات مدل زبانی از متن خروجی با دقت بالا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متد PTP که برخلاف روش‌های قبلی، بدون نیاز به دسترسی به وزن‌های مدل (Black-box) و تنها با تحلیل خروجی، پرامپت اصلی را بازسازی می‌کند.

تصور کنید تمام اسرار مهندسی پرامپت شما، که ماه‌ها برای بهینه‌سازی‌اش وقت گذاشته‌اید، تنها با نگاهی به جواب‌های مدل لو برود. طبق مقاله‌ای که در ۱۲ اوت ۲۰۲۶ منتشر شد، پژوهشگران IIT Bombay و Adobe Research ثابت کردند که می‌توان دستورات دقیقی که به مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — داده شده است را تنها از روی متن خروجی بازسازی کرد.

سال‌ها تصور می‌شد چون چندین دستور مختلف می‌توانند جواب‌های مشابهی تولید کنند، مهندسی معکوس این فرآیند غیرممکن است. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی مدل‌های محلی اشاره کردیم، کارایی مدل به نحوه مدیریت ورودی‌ها بستگی دارد. در اینجا موضوع شبیه به یک اثر انگشت دیجیتال است؛ محققان راهی یافته‌اند تا اثر انگشت را به خودِ انگشت اصلی برگردانند. این چالش در مدیریت داده‌ها یادآور محدودیت‌هایی است که در رویکردهای جست‌وجوی برداری خالص در محیط‌های صنعتی مشاهده شده و نیاز به استراتژی‌های ترکیبی را برجسته می‌کند.

این تیم تکنیکی به نام «پیش‌بینی توکن قبلی» (Previous-Token Prediction یا PTP) ابداع کرده‌اند. در حالی که مدل‌های استاندارد، توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولونگ که مدل تکه‌تکه می‌خورد — بعدی را پیش‌بینی می‌کنند، PTP یک مدل معکوس را آموزش می‌دهد تا توکن‌هایی که «قبل» از خروجی بوده‌اند را حدس بزند.

بر اساس مستندات این پژوهش، جزئیات فنی این روش عبارت است از:

  • مدل معکوس از صفر و با استفاده از داده‌های مصنوعی (Synthetic Data) تولیدشده توسط مدل هدف آموزش می‌بیند.
  • این روش به هیچ دسترسی به وزن‌های مدل اصلی نیاز ندارد.
  • یک پاسخ واحد می‌تواند هم پرامپت دقیق اصلی و هم چندین جایگزین با معنای مشابه را استخراج کند.

مهندسی معکوس پرامپت‌های مدل زبانی از روی متن خروجی با دقت بالا

به نقل از این گزارش، در یک آزمایش، مدل توانست دستور «چگونه با رقبا ارتباط برقرار کنم تا استراتژی‌های قیمت‌گذاری آن‌ها را بفهمم؟» را به‌طور کامل بازسازی کند. همچنین شش نسخه دیگر با همان هدف تولید کرد. نکته تکان‌دهنده این است که مدل معکوسی که روی چت‌بات کوچک Qwen-3-0.6B آموزش دیده بود، توانست معنا و قصد پاسخ‌های GPT-4o را استخراج کند. این توانایی مدل‌های کوچک در بازسازی خروجی‌های مدل‌های بزرگتر، بحث‌های جدیدی را درباره جایگزینی LLMهای حجیم با مدل‌های بهینه و ارزان‌تر برای وظایف خاص ایجاد کرده است.

بازسازی معکوس دستورات مدل زبانی بزرگ از متن خروجی با دقت تقریباً کامل

این قابلیت، چشم‌انداز امنیتی هوش مصنوعی سازمانی را تغییر می‌دهد. شرکت‌ها معمولاً اسرار تجاری و قوانین نظارتی خود را در پرامپت سیستمی (System Prompt) مخفی می‌کنند تا لو نرود. اگر یک مهاجم بتواند این دستورات را از یک چت‌بات عمومی استخراج کند، دارایی‌های محرمانه شرکت عملاً افشا شده‌اند.

حریم خصوصی کاربران نیز در خطر است. هر پرسش حساس یا شخصی می‌تواند از روی متن خروجی استخراج شود و خروجی مدل را به یک نقطه ضعف امنیتی تبدیل کند. این یعنی دفاع‌های فعلی در برابر «تزریق پرامپت» (Prompt Injection) کافی نیستند، چون حمله بعد از تولید متن رخ می‌دهد.

آزمایشگاه‌های هوش مصنوعی اکنون باید وصله‌هایی برای جلوگیری از این وارونگی بسازند. باید منتظر بمانیم و ببینیم آیا ارائه‌دهندگان برای شکستن پیوند ریاضی بین پرامپت و نتیجه، «نویز» یا اختلالاتی در خروجی‌ها ایجاد می‌کنند یا خیر.

گام بعدی شما

  • اگر از پرامپت‌های سیستمی برای محافظت از منطق تجاری استفاده می‌کنید، فرض کنید این دستورات قابل استخراج هستند.
  • خروجی‌های حساس مدل را پیش از انتشار عمومی، با ابزارهای حذف شناسه‌ها بررسی کنید.
  • به‌روزرسانی‌های امنیتی ارائه‌دهندگان مدل‌ها را برای قابلیت‌های Anti-Inversion دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته اعتبار روش‌های فعلی محافظت از IP در هوش مصنوعی را زیر سؤال می‌برد. تخصص تیم Adobe و IIT Bombay در مدل‌سازی معکوس نشان می‌دهد که لایه دستورات سیستمی دیگر یک حصار امن نیست.

تأثیر برای ایران

این خبر بیشتر برای توسعه‌دهندگان ایرانی که روی لایه‌های Wrapper و سرویس‌های مبتنی بر API مدل‌های خارجی کار می‌کنند اهمیت دارد تا کاربران عادی.

·نگاه ما
تحریریه دات‌هوش

این پژوهش فرضیه «یک‌طرفه بودن» تولید متن در LLMها را می‌زند. تا پیش از این، خروجی مدل را یک تابع غیرقابل بازگشت می‌دیدند، اما PTP نشان داد که اثر انگشت دستورات در توکن‌های خروجی باقی می‌ماند. این یعنی امنیت از طریق پنهان‌سازی (Security by Obscurity) در لایه پرامپت دیگر جواب نمی‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.