اگر همین حالا در حال استقرار یک چتبات سازمانی هستید، احتمالاً متوجه شدهاید که دستورالعملهای کلی ایمنی در برابر نشت دادههای آموزشی یا توهمات مدلها ناتواناند. در حالی که دستورالعملهای کلی ایمنی هوش مصنوعی یک بنیاد گسترده فراهم میکنند، اما اغلب در رسیدگی به آسیبپذیریهای منحصربهفرد سیستمهای زاینده، مانند نشت دادههای آموزشی خصوصی و خروجیهای ساختگی (Confabulated)، شکست میخورند. برای پر کردن این شکاف، مؤسسه ملی استاندارد و فناوری (NIST) یک نقشه راه عملیاتی و ملموس را برای ایمنسازی مدلهای بنیادی از طریق پروفایل هوش مصنوعی زاینده (Generative AI Profile - AI 600-1) ارائه داده است.
در حالی که چارچوب مدیریت ریسک (RMF) پیشین بیشتر جنبه فلسفی و کلی داشت، هوش مصنوعی زاینده — مثل آشپزی با دستورالعملهایی که هر بار نتیجه متفاوتی میدهند — تهدیدات متمایزی برای یکپارچگی اطلاعات ایجاد کرده است. سازمانها اکنون با چشماندازی روبرو هستند که در آن تزریق پرامپت (Prompt Injection) و ورودیهای خصمانه (Adversarial Inputs) میتوانند لایههای امنیتی سنتی را دور بزنند. پروفایل AI 600-1 که در ژوئیه ۲۰۲۴ منتشر شد، به عنوان یک لنز کاربردی عمل میکند تا توابع اصلی RMF یعنی «حاکمیت، نقشهبرداری، اندازهگیری و مدیریت» را بر این ریسکهای خاص پیاده کند.
زمینه و کاربرد
این پروفایل داوطلبانه است و برای تیمهایی طراحی شده که در حال ایجاد حاکمیت پیرامون چتباتها، دستیارهای کدنویسی، ابزارهای تولید رسانه و مدلهای بنیادی (Foundation Model) — مدلهای غولپیکری که مثل یک دانشنامه جامع آموزش دیدهاند و حالا برای کارهای خاص تنظیم میشوند — هستند. این سند ۱۲ دسته اقدام را شناسایی کرده است که به زیرمجموعهها و کنترلهای مرتبط در AI RMF متصل شدهاند.
برای بهکارگیری این پروفایل، سازمانها باید ابتدا محدوده (Scope) سیستمهای خود را تعیین کنند. هر اقدام لزوماً با عمق کامل برای هر ابزار کاربرد ندارد. اولویت باید به سیستمهایی داده شود که بالاترین سطح ریسک را دارند؛ بهویژه سیستمهایی که دارای دسترسی گسترده کاربران، استقلال عملیاتی بالا یا دسترسی به دادههای حساس هستند.
بر اساس مستندات NIST، این پروفایل در ۱۲ دسته اقدام سازماندهی شده است:
حاکمیت و نقشهبرداری
- حاکمیت (Govern):
- اقدام ۱: تعریف و ابلاغ موارد استفاده واقعی و مورد انتظار برای جلوگیری از سوءاستفاده.
- اقدام ۲: مستندسازی توزیع دادههای آموزشی و محدودیتها تا کاربران بتوانند درباره قابلاعتماد بودن مدل استدلال کنند.
- اقدام ۳: اجرای تیم قرمز (Red Teaming) و تمرینات شبیهسازی (Tabletop Exercises) برای کاوش در مورد روشهای شکستن مدل (Jailbreaks) و حالتهای شکست.
- اقدام ۴: پیادهسازی معماری «اعتماد صفر» (Zero-Trust)، شامل کنترلهای شناسایی و دسترسیهای حداقلی (Least-Privilege).
- اقدام ۵: سرمایهگذاری در تحلیلهای آماری قدرتمند از خروجیها برای شناسایی افت کیفیت و رانش مدل (Drift).
- نقشهبرداری (Map):
- اقدام ۶: ارزیابی و افشای ریسکها و آسیبهای احتمالی که مختص به محیط استقرار (Deployment Context) هستند.
- اقدام ۷: ایجاد یک فرآیند مدیریت ریسک که به چارچوب گستردهتر AI RMF متصل باشد.
- اقدام ۸: اطمینان از تأمین مسئولانه و اشتراکگذاری شفاف داراییهای هوش مصنوعی، از جمله وزنها و مجموعهدادهها.
اندازهگیری و مدیریت
- اندازهگیری (Measure):
- اقدام ۹: تأیید ارزیابیها، بررسیها و بنچمارکها پیش از انتشار ادعاهای مربوط به عملکرد مدل.
- اقدام ۱۰: اجرای اقدامات کاهش ریسک مؤثر، مانند فیلترینگ، سانسور (Redaction) و رفتارهای «امتناع از پاسخ» برای محتوای حساس.
- مدیریت (Manage):
- اقدام ۱۱: شناسایی و پیادهسازی راهکارهای کاهش آسیبپذیریهای امنیت سایبری، بهویژه تزریق پرامپت.
- اقدام ۱۲: تدوین برنامههای پاسخ به حوادث و بازیابی فناوری هوش مصنوعی برای مدیریت حوادث مربوط به هوش مصنوعی زاینده.
برای تیمهایی که چتباتهای مشتریمحور دارند، این یعنی عبور از اهداف مبهم ایمنی به سمت معیارهای عددی. یک شرکت اکنون باید صحت واقعگرایانه (Factual Accuracy) را بسنجد، نرخ پاسخهای مضر و امتناع را رصد کند و پیش از لانچ، یک «اشتهای ریسک» (Risk Appetite) مستند برای اطلاعات نادرست تعریف کند.
این چارچوب پلی حیاتی به قوانین بینالمللی میزند. برای شرکتهای فعال در بازار اروپا، تمرکز این پروفایل بر شفافیت و منشأ محتوا، مستقیماً مکمل قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) است. این الزام شفافیت در عمل دشوار است، بهطوری که تنها تعداد اندکی از ارائهدهندگان بزرگ هوش مصنوعی توانستهاند استانداردهای شفافیت دادههای آموزشی را در اروپا رعایت کنند. بهطور مشخص، این متدولوژی ابزارهای لازم برای برآورده کردن الزامات شفافیت ماده ۵۰ و نیازمندیهای GPAI را پیش از پایان مهلت نشانگذاری (Watermarking) در ۲ دسامبر ۲۰۲۶ فراهم میکند.
با تطبیق این ۱۲ اقدام با کنترلهای امنیتی موجود، سازمانها میتوانند شکافهای حاکمیتی خود را بدون بازسازی کل زیرساخت حریم خصوصی شناسایی کنند. این تغییر، ایمنی هوش مصنوعی را از یک تمرین تئوریک به چکلیستی از الزامات مهندسی قابلتأیید تبدیل میکند.
کاربران اکنون باید سیستمهای پرریسک خود — آنهایی که استقلال گسترده یا دسترسی به دادههای حساس دارند — را در برابر این ۱۲ دسته ارزیابی کنند تا از انطباق و ایمنی آنها اطمینان حاصل نمایند.
گام بعدی شما
- سیستمهای پرریسک خود (آنهایی که دسترسی به دادههای حساس دارند) را با این ۱۲ دستهبندی تطبیق دهید.
- برای مدلهای در حال استقرار، یک پروتکل پاسخ به حوادث (Incident Response) اختصاصی بنویسید.
- معیارهای عددی برای «نرخ امتناع» و «صحت واقعگرایانه» را در داشبورد مانیتورینگ خود تعریف کنید.
اما تأمین سختافزاری برای اجرای این لایههای امنیتی بدون افت سرعت، چالش بعدی است — به تحلیل ما دربارهی بهینهسازی استنتاج در تراشههای جدید مراجعه کنید.




گفتگو