تصور کنید یک عامل هوش مصنوعی با دسترسی به ترمینال سیستم، بر اثر یک توهم ساده، دستور حذف کل دایرکتوری ریشه را اجرا کند. برای جلوگیری از چنین فجایعی، دیگر نیازی نیست کل منطق عامل را از ابتدا بنویسید؛ کافی است یک لایهٔ امنیتی یا «نگهبان» بین تصمیم مدل و اجرای دستور قرار دهید.
طبق گزارشی که در ۱۴ اوت ۲۰۲۶ منتشر شد، توسعهدهندگان میتوانند با استفاده از MonkeyCode یک لایهٔ اعتبارسنجی بسازند که هر فراخوانی ابزار را پیش از رسیدن به سیستم عملیاتی بررسی میکند. این لایه شبیه به یک دیوارهٔ آتش (Firewall) عمل میکند که درخواستهای پرخطر را بر اساس مجموعهای از قوانین ثابت رد میکند. این رویکرد در راستای اصول امنیتی برای جلوگیری از نشت دادهها و دسترسیهای غیرمجاز در عاملهای هوش مصنوعی است که پیشتر بررسی کرده بودیم.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، اعتماد مطلق به خروجی مدلهای زبانی ریسکهای زیرساختی بزرگی دارد. در این روش، توسعهدهنده بهجای اصلاح مداوم پرامپتها، روی «مهندسی سیاستها» تمرکز میکند تا خطاهای استنتاج (Inference) — همان لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — را مهار کند.
به نقل از گزارش dev.to، این فرآیند با استفاده از دسترسیهای رایگان MonkeyCode و از طریق یک چرخه فنی اجرا میشود:
- طراحی: ایجاد قوانین رد (Deny Rules) با استفاده از مدلهای سطح رایگان.
- ارزیابی: اجرای تستهای دستهای روی یک محیط مستقل از مدل. این متد ارزیابی شباهت زیادی به جایگزینی تستهای محلی کدنویسی با بنچمارکهای عمومی دارد تا دقت واقعی مدل در محیط عملیاتی سنجیده شود.
- بهینهسازی: تنظیم نتایج مورد انتظار بر اساس لاگها تا زمانی که قوانین به ثبات برسند.
این متد برای تیمهایی با کمتر از ۵۰ مورد تست یا قوانینی که هنوز در حال تکامل هستند، ایدهآل است. با این حال، نویسنده هشدار میدهد که لایههای رایگان مرز امنیتی نهایی نیستند و ممکن است در برابر تزریق پرامپت (Prompt Injection) — شبیه به فریب دادن یک نگهبان برای ورود به ساختمان بدون کارت — ناتوان باشند.
در نهایت، این رویکرد ریسک مالی را کاهش میدهد؛ زیرا شما تنها زمانی هزینه مدلهای گرانقیمت و قدرتمند را میپردازید که منطقِ لایهٔ نگهبان روی زیرساختهای رایگان اثبات شده باشد.
گام بعدی شما
- خطرناکترین قابلیتهای ابزاری عاملهای خود را شناسایی و فهرست کنید.
- یک جدول تصمیمگیری شامل موارد «مجاز» و «ممنوع» برای بنچمارک کردن نرخ Recall (بازیابی) نگهبان خود بسازید.
- لایهٔ اعتبارسنجی را ابتدا روی مدلهای کوچکتر و رایگان تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو