پرش به محتوای اصلی
پرش به محتوای مقاله

درون متد CrushOn AI برای جلوگیری از تجاوز نقش در مدل‌ها

·۱۸ مهر ۱۴۰۵۹ دقیقه مطالعه
راهنما
اشکال‌زدایی پرامپت: جلوگیری از صحبت کردن شخصیت هوش مصنوعی به جای کاربر
اشکال‌زدایی پرامپت: جلوگیری از صحبت کردن شخصیت هوش مصنوعی به جای کاربر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متد «پیشنهاد بده، سپس متوقف شو» به‌جای استفاده از پرامپت‌های منفی برای کنترل رفتار مدل در نقش‌آفرینی.

تصور کنید در یک محیط نقش‌آفرینی غوطه‌ور شده‌اید و ناگهان هوش مصنوعی تصمیم می‌گیرد احساسات شخصیت شما را تعریف کند یا به‌جای شما پاسخ دهد؛ این لحظات فوراً حس غوطه‌وری را نابود می‌کنند. برای حل این مشکل، CrushOn AI در ۱۰ اکتبر ۲۰۲۶ راهنمای فنی دقیقی منتشر کرد تا با بازتعریف مرزهای بین مدل و کاربر، پدیده «تجاوز از مرز» (Overreach) را حذف کند. این راهنما توسط یک ناشر وابسته به محصول منتشر شده و در تدوین و ویرایش آن از ابزارهای هوش مصنوعی کمک گرفته شده است.

بسیاری از کاربران سعی می‌کنند با افزودن دستورات منفی مثل «هرگز به‌جای من حرف نزن»، این مشکل را حل کنند. اما طبق گزارش این پلتفرم، این قوانین اغلب شکست می‌خورند، به‌ویژه اگر پیام خوش‌آمدگویی (Greeting) شخصیت از پیش حاوی نمونه‌هایی از کنترل کاربر توسط هوش مصنوعی باشد. در واقع، در فضای نهان (Latent Space) — که شبیه به یک نقشهٔ عظیم از مفاهیم است و مدل بر اساس نزدیکی مفاهیم تصمیم می‌گیرد — رفتار نمونه‌ایِ موجود در پیام آغازین، بر دستور صریح کاربر غلبه می‌کند. افزودن دستورات تکراری «به‌جای من حرف نزن» زمانی که پیام آغازین در حال نوشتن دیالوگ‌ها و واکنش‌های شماست، کارایی بسیار کمی دارد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت و همراستاسازی مدل‌های زبانی اشاره کردیم، تضاد بین دستورات سیستمی و داده‌های نمونه‌ای، یکی از رایج‌ترین نقاط شکست در مدل‌های مولد است. این چالش‌ها در کنار روش‌های مختلف دور زدن حفاظ‌های امنیتی چت‌بات‌ها نشان می‌دهد که کنترل دقیق رفتار مدل‌های زبانی همچنان یک مسئله پیچیده است. چارچوب CrushOn AI پیشنهاد می‌کند به‌جای «ممنوعیت» رفتار، از یک سیستم «اجازه» استفاده شود که دقیقاً مشخص می‌کند هر طرف کنترل کدام بعد از صحنه را بر عهده دارد. برای دنبال کردن این فرآیند، راهنما پیشنهاد می‌کند یک شخصیت اصلی در CrushOn بسازید، حالت «خصوصی» (Private) را برای تمرین انتخاب کنید و از مثال «آیریس ویل» (Iris Vale) استفاده کنید؛ او یک محافظ موزه ۳۲ ساله است که در یک آرشیو امن (SFW) کار می‌کند.

تعریف مرزهای عاملیت

تجاوز از مرز تنها به دیالوگ محدود نمی‌شود و چهار بعد متمایز از عاملیت کاربر را در بر می‌گیرد. راهنما بین «مجوزها» و «ممنوعیت کلی کلمه شما» تفاوت قائل می‌شود. برای مثال، وقتی آیریس می‌پرسد «آیا می‌خواهید برچسب را چک کنید؟»، این یک تعامل مبتنی بر مجوز است، اما جمله «شما پیچ‌گوشتی را زمین می‌گذارید» تصمیمی است که مدل به‌جای کاربر گرفته است.

  • گفتار (Speech): مدل جمله‌ای را بدون درخواست کاربر برای او می‌سازد. جایگزین: آیریس سوالی می‌پرسد و منتظر پاسخ شما می‌ماند.
  • عمل (Action): مدل تصمیم می‌گیرد کاربر کلیدی را بردارد یا بدون انتخاب، شخصیتی را دنبال کند. جایگزین: آیریس کلید را پیشنهاد می‌دهد یا مسیری را نشان می‌دهد.
  • وضعیت درونی (Internal State): مدل احساساتی مثل اعتماد، آرامش یا ترس را به کاربر نسبت می‌دهد. جایگزین: آیریس عدم قطعیت خودش را توصیف می‌کند یا می‌پرسد شما چه احساسی دارید.
  • تصمیم (Decision): مدل انتخابی را که کاربر هنوز نکرده، تکمیل می‌کند. جایگزین: پاسخ مدل در حالی متوقف می‌شود که انتخاب همچنان باز است.

گردش‌کار بازبینی ساختاری

برای رفع خطاهای رفتاری، باید داده‌های شخصیت به چهار بخش مجزا تقسیم شوند تا دستورات با هم تداخل نکنند. این جداسازی به نویسندگان اجازه می‌دهد بدون جایگزینی کل شخصیت، رفتارهای ناخواسته را بررسی کنند. بر اساس راهنمای CrushOn AI، نویسندگان باید موارد زیر را ایزوله کنند:

  • شخصیت (Personality): تعریف ماهیت کاراکتر و نحوه رفتار او تحت فشار.
  • سناریو (Scenario): تعیین نقطه شروع صحنه و مواردی که هنوز حل‌نشده باقی مانده‌اند.
  • پیام آغازین (Greeting): شروعی قابل بازی که تقسیم کنترل مورد نظر را به‌صورت عملی نمایش دهد.
  • گفتگوهای نمونه (Example Conversation): تبادلات کوتاهی که مرز کنترل را در عمل نشان دهند.

یک اشتباه رایج، قرار دادن دستورات حیاتی در بخش «معرفی» (Introduction) است؛ زیرا این بخش صرفاً برای تبلیغ شخصیت به کاربر است و بر رفتار چت تأثیری ندارد. در فرم ساخت شخصیت که در ۱۰ اکتبر ۲۰۲۶ بررسی شد، این ورودی‌ها تفکیک شده‌اند؛ بخش سناریو در یک منوی تاشو قرار دارد و گفتگوهای نمونه از جعبه‌های جفت‌شده «کاربر» و «کاراکتر» استفاده می‌کنند. نویسندگان هشدار یافته‌اند که یک تبادل کامل دوطرفه را تنها در جعبه پاسخ کاراکتر کپی نکنند.

بازبینی پیام آغازین

قبل از افزودن قوانین جدید، باید پیام آغازین برای هرگونه ادعایی درباره مشارکت کاربر بررسی شود. یک پیام متضاد می‌تواند این‌گونه باشد: «شما با شرمندگی به آرشیو می‌دوید. می‌گویید: کمک می‌خواهم، و برچسب آسیب‌دیده را در دست آیریس می‌گذارید. آیریس لبخند می‌زند. شما فوراً احساس امنیت می‌کنید.» این مثال همزمان ورود، احساس شرم، دیالوگ، تحویل دادن شیء و احساس آرامش را برای کاربر اختراع کرده است.

نسخه اصلاح‌شده باید وضعیتی ایجاد کند که ارزش پاسخ دادن داشته باشد: «آیریس ویل یک برگه موجودی خالی را کنار کابینت آبی می‌گذارد و می‌گوید: برچسب خوانا نیست. می‌توانیم لولاها را بررسی کنیم یا دفتر ثبت را چک کنیم. دوست دارید اول کدام را ببینید؟» این بازبینی به آیریس عمل و صدا می‌دهد، در حالی که رفتار و دیالوگ کاربر را از پیام آغازین حذف می‌کند.

پیاده‌سازی قانون عاملیت

به‌جای ممنوعیت‌های مبهم، این راهنما یک قانون عملکردی دقیق را پیشنهاد می‌کند که باید در بخش رفتار یا دستورات سفارشی قرار گیرد: «گفتار، اعمال، ادراکات و عدم قطعیت [کاراکتر] را بنویس. بازدیدکننده کنترل گفتار، اعمال، انتخاب‌ها و احساسات خود را بر عهده دارد. تنها رفتارهای بازدیدکننده‌ای را تایید کن که قبلاً در گفتگو ارائه شده است. یک عمل پیشنهاد بده یا سوال بپرس، و سپس پیش از پاسخ بازدیدکننده متوقف شو. سکوت، تردید یا یک گزینه پیشنهادی را به‌عنوان موافقت تلقی نکن.»

این رویکرد، عبارت «کنترل من را متوقف کن» را با دستور عینی «پیشنهاد بده، سپس متوقف شو» جایگزین می‌کند. این دستور به مولد متن دقیقاً می‌گوید که یک پاسخ موفق بعدی چگونه باید باشد. در راهنمای دستورات سفارشی CrushOn ذکر شده که اگرچه این روش مانع از صحبت کردن کاراکتر به‌جای کاربر می‌شود، اما رفتار مدل همچنان می‌تواند متغیر باشد، زیرا این‌ها دستوراتی برای یک مولد هستند و نه یک سیستم مجوزهای سخت‌افزاری.

اصلاح نمونه‌ها و تست‌های تشخیصی

نمونه‌های گفتگو می‌توانند با قوانین صریح در تضاد باشند. نویسندگان باید تبادلات را که در آن پاسخ کاراکتر شامل یک جواب اختراعی از سوی بازدیدکننده است، حذف کنند. به‌جای آن، از تبادلات کوتاه و تألیفی استفاده کنید. برای مثال:

  • بازدیدکننده: «نمی‌توانم تصمیم بگیرم که قفل را بررسی کنم یا دفتر ثبت را.»
  • آیریس: «دفتر ثبت احتمالاً کمتر به باز شدن اعتراض می‌کند.» او به کتاب بسته ضربه می‌زند. «می‌خواهید از آنجا شروع کنیم؟»

در این مورد، آیریس ترجیح خود را بیان می‌کند و یک شوخی خشک می‌کند، بدون اینکه تردید کاربر را به اجازه برای تصمیم‌گیری تبدیل کند.

برای تایید اصلاحات، راهنما پنج پرامپت تشخیصی خاص را پیشنهاد می‌کند. این‌ها باید به‌عنوان ورودی‌های تست استفاده شوند، نه پاسخ‌های نمونه. نویسندگان باید اولین پاسخ کامل، حتی در صورت شکست، را ذخیره کنند و سپس جایگزین‌ها را درخواست کنند:

  • انتخاب نشده: «تصمیم نگرفته‌ام کابینت را باز کنم. بدون اتخاذ این تصمیم ادامه بده.» (بررسی کنید آیا آیریس پیشنهاد می‌دهد یا بدون اجبار به موافقت، عمل می‌کند).
  • سکوت: «من ساکت می‌مانم. آیریس چه می‌کند؟» (بررسی کنید آیا پاسخ از اختراع گفتار یا تفسیر سکوت به‌عنوان رضایت اجتناب می‌کند).
  • احساس بیان‌شده: «احساس عصبی بودن می‌کنم اما تکان نخورده‌ام. به‌عنوان آیریس پاسخ بده.» (بررسی کنید آیا مدل تصمیم می‌گیرد که کاربر آرام شود یا نزدیک‌تر بیاید یا خیر).
  • عمل تکمیل‌شده: «دفتر را روی میز می‌گذارم. از اینجا ادامه بده.» (بررسی کنید آیا مدل یک عمل اضافی و درخواستی بعد از آن اضافه می‌کند یا خیر).
  • ادامه مبهم: «صحنه را برای یک پاراگراف کوتاه ادامه بده.» (بررسی کنید آیا مرز کنترل بدون یادآوری مجدد حفظ می‌شود).

بازبین‌ها باید هر مورد را به عنوان «برقرار»، «عدم برقرار» یا «نامشخص» علامت‌گذاری کنند. «نامشخص» زمانی استفاده می‌شود که متن می‌تواند هم یک پیشنهاد عمل باشد و هم یک تحویل کامل تصمیم. مفید بودن باید جداگانه ردیابی شود؛ پاسخی که صرفاً تکرار می‌کند «من شما را کنترل نمی‌کنم»، مرز را رعایت کرده اما در نقش‌آفرینی شکست خورده است.

ردیابی و تکرار

برای یک تشخیص مفید، در هر بار هر بار تنها یک متغیر را تغییر دهید. اگر پیام آغازین اصلاح‌شده همچنان منجر به تجاوز از مرز شد، تنها در آن زمان قانون کنترل فشرده را اضافه کنید. تغییر همزمان پیام آغازین، قوانین، مدل و طول پاسخ، تشخیص اینکه کدام تغییر مؤثر بوده را غیرممکن می‌کند.

نویسندگان می‌توانند یک سابقه توسعه ساده را نگه دارند:
{ "prompt_version": "agency-rule-01", "model_label": "record the displayed label", "chat_context": "fresh", "prompt": "paste the exact diagnostic", "first_reply": "", "agency_review": "not run", "evidence_sentence": "", "scene_usefulness": "not reviewed" }

بازیابی و صحنه‌های پیچیده

برای چت‌های موجود که در آن‌ها هوش مصنوعی پیش‌تر تجاوز کرده است، راهنما اصلاحات «خارج از شخصیت» (OOC) را توصیه می‌کند. یک مثال برای اصلاح: «(OOC: بازدیدکننده من کلید را نپذیرفته یا دنبال آیریس نرفته است. درست قبل از آن تصمیم بازگرد. پیشنهاد یا عمل بعدی آیریس را بنویس و سپس پاسخ من را باز بگذار).»

در صحنه‌های گروهی، هوش مصنوعی ممکن است نیاز داشته باشد چندین NPC را کنترل کند. راهنما نسبت به قوانینی مانند «هرگز کسی جز آیریس را ننویس» هشدار می‌دهد، زیرا این کار به‌طور تصادفی شخصیت‌های پشتیبان را حذف می‌کند. به‌جای آن، نویسندگان باید یک «لیست مجوزهای کست» ارائه دهند و صریحاً مشخص کنند چه کسی توسط هوش مصنوعی کنترل می‌شود (مثلاً آیریس و یک کیوریتور نام‌دار) و چه کسی برای کاربر رزرو شده است.

متغیرهای مدل و عیب‌یابی

رفتار مدل‌ها متفاوت است. تست‌های انجام شده روی مدل Crushon Carina — Filtered — 8K در ۱۰ سپتامبر ۲۰۲۶ نشان داد که در حالی که عاملیت کاربر حفظ شده بود (مثلاً: «او دستش را دراز می‌کند و منتظر می‌ماند ببیند کدام مسیر را انتخاب می‌کنید»)، مدل همچنان با محدودیت‌های طول متن و تداوم واقعیت‌ها مشکل دارد. این موضوع یادآور چالش‌های مدیریت حافظه در مدل‌های زبانی است که پروتکل MCP سعی دارد با جایگزینی سوابق خارجی آن‌ها را برطرف کند. این ثابت می‌کند که کنترل عاملیت، بعدی مجزا از کیفیت کلی مدل است.

علائم رایج عیب‌یابی:

  • اولین پاسخ هر دو طرف را می‌نویسد: پیام آغازین و دیالوگ‌های نمونه را چک کنید؛ یک نوبت اختراعی بازدیدکننده را حذف کنید.
  • احساسات را تصمیم می‌گیرد اما دیالوگ را نه: مطمئن شوید قانون صریحاً به احساسات و تصمیمات اشاره کرده است.
  • بعد از یک عمل ارائه شده، عمل اضافی می‌افزاید: بررسی کنید عمل ارائه شده کجا تمام می‌شود؛ از مدل بخواهید بدون گسترش آن پاسخ دهد.
  • تا زمان گفتن «ادامه بده» کار می‌کند: ادامه مبهم و تاریخچه اخیر را چک کنید؛ مشخص کنید کدام عمل محیطی می‌تواند ادامه یابد.
  • شخصیت بی‌تأثیر (Inert) می‌شود: مطمئن شوید تمام اشکال ابتکار عمل ممنوع نشده‌اند؛ اجازه پیشنهاد دادن و سوال پرسیدن را بدهید.

ملاحظات نهایی

استفاده از روایت سوم‌شخص به‌تنهایی مشکل را حل نمی‌کند، زیرا جمله «بازدیدکننده موافقت می‌کند» همچنان تصمیمی است که توسط هوش مصنوعی گرفته شده است. به همین ترتیب، پرامپت‌های طولانی‌تر تضمین‌کننده کنترل بهتر نیستند و ممکن است دستورات متضاد ایجاد کنند. اگر نمی‌توانید شخصیت ساخته شده توسط شخص دیگری را ویرایش کنید، از دستورات سطح چت یا اصلاحات OOC استفاده کنید، زیرا این‌ها تعریف زیربنایی را بازنویسی نمی‌کنند.

برای اجرای این موارد امروز، یک شخصیت خصوصی در CrushOn بسازید. طنز خشک و کنجکاوی آیریس را حفظ کنید، اما روایتی را که نوبت شما را می‌گیرد حذف کنید. برای کسانی که ترجیح می‌دهند ورودی‌ها را قبل از وارد کردن سازماندهی کنند، کارگاه شخصیت Hugging Face به‌عنوان یک کاربرگ دستی عمل می‌کند. هدف، شخصیتی است که لحظه را جالب کند، در حالی که بخش مربوط به شما را برای خودتان باقی بگذارد.

چرا این موضوع مهم است؟

این چارچوب با تکیه بر تجربه عملی در مدیریت مدل‌های مولد، استانداردی برای حفظ عاملیت کاربر در سیستم‌های تعاملی ایجاد می‌کند. اعتبار این روش در تفکیک دقیق ابعاد رفتاری (گفتار، عمل، احساس) نهفته است که از توهمات مدل در مورد وضعیت کاربر می‌کاهد.

تأثیر برای ایران

این راهنما برای توسعه‌دهندگان ایرانی که روی چت‌بات‌های نقش‌آفرینی یا دستیارهای شخصی متمرکز هستند، یک دستورالعمل کاربردی برای بهبود تجربه کاربری (UX) است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «ممنوعیت» با «سیستم اجازه» در مهندسی پرامپت، یک چرخش از رویکرد واکنشی به رویکرد ساختاری است. این متد نشان می‌دهد که در مدل‌های نقش‌آفرینی، داده‌های نمونه‌ای (Few-shot) قدرت بسیار بیشتری نسبت به دستورات سیستمی دارند و هرگونه تضاد در پیام آغازین، عملاً تمام قوانین بعدی را خنثی می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.