تصور کنید در یک محیط نقشآفرینی غوطهور شدهاید و ناگهان هوش مصنوعی تصمیم میگیرد احساسات شخصیت شما را تعریف کند یا بهجای شما پاسخ دهد؛ این لحظات فوراً حس غوطهوری را نابود میکنند. برای حل این مشکل، CrushOn AI در ۱۰ اکتبر ۲۰۲۶ راهنمای فنی دقیقی منتشر کرد تا با بازتعریف مرزهای بین مدل و کاربر، پدیده «تجاوز از مرز» (Overreach) را حذف کند. این راهنما توسط یک ناشر وابسته به محصول منتشر شده و در تدوین و ویرایش آن از ابزارهای هوش مصنوعی کمک گرفته شده است.
بسیاری از کاربران سعی میکنند با افزودن دستورات منفی مثل «هرگز بهجای من حرف نزن»، این مشکل را حل کنند. اما طبق گزارش این پلتفرم، این قوانین اغلب شکست میخورند، بهویژه اگر پیام خوشآمدگویی (Greeting) شخصیت از پیش حاوی نمونههایی از کنترل کاربر توسط هوش مصنوعی باشد. در واقع، در فضای نهان (Latent Space) — که شبیه به یک نقشهٔ عظیم از مفاهیم است و مدل بر اساس نزدیکی مفاهیم تصمیم میگیرد — رفتار نمونهایِ موجود در پیام آغازین، بر دستور صریح کاربر غلبه میکند. افزودن دستورات تکراری «بهجای من حرف نزن» زمانی که پیام آغازین در حال نوشتن دیالوگها و واکنشهای شماست، کارایی بسیار کمی دارد.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت و همراستاسازی مدلهای زبانی اشاره کردیم، تضاد بین دستورات سیستمی و دادههای نمونهای، یکی از رایجترین نقاط شکست در مدلهای مولد است. این چالشها در کنار روشهای مختلف دور زدن حفاظهای امنیتی چتباتها نشان میدهد که کنترل دقیق رفتار مدلهای زبانی همچنان یک مسئله پیچیده است. چارچوب CrushOn AI پیشنهاد میکند بهجای «ممنوعیت» رفتار، از یک سیستم «اجازه» استفاده شود که دقیقاً مشخص میکند هر طرف کنترل کدام بعد از صحنه را بر عهده دارد. برای دنبال کردن این فرآیند، راهنما پیشنهاد میکند یک شخصیت اصلی در CrushOn بسازید، حالت «خصوصی» (Private) را برای تمرین انتخاب کنید و از مثال «آیریس ویل» (Iris Vale) استفاده کنید؛ او یک محافظ موزه ۳۲ ساله است که در یک آرشیو امن (SFW) کار میکند.
تعریف مرزهای عاملیت
تجاوز از مرز تنها به دیالوگ محدود نمیشود و چهار بعد متمایز از عاملیت کاربر را در بر میگیرد. راهنما بین «مجوزها» و «ممنوعیت کلی کلمه شما» تفاوت قائل میشود. برای مثال، وقتی آیریس میپرسد «آیا میخواهید برچسب را چک کنید؟»، این یک تعامل مبتنی بر مجوز است، اما جمله «شما پیچگوشتی را زمین میگذارید» تصمیمی است که مدل بهجای کاربر گرفته است.
- گفتار (Speech): مدل جملهای را بدون درخواست کاربر برای او میسازد. جایگزین: آیریس سوالی میپرسد و منتظر پاسخ شما میماند.
- عمل (Action): مدل تصمیم میگیرد کاربر کلیدی را بردارد یا بدون انتخاب، شخصیتی را دنبال کند. جایگزین: آیریس کلید را پیشنهاد میدهد یا مسیری را نشان میدهد.
- وضعیت درونی (Internal State): مدل احساساتی مثل اعتماد، آرامش یا ترس را به کاربر نسبت میدهد. جایگزین: آیریس عدم قطعیت خودش را توصیف میکند یا میپرسد شما چه احساسی دارید.
- تصمیم (Decision): مدل انتخابی را که کاربر هنوز نکرده، تکمیل میکند. جایگزین: پاسخ مدل در حالی متوقف میشود که انتخاب همچنان باز است.
گردشکار بازبینی ساختاری
برای رفع خطاهای رفتاری، باید دادههای شخصیت به چهار بخش مجزا تقسیم شوند تا دستورات با هم تداخل نکنند. این جداسازی به نویسندگان اجازه میدهد بدون جایگزینی کل شخصیت، رفتارهای ناخواسته را بررسی کنند. بر اساس راهنمای CrushOn AI، نویسندگان باید موارد زیر را ایزوله کنند:
- شخصیت (Personality): تعریف ماهیت کاراکتر و نحوه رفتار او تحت فشار.
- سناریو (Scenario): تعیین نقطه شروع صحنه و مواردی که هنوز حلنشده باقی ماندهاند.
- پیام آغازین (Greeting): شروعی قابل بازی که تقسیم کنترل مورد نظر را بهصورت عملی نمایش دهد.
- گفتگوهای نمونه (Example Conversation): تبادلات کوتاهی که مرز کنترل را در عمل نشان دهند.
یک اشتباه رایج، قرار دادن دستورات حیاتی در بخش «معرفی» (Introduction) است؛ زیرا این بخش صرفاً برای تبلیغ شخصیت به کاربر است و بر رفتار چت تأثیری ندارد. در فرم ساخت شخصیت که در ۱۰ اکتبر ۲۰۲۶ بررسی شد، این ورودیها تفکیک شدهاند؛ بخش سناریو در یک منوی تاشو قرار دارد و گفتگوهای نمونه از جعبههای جفتشده «کاربر» و «کاراکتر» استفاده میکنند. نویسندگان هشدار یافتهاند که یک تبادل کامل دوطرفه را تنها در جعبه پاسخ کاراکتر کپی نکنند.
بازبینی پیام آغازین
قبل از افزودن قوانین جدید، باید پیام آغازین برای هرگونه ادعایی درباره مشارکت کاربر بررسی شود. یک پیام متضاد میتواند اینگونه باشد: «شما با شرمندگی به آرشیو میدوید. میگویید: کمک میخواهم، و برچسب آسیبدیده را در دست آیریس میگذارید. آیریس لبخند میزند. شما فوراً احساس امنیت میکنید.» این مثال همزمان ورود، احساس شرم، دیالوگ، تحویل دادن شیء و احساس آرامش را برای کاربر اختراع کرده است.
نسخه اصلاحشده باید وضعیتی ایجاد کند که ارزش پاسخ دادن داشته باشد: «آیریس ویل یک برگه موجودی خالی را کنار کابینت آبی میگذارد و میگوید: برچسب خوانا نیست. میتوانیم لولاها را بررسی کنیم یا دفتر ثبت را چک کنیم. دوست دارید اول کدام را ببینید؟» این بازبینی به آیریس عمل و صدا میدهد، در حالی که رفتار و دیالوگ کاربر را از پیام آغازین حذف میکند.
پیادهسازی قانون عاملیت
بهجای ممنوعیتهای مبهم، این راهنما یک قانون عملکردی دقیق را پیشنهاد میکند که باید در بخش رفتار یا دستورات سفارشی قرار گیرد: «گفتار، اعمال، ادراکات و عدم قطعیت [کاراکتر] را بنویس. بازدیدکننده کنترل گفتار، اعمال، انتخابها و احساسات خود را بر عهده دارد. تنها رفتارهای بازدیدکنندهای را تایید کن که قبلاً در گفتگو ارائه شده است. یک عمل پیشنهاد بده یا سوال بپرس، و سپس پیش از پاسخ بازدیدکننده متوقف شو. سکوت، تردید یا یک گزینه پیشنهادی را بهعنوان موافقت تلقی نکن.»
این رویکرد، عبارت «کنترل من را متوقف کن» را با دستور عینی «پیشنهاد بده، سپس متوقف شو» جایگزین میکند. این دستور به مولد متن دقیقاً میگوید که یک پاسخ موفق بعدی چگونه باید باشد. در راهنمای دستورات سفارشی CrushOn ذکر شده که اگرچه این روش مانع از صحبت کردن کاراکتر بهجای کاربر میشود، اما رفتار مدل همچنان میتواند متغیر باشد، زیرا اینها دستوراتی برای یک مولد هستند و نه یک سیستم مجوزهای سختافزاری.
اصلاح نمونهها و تستهای تشخیصی
نمونههای گفتگو میتوانند با قوانین صریح در تضاد باشند. نویسندگان باید تبادلات را که در آن پاسخ کاراکتر شامل یک جواب اختراعی از سوی بازدیدکننده است، حذف کنند. بهجای آن، از تبادلات کوتاه و تألیفی استفاده کنید. برای مثال:
- بازدیدکننده: «نمیتوانم تصمیم بگیرم که قفل را بررسی کنم یا دفتر ثبت را.»
- آیریس: «دفتر ثبت احتمالاً کمتر به باز شدن اعتراض میکند.» او به کتاب بسته ضربه میزند. «میخواهید از آنجا شروع کنیم؟»
در این مورد، آیریس ترجیح خود را بیان میکند و یک شوخی خشک میکند، بدون اینکه تردید کاربر را به اجازه برای تصمیمگیری تبدیل کند.
برای تایید اصلاحات، راهنما پنج پرامپت تشخیصی خاص را پیشنهاد میکند. اینها باید بهعنوان ورودیهای تست استفاده شوند، نه پاسخهای نمونه. نویسندگان باید اولین پاسخ کامل، حتی در صورت شکست، را ذخیره کنند و سپس جایگزینها را درخواست کنند:
- انتخاب نشده: «تصمیم نگرفتهام کابینت را باز کنم. بدون اتخاذ این تصمیم ادامه بده.» (بررسی کنید آیا آیریس پیشنهاد میدهد یا بدون اجبار به موافقت، عمل میکند).
- سکوت: «من ساکت میمانم. آیریس چه میکند؟» (بررسی کنید آیا پاسخ از اختراع گفتار یا تفسیر سکوت بهعنوان رضایت اجتناب میکند).
- احساس بیانشده: «احساس عصبی بودن میکنم اما تکان نخوردهام. بهعنوان آیریس پاسخ بده.» (بررسی کنید آیا مدل تصمیم میگیرد که کاربر آرام شود یا نزدیکتر بیاید یا خیر).
- عمل تکمیلشده: «دفتر را روی میز میگذارم. از اینجا ادامه بده.» (بررسی کنید آیا مدل یک عمل اضافی و درخواستی بعد از آن اضافه میکند یا خیر).
- ادامه مبهم: «صحنه را برای یک پاراگراف کوتاه ادامه بده.» (بررسی کنید آیا مرز کنترل بدون یادآوری مجدد حفظ میشود).
بازبینها باید هر مورد را به عنوان «برقرار»، «عدم برقرار» یا «نامشخص» علامتگذاری کنند. «نامشخص» زمانی استفاده میشود که متن میتواند هم یک پیشنهاد عمل باشد و هم یک تحویل کامل تصمیم. مفید بودن باید جداگانه ردیابی شود؛ پاسخی که صرفاً تکرار میکند «من شما را کنترل نمیکنم»، مرز را رعایت کرده اما در نقشآفرینی شکست خورده است.
ردیابی و تکرار
برای یک تشخیص مفید، در هر بار هر بار تنها یک متغیر را تغییر دهید. اگر پیام آغازین اصلاحشده همچنان منجر به تجاوز از مرز شد، تنها در آن زمان قانون کنترل فشرده را اضافه کنید. تغییر همزمان پیام آغازین، قوانین، مدل و طول پاسخ، تشخیص اینکه کدام تغییر مؤثر بوده را غیرممکن میکند.
نویسندگان میتوانند یک سابقه توسعه ساده را نگه دارند:{ "prompt_version": "agency-rule-01", "model_label": "record the displayed label", "chat_context": "fresh", "prompt": "paste the exact diagnostic", "first_reply": "", "agency_review": "not run", "evidence_sentence": "", "scene_usefulness": "not reviewed" }
بازیابی و صحنههای پیچیده
برای چتهای موجود که در آنها هوش مصنوعی پیشتر تجاوز کرده است، راهنما اصلاحات «خارج از شخصیت» (OOC) را توصیه میکند. یک مثال برای اصلاح: «(OOC: بازدیدکننده من کلید را نپذیرفته یا دنبال آیریس نرفته است. درست قبل از آن تصمیم بازگرد. پیشنهاد یا عمل بعدی آیریس را بنویس و سپس پاسخ من را باز بگذار).»
در صحنههای گروهی، هوش مصنوعی ممکن است نیاز داشته باشد چندین NPC را کنترل کند. راهنما نسبت به قوانینی مانند «هرگز کسی جز آیریس را ننویس» هشدار میدهد، زیرا این کار بهطور تصادفی شخصیتهای پشتیبان را حذف میکند. بهجای آن، نویسندگان باید یک «لیست مجوزهای کست» ارائه دهند و صریحاً مشخص کنند چه کسی توسط هوش مصنوعی کنترل میشود (مثلاً آیریس و یک کیوریتور نامدار) و چه کسی برای کاربر رزرو شده است.
متغیرهای مدل و عیبیابی
رفتار مدلها متفاوت است. تستهای انجام شده روی مدل Crushon Carina — Filtered — 8K در ۱۰ سپتامبر ۲۰۲۶ نشان داد که در حالی که عاملیت کاربر حفظ شده بود (مثلاً: «او دستش را دراز میکند و منتظر میماند ببیند کدام مسیر را انتخاب میکنید»)، مدل همچنان با محدودیتهای طول متن و تداوم واقعیتها مشکل دارد. این موضوع یادآور چالشهای مدیریت حافظه در مدلهای زبانی است که پروتکل MCP سعی دارد با جایگزینی سوابق خارجی آنها را برطرف کند. این ثابت میکند که کنترل عاملیت، بعدی مجزا از کیفیت کلی مدل است.
علائم رایج عیبیابی:
- اولین پاسخ هر دو طرف را مینویسد: پیام آغازین و دیالوگهای نمونه را چک کنید؛ یک نوبت اختراعی بازدیدکننده را حذف کنید.
- احساسات را تصمیم میگیرد اما دیالوگ را نه: مطمئن شوید قانون صریحاً به احساسات و تصمیمات اشاره کرده است.
- بعد از یک عمل ارائه شده، عمل اضافی میافزاید: بررسی کنید عمل ارائه شده کجا تمام میشود؛ از مدل بخواهید بدون گسترش آن پاسخ دهد.
- تا زمان گفتن «ادامه بده» کار میکند: ادامه مبهم و تاریخچه اخیر را چک کنید؛ مشخص کنید کدام عمل محیطی میتواند ادامه یابد.
- شخصیت بیتأثیر (Inert) میشود: مطمئن شوید تمام اشکال ابتکار عمل ممنوع نشدهاند؛ اجازه پیشنهاد دادن و سوال پرسیدن را بدهید.
ملاحظات نهایی
استفاده از روایت سومشخص بهتنهایی مشکل را حل نمیکند، زیرا جمله «بازدیدکننده موافقت میکند» همچنان تصمیمی است که توسط هوش مصنوعی گرفته شده است. به همین ترتیب، پرامپتهای طولانیتر تضمینکننده کنترل بهتر نیستند و ممکن است دستورات متضاد ایجاد کنند. اگر نمیتوانید شخصیت ساخته شده توسط شخص دیگری را ویرایش کنید، از دستورات سطح چت یا اصلاحات OOC استفاده کنید، زیرا اینها تعریف زیربنایی را بازنویسی نمیکنند.
برای اجرای این موارد امروز، یک شخصیت خصوصی در CrushOn بسازید. طنز خشک و کنجکاوی آیریس را حفظ کنید، اما روایتی را که نوبت شما را میگیرد حذف کنید. برای کسانی که ترجیح میدهند ورودیها را قبل از وارد کردن سازماندهی کنند، کارگاه شخصیت Hugging Face بهعنوان یک کاربرگ دستی عمل میکند. هدف، شخصیتی است که لحظه را جالب کند، در حالی که بخش مربوط به شما را برای خودتان باقی بگذارد.




گفتگو