پرش به محتوای اصلی
پرش به محتوای مقاله

کاربران Verdict Buddy: دقت فنی بر همدلی در میانجی‌گری هوش مصنوعی پیشتاست

·۴ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
هوش مصنوعی واسطه‌گری با رویکرد گاتمن، EFT و NVC — Verdict Buddy از Inithouse، امتیاز ۴.۹ از ۵ (۲۹۰ ارزیابی)
هوش مصنوعی واسطه‌گری با رویکرد گاتمن، EFT و NVC — Verdict Buddy از Inithouse، امتیاز ۴.۹ از ۵ (۲۹۰ ارزیابی)
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل همدلی (Empathy) با دقت فنی (Technical Precision) در لایه خروجی؛ یافته‌ای که نشان می‌دهد در ابزارهای تحلیل تضاد، نام‌گذاری دقیق الگوهای رفتاری بسیار ارزشمندتر از جملات حمایتی است.

تصور کنید یک متخصص روان‌شناسی بالینی را در کالبد یک مدل زبانی قرار دهید تا به‌جای توصیه‌های کلی، دقیقاً ریشهٔ دعوای شما و شریکتان را کالبدشکافی کند. این دقیقاً همان مسیری است که Inithouse برای رسیدن به یکی از موفق‌ترین مدل‌های میانجی‌گر هوش مصنوعی طی کرده است. در حالی که استدلال کلی مدل‌های زبانی بزرگ (LLM) به عنوان استاندارد شناخته می‌شود، یک زنجیره پرامپت تخصصی مبتنی بر روان‌شناسی بالینی در حل اختلافات بسیار مؤثرتر عمل می‌کند.

به نقل از گزارش منتشرشده در ۲۶ جولای ۲۰۲۶، ابزار Verdict Buddy توانسته است میانگین امتیاز ۴.۹ از ۵ را در ۲۹۰ مورد داوری کاربر به دست آورد. تفاوت اصلی این ابزار در این است که تخصص دامنه را مستقیماً در معماری خود کدگذاری کرده و به‌جای تکیه بر شهود خام مدل، از یک ساختار لایه‌بندی شده استفاده می‌کند.

بسیاری از ابزارهای فعلی، تضادها را از یک زاویهٔ واحد می‌بینند و توصیه‌های سطحی می‌دهند. اما Inithouse با تضادها مثل یک مسئلهٔ داده‌ای ساختاریافته برخورد می‌کند. آن‌ها اختلافات را به‌جای تکیه بر حدس مدل، از طریق توالی چهار لایه مورد تأیید پژوهشی نقشه‌برداری می‌کنند. تیم توسعه متوجه شد که امتیازات بالای کاربران نتیجه مستقیم این موضوع است که تحلیل تضادها بسیار «سzczegرا» و دقیق به نظر می‌رسید؛ امری که مستقیماً حاصل چارچوب‌های روان‌شناسی کدگذاری شده در معماری پرامپت‌ها بود. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، هرچه ساختار ورودی دقیق‌تر باشد، خروجی مدل از حالت «حدس زدن» خارج شده و به «تحلیل» نزدیک می‌شود.

این سیستم از یک مدل زبانی بزرگ (LLM) استفاده می‌کند، اما فرآیند استدلال را در چهار لایه می‌بندد تا از علائم سطحی به سمت نیازهای زیربنایی حرکت کند:

  • چهار سوار گاتمن (Gottman’s Four Horsemen): این لایه برای شناسایی الگوهای ارتباطی مخرب طراحی شده است. پرامپت به‌طور ویژه مواردی چون تحقیر، انتقاد، تدافع و دیوارکشی (Stonewalling) را بررسی می‌کند. هنگامی که این الگوها شناسایی شوند، حکم نهایی نام الگوی مربوطه را ذکر کرده و توضیح می‌دهد که چگونه این رفتار در طول زمان اعتماد را تخریب می‌کند. طبق مستندات این شرکت، ۶۰٪ تضادهای عاطفی تنها با همین لایه شناسایی و مدیریت می‌شوند.
  • درمان متمرکز بر هیجان (EFT): این بخش دینامیک دلبستگی را نقشه‌برداری می‌کند. این لایه چرخه «تعقیب-عقب‌نشینی» (pursue-withdraw) را شناسایی کرده و استدلال‌های سطحی (مثلاً بحث بر سر اینکه چه کسی ظرف‌ها را نشسته) را به تنش‌های واقعی، مانند احساس نادیده گرفته شدن یا نیازهای دلبستگی برآورده نشده، بازتعریف می‌کند.
  • پروژه مذاکره هاروارد (Harvard Negotiation Project): این لایه مذاکره بر پایه منافع را فراهم می‌کند. پرامپت تمایز میان «موضع» (مثلاً: می‌خواهم ساعت ۷ خانه باشی) و «منافع» (مثلاً: نیاز دارم حس کنم اولویت تو هستم) را کدگذاری می‌کند و گزینه‌هایی پیشنهاد می‌دهد که منافع زیربنایی را ارضا کنند، نه اینکه صرفاً خواسته‌های بیان شده را دیکته کنند.
  • ارتباط بدون خشونت (NVC): این لایه خروجی نهایی حکم را ساختار می‌دهد. به‌جای قضاوت درباره اینکه چه کسی حق دارد، نیازهای ناگفته هر فرد را نقشه‌برداری کرده و گام‌های عملی بعدی را در قالب مشاهدات، احساسات، نیازها و درخواست‌ها پیشنهاد می‌دهد.

مکانیزم کدگذاری در این سیستم به‌گونه‌ای است که هر مرحله از زنجیره، اطلاعات خود را به مرحله بعد منتقل می‌کند تا عمق تحلیل تضمین شود. برای مثال، شناسایی «تحقیر» در لایه گاتمن، به لایه EFT کمک می‌کند تا بفهمد کدام طرف در چرخه «تعقیب-عقب‌نشینی» قرار دارد؛ زیرا تحقیر معمولاً در طرف «تعقیب‌کننده» ظاهر می‌شود. این تحلیل به نوبه خود استخراج منافع را شکل می‌دهد، چرا که منافع طرف «عقب‌نشین‌کننده» معمولاً به‌جای موضوع بحث، بر محور امنیت متمرکز است. در نتیجه، این توالی حکمی تولید می‌کند که به جای درگیر شدن با اختلاف سطحی، به الگوی ساختاری تضاد می‌پردازد.

بر اساس گزارش Inithouse، این توالی حیاتی است. نسخه‌های اولیه سیستم، لایه EFT را قبل از گاتمن اجرا می‌کردند. این موضوع باعث شد هوش مصنوعی دینامیک دلبستگی را بیش از حد به تضادهایی نسبت دهد که در واقع مربوط به نقض مرزهای شخصی بودند. تغییر ترتیب و شناسایی ابتدا الگوهای مخرب و سپس بررسی دلبستگی، باعث شد نتایج برای کاربران بسیار واقع‌بینانه‌تر و grounded به نظر برسد.

این ابزار در سه حالت «تک‌نفره» (Solo)، «زوج» (Couple) و «گروهی» (Group) کار می‌کند. معماری پرامپت در هر سه حالت یکسان است تا از بروز باگ‌های واگرایی جلوگیری شود؛ به این ترتیب هر بهبود در کدگذاری چارچوب‌ها، به تمام حالت‌ها منتقل می‌شود. تفاوت‌ها تنها در نحوه قاب‌بندی (Framing) است:

  • تک‌نفره: تنها یک دیدگاه ارائه می‌شود. حکم برای جبران این نقص، موضع احتمالی طرف غایب را به‌طور صریح مدل‌سازی می‌کند.
  • زوج: هر دو دیدگاه ارسال می‌شود. حکم برای بررسی سازگاری، دو روایت را با یکدیگر تطبیق داده و تناقض‌ها را علامت‌گذاری می‌کند.
  • گروهی: چندین طرف درگیر هستند. در این حالت، وزن لایه هاروارد بیشتر می‌شود، زیرا تضادهای گروهی اغلب بیشتر بر پایه منافع هستند تا دلبستگی‌های عاطفی.

داده‌های حاصل از ۲۹۰ امتیاز اول، بینش‌های غافلگیرکننده‌ای درباره جمعیت کاربران ارائه داد. در حالی که تضادهای عاطفی و رابطه پیشتاز بودند، اختلافات هم‌اتاق (Roommate disputes) به دومین دسته بزرگ تبدیل شدند و از تضادهای محیط کار پیشی گرفتند. اختلافات هم‌اتاق‌ها بر فضای مشترک و تخصیص منابع متمرکز است و به همین دلیل، لایه هاروارد در مدیریت آن‌ها موفق‌تر از لایه‌های گاتمن یا EFT (که برای پیوندهای عاطفی ساخته شده‌اند) عمل می‌کند.

یک یافته ضدشهودی این است که کاربران «دقت فنی» را به زبان‌های «نرم و همدلانه» ترجیح می‌دهند. امتیازها زمانی بهبود یافت که هوش مصنوعی به‌جای ارائه اطمینان‌بخشی‌های ملایم، صریحاً نام الگوی رفتاری را ذکر می‌کرد؛ مثلاً: «چرخه تعقیب-عقب‌نشینی با محرک تحقیر در مرحله تشدید». کاربران می‌خواهند دقیقاً بدانند چه اتفاقی در حال رخ دادن است.

با این حال، سیستم هنوز نقص‌هایی دارد. «امتیاز تنش» (Tension Score) که بازه‌ای بین ۰ تا ۱۰۰ دارد، در حال حاضر برای اکثر کاربرها بین ۴۵ تا ۶۵ متمرکز شده و قدرت تفکیک پایینی دارد. این اتفاق به این دلیل افتاد که کالیبراسیون این امتیاز بر اساس موارد تست داخلی انجام شده بود، نه داده‌های واقعی کاربران. Inithouse اکنون در حال بازنگری این کالیبراسیون بر اساس توزیع ۲۹۰ حکم امتیازگذاری شده است.

علاوه بر این، تیم توسعه تفاوت‌های فرهنگی را دست‌کم گرفته بود. خروجی‌های NVC در حالی که در بافت‌های فردگرای غربی مانند آمریکا و اروپای غربی مؤثر است، برای کاربرانی که از فرهنگ‌های ارتباطی «بافت-بالا» (High-Context) می‌آیند، بیش از حد مستقیم و خشک به نظر می‌رسد و این موضوع همچنان یک چالش حل‌نشده است.

این آزمایش ثابت می‌کند که برای مسائل تخصصی و محدود، کدگذاری دانش دامنه در زنجیره پرامپت‌ها بسیار موثرتر از تنظیم دقیق (Fine-tuning) یا استفاده از تولید بازیابی‌افزا (RAG) است. دلیل این امر آن است که چارچوب‌های روان‌شناسی مانند درخت‌های تصمیم عمل می‌کنند (شناسایی الگو $
ightarrow$ طبقه‌بندی $
ightarrow$ پاسخ)، بنابراین به‌طور طبیعی با توالی پرامپت‌ها سازگار هستند.

گام بعدی شما

  • اگر برنامه‌نویس هستید، به‌جای نوشتن پرامپت‌های بلند، سعی کنید فرآیند استدلال مدل را به لایه‌های تخصصی (Domain-specific layers) تقسیم کنید.
  • برای تحلیل تضادها در تیم، از مدلِ تفکیک «موضع» و «منفعت» (رویکرد هاروارد) در پرامپت‌های خود استفاده کنید.
  • بررسی کنید که آیا مدل شما در مواجهه با کاربر، بیش از حد «همدلانه» است یا «دقیق»؛ احتمالاً کاربران شما هم دقت فنی را ترجیح می‌دهند.

اما تأثیر این رویکرد بر کاهش هزینه‌های استنتاج در مقیاس بالا، بحث دیگری است که در تحلیل بعدی ما درباره بهینه‌سازی توکن‌ها بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار چارچوب‌های علمی (مانند هاروارد و گاتمن)، استدلال مدل را از حالت احتمالی به حالت ساختاریافته تبدیل می‌کند. این یعنی مدل‌های عمومی می‌توانند با مهندسی دقیق، در حوزه‌های حساس مثل روان‌شناسی و حقوق، عملکردی نزدیک به متخصصان انسانی داشته باشند.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که قصد ساخت ابزارهای تخصصی (مانند دستیارهای حقوقی یا روان‌شناختی) را دارند، یک الگوی جایگزین برای Fine-tuning است که هزینه و زمان کمتری می‌طلبد.

·نگاه ما
تحریریه دات‌هوش

این مورد ثابت می‌کند که «مهندسی دانش» در لایه پرامپت، جایگزینی قدرتمند برای آموزش مجدد مدل است. در واقع، تبدیل چارچوب‌های روان‌شناسی به درخت‌های تصمیم برای مدل، دقت را به شدت بالا می‌برد. نکته کلیدی این است که کاربر نهایی در ابزارهای تخصصی، «صراحت فنی» را به «همدلی مصنوعی» ترجیح می‌دهد و این یک تغییر دیدگاه در طراحی تجربه کاربری (UX) برای هوش مصنوعی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.