پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های Xinxu Cloud Brain تشخیص احساسات را به جای تشخیص، فرضیه می‌کنند

·۲۹ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
سیستم چندوجهی احساسات هوش مصنوعی مغز ابری Xinxu: معماری یکپارچه پردازش احساسات مبتنی بر ابر
سیستم چندوجهی احساسات هوش مصنوعی مغز ابری Xinxu: معماری یکپارچه پردازش احساسات مبتنی بر ابر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از مدل‌های تک-ورودی (End-to-End) به معماری شواهد مجزا که در آن هر مودالیته (صدا، متن، تصویر) وزن متغیری بر اساس کیفیت داده‌های لحظه‌ای دارد.

تصور کنید سیستمی را که به جای اینکه صرفاً به شما بگوید کاربر «غمگین» است، نشان دهد که این غم از چه گام‌هایی استخراج شده است؛ مثلاً ترکیب تُن صدای پایین و کلمات کلیدی خاص، در حالی که صراحتاً اعلام می‌کند ۲۷٪ احتمال خطا وجود دارد. این رویکرد، پایان عصر مدل‌هایی است که احساسات پیچیده انسانی را در یک دسته‌بندی ساده و قطعی می‌گنجاندند.

طبق راهنمای فنی منتشر شده در ۲۰ اوت ۲۰۲۶، Xinxu Cloud Brain AI محدودیت‌های مدل‌های فعلی را با تبدیل نشانه‌های احساسی به «فرضیات مبتنی بر شواهد» حل کرده است. اکثر مدل‌های فعلی تلاش می‌کنند تمام ورودی‌ها را در یک مدل بزرگ بچپانند و اغلب تفاوت میان «حالت خنثی» و «کمبود شواهد» را نادیده می‌گیرند. Xinxu هدف را از تشخیص روان‌شناختی به فرضیه‌سازی تغییر داده تا تفسیر نهایی بر عهده کاربر باقی بماند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و شفافیت مدل‌های زبانی اشاره کردیم، حذف توهمات (Hallucination) — شبیه به دوستی که خاطره‌ای را اشتباه تعریف می‌کند — تنها از طریق پذیرش عدم‌قطعیت ممکن است. در این سامانه، شفافیت باعث می‌شود هوش مصنوعی در جایی که داده‌ها متناقض یا ناقص هستند، از حدس زدن خودداری کند. این رویکرد به نوعی پاسخ به چالش‌های مربوط به شفافیت در زنجیره تفکر مدل‌های پیشرو است که پیش‌تر بررسی کرده بودیم.

معماری شواهد سه‌شاخه

به نقل از گزارش dev.to، این سیستم از مدل‌های بینایی-زبانی (VLM) — مدلی که هم‌زمان متن، عکس و صدا را می‌فهمد، مثل ما که با چند حس دنیا را می‌خوانیم — به دلیل حذف داده‌های خام صوتی و ناتوانی در درک مرزهای فرهنگی، دوری می‌کند. در عوض، Xinxu از سه رمزگذار (Encoder) اختصاصی استفاده می‌کند:

  • رمزگذار متن: معناشناسی، نفی، کنایه و تاریخچه گفتگو را پردازش می‌کند. این بخش، متن‌های تبدیل‌شده از گفتار را از متن‌های نوشتاری جدا می‌کند تا متاداده‌هایی مثل برچسب‌های زمانی حفظ شوند.
  • رمزگذار گفتار: گام، انرژی، نرخ بیان، مکث‌ها و کیفیت صدا را تحلیل می‌کند. این سامانه از تبدیل گفتار به متن صرف پرهیز می‌کند، زیرا بار احساسی اصلی در ویژگی‌های آکوستیک است. اگر کیفیت صدا پایین باشد، وزن این شاخه در تصمیم نهایی به‌طور خودکار کاهش می‌یابد.
  • رمزگذار بینایی: تحلیل نقاشی‌ها از طریق رنگ، خط و ترکیب‌بندی است. این مدل از نگاشت‌های جهانی (مثلاً اینکه رنگ سیاه لزوماً به معنای غم است) دوری می‌کند و برای ردیابی مسیر خطوط، نیاز به رضایت صریح کاربر دارد.

منطق تلفیق و عدم‌قطعیت

برای ترکیب این جریان‌ها، Xinxu از آداپتور (Adapter) — لایه‌های سازگارسازی که خروجی‌های مختلف را به یک زبان مشترک تبدیل می‌کنند — استفاده می‌کند. در اینجا یک ترنسفورمر (Transformer) چندوجهی یا تلفیق گیت‌دار، داده‌ها را ترکیب می‌کند. مدل‌های VLM در این ساختار تنها به عنوان معلم یا تولیدکننده توضیح به کار می‌روند، نه تصمیم‌گیرنده نهایی. این ساختار پیچیده از مدیریت استنتاج چندوجهی یکپارچه بهره می‌برد تا ورودی‌های متنوع را به شکلی بهینه پردازش کند.

این سیستم برای «مودالیته‌های مفقود» طراحی شده است؛ یعنی اگر کاربر صدا را غیرفعال کند یا تصویری آسیب‌دیده بفرستد، مدل از طریق تکنیک دراپ‌اوت (Dropout) — شبیه به تمرین دادن ورزشکار با حذف یکی از اعضای بدن برای تقویت بقیه — در زمان آموزش، یاد گرفته است که با نبود یک منبع، باز هم پاسخ دهد.

مکانیسم‌های خروجی دقیق

خروجی این سیستم به جای یک برچسب ساده، یک شیء پیچیده است که شامل احتمالات چندبرچسبی، میزان تحریک (Arousal) و کالیبراسیون عدم‌قطعیت است. برای مثال، خروجی ممکن است چنین باشد:

  • احساسات: غم (۰.۶۸)، اضطراب (۰.۳۱)
  • عدم‌قطعیت: ۰.۲۷
  • تصمیم: «درخواست تأیید از کاربر»

شدت احساسات توسط یک لایه رگرسیون (Regression) — روشی ریاضی برای پیش‌بینی اعداد دقیق به جای دسته‌بندی‌های کلی — محاسبه می‌شود تا قدرت احساسات بر پایه ریاضی باشد، نه حدس‌های یک مدل زبانی.

یکپارچگی داده‌ها و آموزش

آموزش در مراحل شواهد-محور انجام می‌شود. ابتدا خطوط پایه برای هر شاخه (متن، صدا، تصویر) ساخته شده و سپس با استفاده از لورا (LoRA) — روشی برای تنظیم سریع مدل بدون تغییر تمام پارامترها — لایه‌های تلفیق آموزش می‌بینند.

در مورد برچسب‌گذاری، Xinxu بر گزارش‌های خودِ کاربر اولویت می‌دهد تا تحلیل‌های ناظر خارجی. آن‌ها معتقدند ناظران تنها «تفسیر» خود از یک چهره را می‌گویند، نه آنچه فرد واقعاً حس می‌کند. همچنین برای جلوگیری از نشت داده (Data Leakage)، داده‌های یک کاربر هرگز هم‌زمان در مجموعه آموزش و آزمون قرار نمی‌گیرند.

مرزهای ایمنی و نظارتی

به دلیل حساسیت داده‌های بیومتریک، سیستم از رمزنگاری شدید و دوره‌های کوتاه نگهداری داده استفاده می‌کند. طبق استانداردهای EU AI Act، این ابزار به‌طور صریح برای تصمیمات حساس در استخدام، آموزش، بیمه یا اجرای قانون ممنوع شده است.

برای ایمنی بحرانی، سیستم برای تشخیص آسیب به خود (Self-harm) به برچسب‌های احساسی تکیه نمی‌کند، بلکه یک مسیر ایمنی مجزا دارد که در صورت تشخیص خطر، فوراً کاربر را به خدمات اضطراری ارجاع می‌دهد.

نظارت و استقرار

ارزیابی سیستم فراتر از صحت (Accuracy) است و معیارهایی مثل Confusion Matrix — جدولی که نشان می‌دهد مدل چه احساساتی را با هم اشتباه گرفته است — را گزارش می‌کند. در زمان سرویس‌دهی، یک لایه سیاست‌گذاری سخت‌گیرانه اعمال می‌شود: بررسی رضایت $ \rightarrow $ پیش‌پردازش کیفیت $ \rightarrow $ رمزگذاری موازی $ \rightarrow $ کالیبراسیون $ \rightarrow $ تأیید کاربر.

این تغییر معماری یعنی سیستم می‌تواند «به‌طور ایمن تخریب شود». وقتی سیگنال‌ها با هم در تضاد هستند، مدل به جای حدس زدن، امتیاز اطمینان را پایین می‌آورد و از کاربر می‌پرسد: «آیا منظور شما این بود؟»

گام بعدی شما

  • اگر توسعه‌دهنده هستید، معماری «تلفیق شواهد» را برای جایگزینی با طبقه‌بندی‌های Softmax در پروژه‌های خود بررسی کنید.
  • در طراحی سیستم‌های AI، به جای خروجی قطعی، فیلد «عدم‌قطعیت» (Uncertainty) را به رابط کاربری اضافه کنید.
  • مستندات EU AI Act را برای درک محدودیت‌های قانونی استخراج احساسات در محیط کار مطالعه کنید.

اما چالش اصلی در این مسیر، تأمین سخت‌افزاری برای پردازش موازی سه رمزگذار سنگین است — به تحلیل ما درباره بهینه‌سازی استنتاج در لبه مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با تکیه بر تخصص در کالیبراسیون عدم‌قطعیت، ریسک توهمات احساسی را کاهش می‌دهد. اعتبار این سیستم در این است که به جای ادعای خواندن ذهن، شواهد متناقض را به کاربر گزارش می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و حساسیت داده‌های بیومتریک، استقرار مستقیم این مدل در ایران دشوار است، اما معماری «تلفیق شواهد» برای پژوهشگران داخلی در حوزه پردازش زبان فارسی و تحلیل احساسات کاربردی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «تشخیص» با «فرضیه‌سازی» در Xinxu، یک چرخش فلسفی در طراحی AI است. این رویکرد پذیرفته است که مدل هرگز به حقیقت درونی انسان دست نمی‌یابد و در نتیجه، شفافیت در مورد «نادانی مدل» را به دقتِ ظاهری ترجیح می‌دهد. این مدل می‌تواند الگویی برای کاهش مسئولیت حقوقی شرکت‌های AI در تحلیل‌های روان‌شناختی باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.