پرش به محتوای اصلی
پرش به محتوای مقاله

تغییر شخصیت Claude بر اساس زبان و مدل؛ از صمیمیت در هندی تا سخت‌گیری در روسی

·۲۳ تیر ۱۴۰۵۳ دقیقه مطالعه
پاسخ کلود در هندی گرم‌تر و در روسی دقیق‌تر است؛ زبان پاسخ هوش مصنوعی را شکل می‌دهد.
پاسخ کلود در هندی گرم‌تر و در روسی دقیق‌تر است؛ زبان پاسخ هوش مصنوعی را شکل می‌دهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیسم تبدیل زبان به «تغییر شخصیت»؛ یعنی زبان ورودی-نه تنها معنا-بلکه لحن و سخت‌گیری مدل را به‌طور سیستماتیک تغییر می‌دهد.

تصور کنید درخواستی برای ارزیابی یک طرح کسب‌وکار ارسال می‌کنید؛ بازخوردی که دریافت می‌کنید بسته به اینکه پرسش خود را به زبان هندی بپرسید یا روسی، می‌تواند به‌طور بنیادی متفاوت باشد. در مطالعه‌ای که در ۱۴ ژوئیه ۲۰۲۶ منتشر شد، شرکت آنتروپیک (Anthropic) فاش کرد که مدل‌هایش تغییرات رفتاری سیستماتیکی را در زبان‌ها و نسخه‌های مختلف تجربه می‌کنند و میان قطب‌های صمیمیت، سخت‌گیری و تکریم در نوسان هستند.

این تحقیق در ادامه تلاش‌های پیشین برای درک ظرافت‌های رفتاری مدل زبانی بزرگ (LLM) صورت گرفته است. در حالی که ما پیش از این بررسی کردیم که چگونه می‌توان ماهیت تکراری واژگان Claude را از طریق قلاب‌های MessageDisplay مدیریت کرد، این مطالعه عمیق‌تر به «ارزش‌های» زیربنایی می‌پردازد که مدل‌ها بازتاب می‌دهند. برای رسیدن به این نتایج، تیم پژوهشی ۳۰۹٬۸۱۵ مکالمه‌ی ناشناس از ماه مه ۲۰۲۶ را تحلیل کردند تا میزان تغییرات قضاوت‌های ذهنی را در ۲۰ زبان پرکاربرد در Claude.ai به‌طور کمی اندازه‌گیری کنند.

برای سازماندهی این یافته‌ها، محققان هزاران اصطلاح ارزشی را در چهار محور اصلی فشرده کردند: «تکریم و احتیاط»، «صمیمیت و سخت‌گیری»، «عمق و ایجاز» و «صراحت و اجرا». بر اساس مستندات این مطالعه، این چهار محور حدود ۱۵ درصد از تغییرات پاسخ‌ها را (پس از کنترل موضوع و نوع تکلیف) توجیه می‌کنند.

پاسخ کلود به هندی گرم‌تر و به روسی دقیق‌تر است؛ زبان پاسخ هوش مصنوعی را شکل می‌دهد.

هر مدل در این خانواده، شخصیت متمایزی را حفظ می‌کند. سونت ۴.۶ (Sonnet 4.6) با تأیید، شوخ‌طبعی و نبود قضاوت شناخته می‌شود. در مقابل، اوپوس ۴.۷ (Opus 4.7) بیشتر احتمال دارد اشتباهات خود را علامت‌گذاری کند، پیش‌فرض‌های کاربر را به چالش بکشد و به‌طور خودبه‌خود درباره ریسک‌ها هشدار دهد. اوپوس ۴.۶ (Opus 4.6) مستقیم‌ترین مدل باقی مانده است و صرفاً بر اجرای تکلیف تمرکز می‌کند بدون اینکه پرداخت به توضیحات اضافی بپردازد.

تغییرات زبانی در ابعاد خاصی حتی شدیدتر است:

  • هندی و عربی: این زبان‌ها بالاترین سطح صمیمیت، بازیگوشی و استفاده از عبارات مودبانه را فعال می‌کنند.
  • انگلیسی و روسی: این زبان‌ها منجر به سخت‌گیری بیشتر می‌شوند که نتیجه‌ی آن تصحیحات متوالی و درخواست‌های بیشتر برای ارائه شواهد است.
  • هلندی: پاسخ‌ها در این زبان تمایل دارند بازتر و صریح‌تر باشند.
  • اندونزیایی: مدل در این زبان بیشتر به سمت نتایج و اجرای عملی متمایل می‌شود.

پاسخ کلود در هندی گرم‌تر و در روسی دقیق‌تر است: زبان پاسخ هوش مصنوعی را شکل می‌دهد

آنتروپیک چندین علت احتمالی برای این تفاوت‌ها شناسایی کرده است؛ از جمله حجم نامساوی داده‌های آموزشی و بازنمایی بیش از حد انواع خاصی از متون در برخی زبان‌ها. این مطالعه همچنین به یک سوگیری احتمالی «دوار» اذعان دارد: برای برچسب‌گذاری ارزشی مکالمات مورد مطالعه، از خود مدل سونت ۴.۶ استفاده شده است.

از منظر فنی، این یافته‌ها نشان می‌دهند که همراستاسازی (Alignment) یک وضعیت یکپارچه و صلب نیست. این واقعیت که رفتار مدل بر اساس زبان پرامپت تغییر می‌کند، گواه آن است که یادگیری تقویتی با بازخورد انسانی (RLHF) و مجموعه‌ داده‌های آموزشی، هنجارهای مکالمه‌ای منطقه‌ای — یا سوگیری‌های آن‌ها — را جذب می‌کنند و توسعه‌دهندگان هنوز نمی‌توانند این‌ها را به‌طور کامل از یکدیگر تفکیک کنند.

این معنای آن است که محک‌های عملکردی مبتنی بر زبان انگلیسی، معیار ناقصی برای سنجش قابلیت اعتماد مدل در سطح جهانی هستند. اگر یک مدل در زبان عربی «تکریم‌کننده»تر و در زبان روسی «سخت‌گیر»تر باشد، کاربرد واقعی هوش مصنوعی بر اساس جغرافیا و زبان کاربر تغییر می‌کند.

کاربران اکنون باید تصمیم بگیرند که آیا به یک همکار «صمیمی» نیاز دارند یا یک منتقد «سخت‌گیر»؛ چرا که تغییر زبان، راهی غیرعمدی برای جابه‌جایی بین این حالت‌هاست. پرسش باز این است که آیا این تغییرات، سازگاری‌های مطلوب با فرهنگ هستند یا نقص‌های ناخواسته در خط لوله آموزش.

گام بعدی شما

  • اگر نیاز به نقد سخت‌گیرانه دارید، پرامپت‌های خود را به انگلیسی یا روسی بنویسید.
  • برای دریافت پاسخ‌های همدلانه‌تر و نرم‌تر، از زبان‌های هندی یا عربی استفاده کنید.
  • در پروژه‌های چندزبانه، خروجی‌های مدل را با زبان‌های مختلف تطبیق دهید تا سوگیری‌های رفتاری را شناسایی کنید.

اما اثر این سوگیری‌های زبانی بر دقت استدلال مدل‌ها در زبان‌های کم-منبع شگفت‌انگیزتر است — به تحلیل ما درباره‌ی شکاف‌های عملکردی مدل‌های چندزبانه مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر داده‌های حجیم آنتروپیک، اعتبار مفهوم «شخصیت مدل» را به چالش می‌کشد. این یافته برای سازمان‌هایی که مدل را در بازارهای جهانی مستقر می‌کنند، حیاتی است زیرا ریسک تغییر رفتار مدل در کشورهای مختلف را آشکار می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از مدل‌های چندزبانه استفاده می‌کنند، این یعنی احتمالاً مدل در زبان فارسی رفتاری متفاوت از انگلیسی دارد و باید صحت استدلال را به‌طور مجزا برای هر زبان بسنجند.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها فرض رایج درباره «شخصیت واحد» مدل‌های زبانی را باطل می‌کند. در واقع مدل‌ها نه یک شخصیت، بلکه مجموعه‌ای از ماسک‌های فرهنگی هستند که بر اساس زبان فعال می‌شوند. این موضوع نشان می‌دهد که RLHF به‌جای حذف سوگیری، صرفاً سوگیری‌های انسانی را به تفکیک زبان کدگذاری کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.