پرش به محتوای اصلی
پرش به محتوای مقاله

رمزگشایی از توهمات منطقی؛ چرا مدل‌های زبانی دلیل تصمیمات خود را نمی‌دانند؟

·۲۱ خرداد ۱۴۰۵۱ دقیقه مطالعه
رمزگشایی از توهمات منطقی؛ چرا مدل‌های زبانی دلیل تصمیمات خود را نمی‌دانند؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات آماری جدایی (Decoupling) میان لایه‌ی زبانی و لایه‌ی تصمیم‌گیر؛ این نخستین بار است که نشان داده می‌شود مدل می‌تواند رفتاری سیستماتیک داشته باشد اما در عین حال، هیچ درکی زبانی از محرک‌های آن رفتار نداشته باشد.

باید بپذیرید که هر آنچه مدل‌های زبانی بزرگ (LLM) درباره‌ی نحوه تفکرشان می‌گویند، احتمالاً یک توهم سازمان‌یافته است. تصور کنید سیستمی را که دقیقاً می‌داند چه پاسخی دهد، اما وقتی از او می‌پرسید «چرا»، پاسخی می‌دهد که هیچ ربطی به فرآیند واقعی تصمیم‌گیری‌اش ندارد.

این کشف در حالی رخ می‌دهد که ما در دوران گذار به مدل‌های استدلالی هستیم. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، همراستاسازی مدل‌ها با واقعیت همواره چالش‌برانگیز بوده است. این پژوهش اکنون تأیید می‌کند که شکاف میان «رفتار» و «گزارش زبانی» عمیق‌تر از آن است که تصور می‌شد.

طبق اعلام پژوهشی به سرپرستی گابریل فریدمن (Gabriel Freedman) که در ۱۰ ژوئن ۲۰۲۶ منتشر شد، مدل‌ها دچار پدیده‌ای به نام «باور سطحی» هستند. در این مطالعه که نتایج آن در وب‌سایت arxiv.org منتشر شده، پژوهشگران از محیط‌های تصمیم‌گیری دوگانه (Binary) استفاده کردند. یافته‌های کلیدی این گزارش عبارتند از:

  • مدل‌های رفتاری توانستند انتخاب‌های مدل را با دقت پیش‌بینی کنند، که ثابت می‌کند تصمیمات LLMها تصادفی نیست و به ویژگی‌های بصری وابسته است.
  • گزارشات مستقیم مدل‌ها (Self-reports) تنها در بخش کوچکی از موارد توانستند محرک‌های واقعی تصمیم را شناسایی کنند.
  • این شکاف کیفی در شرایط مختلف نمونه‌برداری، تغییر ترتیب پرامپت‌ها و ساختارهای متغیر تصمیم‌گیری همچنان پابرجا بود.

برای جامعه‌ی فنی، این نتیجه به این معناست که لایه زبانی مدل کاملاً از سیستم اولویت‌بندی احتمالی که تصمیم نهایی را اجرا می‌کند، جدا شده است. بنابراین، زنجیره تفکر (Chain-of-Thought) ممکن است صرفاً تقلیدی از منطق باشد؛ یعنی توهم (Hallucination) هایی که پس از اتخاذ تصمیم برای پذیرفتنی جلوه دادن آن ساخته می‌شوند، نه ردپایی شفاف از فرآیند استدلال.

توسعه‌دهندگان اکنون باید بررسی کنند که آیا این «باور سطحی» از طریق روش‌های تفسیرپذیری مکانیکی قابل رفع است یا اینکه شفافیت زبانی در معماری‌های فعلی مبتنی بر ترنسفورمر، یک محال ساختاری است.

گام بعدی شما

  • بررسی متدهای تفسیرپذیری مکانیکی برای یافتن محرک‌های واقعی تصمیم‌گیری.
  • بازنگری در اعتماد به گزارشات زبانی مدل‌ها در سیستم‌های حساس و حیاتی.
  • دنبال کردن پژوهش‌های مربوط به جداسازی لایه‌ی استنتاج (Inference) از لایه‌ی توجیهی.

اما آیا می‌توان این شکاف را با تغییر معماری ترنسفورمرها برطرف کرد یا شفافیت زبانی یک محال ساختاری است؟ به تحلیل ما درباره‌ی مدل‌های استدلالی نسل بعدی مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار روش‌های همراستاسازی مبتنی بر توضیح را تخریب می‌کند. تخصص پژوهشگران در حوزه ایمنی هوش مصنوعی اکنون باید بر استخراج مستقیم وزن‌ها متمرکز شود، نه اعتماد به پاسخ‌های متنی مدل.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما این است که این یافته، اعتبار «استدلال» در مدل‌های فعلی را زیر سؤال می‌برد. اگر زنجیره تفکر تنها یک توجیه پسینی (Post-hoc) باشد، پس ما با مدل‌هایی روبرو هستیم که در تقلید از ظاهرِ منطق استادند، اما در واقعیت، بر اساس توزیع‌های احتمالی پنهانی عمل می‌کنند که حتی خودشان قادر به شرح آن نیستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.