پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه RecToM با بازسازی بازگشتی دیدگاه‌ها به دقت ۱۰۰٪ در Hi-ToM رسید؟

·۲۲ خرداد ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
چگونه RecToM با بازسازی بازگشتی دیدگاه‌ها به دقت ۱۰۰٪ در Hi-ToM رسید؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی روش‌های «فیلترینگ رویداد» با «بازسازی بازگشتی دیدگاه‌ها» برای حل مسئله باورهای تودرتو؛ دست‌یابی به اولین رکورد ۱۰۰٪ در Hi-ToM توسط LMMها.

اگر تصور می‌کنید حل چالش‌های استدلال اجتماعی تنها با افزایش مقیاس مدل‌ها ممکن است، در اشتباهید. شکاف واقعی در درک «باورهای تودرتو» است؛ جایی که هوش مصنوعی باید تشخیص دهد «من فکر می‌کنم که تو فکر می‌کنی من چه می‌دانم».

طبق یک تحلیل فنی که در ۱۱ ژوئن ۲۰۲۶ منتشر شد، مدل‌های GPT-5.4 و Qwen3.5 توانسته‌اند با دستیابی به دقت ۱۰۰٪ در بنچمارک Hi-ToM، یکی از دشوارترین مسائل استدلال اجتماعی را حل کنند. این موفقیت مدیون چارچوبی به نام RecToM است که در زمان استنتاج (Inference) اجرا می‌شود.

تئوری ذهن (Theory of Mind) توانایی شناختی برای استنتاج باورها و حالات ذهنی دیگران بر اساس اطلاعات ناقص یا نامتقارن است. همان‌طور که در تحلیل قبلی ما درباره‌ی محدودیت‌های استدلال در مدل‌های زبانی اشاره کردیم، تلاش‌های پیشین برای بهبود این قابلیت بر فیلتر کردن رویدادهای مشاهده‌شده یا ایجاد زنجیره‌های باور زمانی متکی بودند؛ اما این روش‌ها در مدل‌سازی صریح باورهای تودرتو شکست می‌خوردند.

به نقل از مستندات RecToM، این چارچوب با پیاده‌سازی «بازسازی بازگشتی دیدگاه‌ها» عمل می‌کند. به جای اینکه پرسش را به عنوان یک پرامپت (Prompt) واحد در نظر بگیرد، دیدگاه هر شخصیت را بر اساس شخصیت پیشین در زنجیره استدلال می‌سازد. این فرآیند باعث می‌شود سؤالات پیچیده درجه‌بالا به سؤالات ساده‌ای درباره جهان واقعی تبدیل شوند که در دل یک دیدگاه بازسازی‌شده قرار گرفته‌اند.

جزئیات فنی این دستاورد شامل موارد زیر است:

  • ارزیابی جامع در سه بنچمارک کلیدی: Hi-ToM، Big-ToM و FanToM.
  • اعتبارسنجی عملکرد با استفاده از تحلیل KD45 برای اثبات ایجاد یک مودالیته باور ساختاریافته.
  • ادغام به عنوان یک لایه‌ی استنتاجی روی مدل‌های مختلف از جمله GPT-5.4 و Qwen3.5.

این نتیجه، فرضیات رایج در میدان AI را تغییر می‌دهد: استدلال اجتماعی صرفاً محصول مقیاس نیست، بلکه نتیجه‌ی مدیریت صحیح دیدگاه‌ها است. RecToM نشان می‌دهد که جایگزینی فیلترهای ساده با یک مودالیته ساختاری در زمان استنتاج، می‌تواند نیاز به آموزش‌های تخصصی و سنگین برای وظایف استدلالی پیچیده را از بین ببرد.

گام بعدی شما

  • بررسی نحوه ادغام منطق بازگشتی در سیستم‌های عامل‌محور (Agentic) برای بهبود مذاکرات خودکار.
  • تحلیل اثر کاهش نیاز به Fine-tuning در وظایف استدلالی اجتماعی با استفاده از لایه‌های استنتاجی.
  • مطالعه مستندات تحلیل KD45 برای درک نحوه سنجش صحت باورها در مدل‌های زبانی.

اما تأثیر این معماری بر تعاملات پیچیده در سیستم‌های چند-عاملی، ابعاد تازه‌ای از همکاری ماشین-انسان را می‌طلبد — منتظر تحلیل ما درباره‌ی ارکستراسیون عامل‌ها باشید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار بنچمارک‌های معتبر، ثابت می‌کند که استدلال اجتماعی پیچیده از طریق مهندسی ساختار استنتاج قابل حل است. این تغییر پارادایم، مسیر توسعه عامل‌های AI برای مذاکرات دیپلماتیک و همکاری‌های پیچیده انسانی را متحول می‌کند.

تأثیر برای ایران

این دستاورد برای پژوهشگران ایرانی در حوزه مدل‌های بنیادی و توسعه‌دهندگان سیستم‌های عامل‌محور اهمیت دارد و مسیری را برای بهبود استدلال اجتماعی بدون نیاز به منابع محاسباتی عظیم برای بازآموزی مدل‌ها می‌گشاید.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که RecToM در واقع یک «لایه فرا-شناختی» (Meta-cognitive layer) در زمان استنتاج ایجاد می‌کند. آنچه از این خبر می‌توان آموخت این است که هوش اجتماعی در AI نیازی به تغییر وزن‌های مدل در مرحله آموزش ندارد، بلکه با تعریف یک ساختار منطقی صحیح در مرحله خروجی، می‌توان قابلیت‌هایی را فعال کرد که پیش‌تر تصور می‌شد تنها با افزایش پارامترها به دست می‌آیند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.