پرش به محتوای اصلی
پرش به محتوای مقاله

دقت بازیابی در برابر توانایی استنتاج؛ تضاد حافظه در مدل‌های عامل‌محور

·۱۷ شهریور ۱۴۰۵۵ دقیقه مطالعه
تحلیل
عامل شما واقعیت را به خاطر سپرده بود، اما مثل یک غریبه پاسخ داد.
عامل شما واقعیت را به خاطر سپرده بود، اما مثل یک غریبه پاسخ داد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تفکیک دقیق بین «توانایی بازیابی» و «توانایی به‌کارگیری» در حافظه عامل‌ها؛ اثبات اینکه مدل‌ها حقیقت را می‌دانند اما نمی‌توانند بدون اشاره مستقیم، آن را در مسیر حل مسئله قرار دهند.

عامل‌های هوش مصنوعی می‌توانند حافظه‌ای بی‌نقص از یک حقیقت داشته باشند و با این حال، به درخواستی چنان پاسخ دهند که گویی کاملاً غریبه‌اند. طبق تحلیل فنی مطالعه InMind (arXiv 2607.24368v1) که در ۲۷ ژوئیه ۲۰۲۶ توسط رویز لی، مینگ‌شوان دو، بن‌فنگ شو و ژندونگ مائو منتشر شد، گسستی عمیق میان توانایی مدل در بازیابی یک تکه داده و توانایی آن در استفاده خودمختار از آن داده وجود دارد.

این حالت شکست، یک ضعف سیستماتیک در نحوه عملکرد سامانه‌های حافظه فعلی را افشا می‌کند. در حالی که ما اغلب با «حافظه» به عنوان یک قابلیت واحد برخورد می‌کنیم، این توانایی در واقع از دو نیمه متمایز تشکیل شده است. سیلوییا لاسکوفسکا در واژه‌نامه‌ای از اصطلاحات عامل‌ها که در ۳ سپتامبر ۲۰۲۶ منتشر شد، این تمایز را به تصویر می‌کشد. نیمه «آسان»، بازیابی یک حقیقت نام‌برده است؛ مانند مؤسسی که درباره یک شرکت کدنویسی هوش مصنوعی می‌پرسد که سه هفته پیش به آن اشاره کرده بود. نیمه «سخت»، به‌کارگیری آن دانش بدون یک نشانه مستقیم است؛ مانند درخواست از عامل برای تدوین یک پیشنهاد برای آن شرکت با استفاده از بودجه‌ای خاص از یک برنامه موشکی.

عامل شما واقعیت را به خاطر سپرده بود، اما مثل یک غریبه پاسخ داد.

پژوهشگران برای کمی کردن این پدیده، ۶ سامانه حافظه مختلف را در ۱۲۵ وظیفه آزمایش کردند. نتایج، شکافی تکان‌دهنده در عملکرد را نشان می‌دهد:

  • پرسش‌های مستقیم: وقتی یک پرسش صراحتاً نام حقیقت مورد نیاز را می‌آورد، سامانه‌های حافظه امتیازی بین ۷۶.۰٪ تا ۱۰۰.۰٪ کسب کردند.
  • درخواست‌های غیرمستقیم: وقتی همان حقیقت مورد نیاز بود اما نامش برده نشد، عملکرد به شدت سقوط کرد و به بین ۰.۸٪ تا ۱۲.۰٪ رسید.
  • امتیاز سرتاسری (End-to-End): حتی بهترین پیکربندی‌ها برای درخواست‌های غیرمستقیم تنها به سقف ۱۴.۴٪ رسیدند.
  • کنترل‌های RAG ساده: بهترین مورد از سه کنترل تولید بازیابی‌افزا (Naive RAG) ساده تنها امتیاز ۱۶.۰٪ کسب کرد.

نکته حیاتی این است که این مطالعه ثابت می‌کند مدل‌ها هوش زیربنایی لازم برای حل این وظایف را دارند. وقتی حقیقت مورد نیاز به‌صورت دستی در بستر متن (Context) قرار گرفت — و سامانه بازیابی کاملاً دور زده شد — همان مدل‌ها ۸۴.۰٪ از درخواست‌های غیرمستقیم را درست پاسخ دادند. این تأیید می‌کند که شکست مربوط به «دسترسی» است، نه «توانایی شناختی». همان‌طور که نویسندگان بیان می‌کنند: «آنچه ۸۴.۰٪ را از ۱۶.۰٪ جدا می‌کند، دسترسی است، نه توانایی».

آزمون‌های تکمیلی نشان داد حقایق در واقع گم نمی‌شوند؛ یک پرسش مستقیم می‌تواند حقیقتی را با صحت تا ۱۰۰.۰٪ بازگرداند، حتی پس از ۳۸ جلسه ترافیک مداخله‌ای. افزایش هشت برابری ابعاد بردار معنایی (Embedding) حضور حقیقت را برای هر ۶ سامانه افزایش داد، اما هیچ پیکربندی‌ای در زمان پرسش نتوانست امتیاز درخواست‌های غیرمستقیم سرتاسری را به بالای ۱۶.۰٪ برساند. این نشان می‌دهد که مشکل از رزولوشن ذخیره‌ساز حافظه نیست، بلکه منطق مسیریابی (Routing) است که معیوب است. این چالش با یافته‌های پیشین همسو است، جایی که فشرده‌سازی حافظه در عامل‌ها منجر به کاهش شدید نرخ بازیابی داده‌ها شد و نشان داد که مدیریت بهینه فضای ذخیره‌سازی بر دقت خروجی اثرگذار است.

مسئله مسیریابی

نویسندگان «مسیریابی» را به عنوان مسئله باز شناسایی کردند: فرآیند تصمیم‌گیری درباره اینکه کدام حقایق باید پیش از آنکه کاربر حتی سؤالی بپرسد، در بستر فعال مدل باقی بمانند.

به عنوان یک ابزار تشخیص، پژوهشگران از یک کاوشگر «همیشه-در-وضعیت» (always-in-state) استفاده کردند؛ یک فایل markdown محدود به ۲۰۰ خط که مستقیماً در پرامپت قرار گرفت. این روش به نرخ موفقیت ۶۸.۸٪ در درخواست‌های غیرمستقیم رسید.

با این حال، این یک معماری مقیاس‌پذیر نیست. نویسندگان این مورد را به عنوان یک معیار اندازه‌گیری ارائه کردند و نه یک معماری پیشنهادی؛ زیرا با رشد ذخیره حافظه، یک فایل استاتیک در نهایت پر می‌شود و حقایق جدید شروع به بیرون راندن حقایق قدیمی‌تر می‌کنند و سیستم دوباره به همان شکست در بازیابی بازمی‌گردد.

اعتبارسنجی شکست

سرگئی پارفنونوف، پژوهشگر مستقل، باتری مشابهی را برای آزمایش این شکست پیشنهاد کرد. او در کاوشگر محلی BM25 خود روی ۱۲ مورد دریافت کرد که ۱۲ مورد از ۱۲ پرسش مستقیم درست پاسخ داده شدند، اما تنها ۴ مورد از ۱۲ وظیفه غیرمستقیم موفق بود. آزمایش پارفنونوف محدودتر بود و هیچ مدلی در حلقه (loop) آن حضور نداشت.

پارفنونوف هشدار می‌دهد که امتیازدهی بر اساس پاسخ نهایی به تنهایی می‌تواند گمراه‌کننده باشد. در جدول ۴ مقاله InMind، پیکربندی‌های بازیابی وقتی فقط بر اساس پاسخ داوری شدند، امتیازی بین ۱۸.۴٪ تا ۲۹.۶٪ گرفتند، در حالی که امتیاز سرتاسری آن‌ها در جدول ۱ بین ۳.۲٪ تا ۱۶.۰٪ بود.

برای مثال، در یک مورد بررسی‌شده، مدل یک هشدار کلی درباره آلرژی ماکارون را از داده‌های آموزشی عمومی خود ارائه داد، در حالی که حافظه شخصی‌سازی‌شده مربوط به آلرژی کاربر هرگز به بستر مدل نرسیده بود. بدون راهی برای حذف اثر دانش عمومی، سیستم برای حافظه‌ای که عملاً هیچ داده‌ای تحویل نداده، امتیاز می‌گیرد.

اصلاح باتری آزمون

برای جلوگیری از این «اعتبار کاذب»، باتری سخت‌گیرانه‌تری لازم است. پارفنونوف پیشنهاد می‌کند از نسخه‌های مستقل یک وضعیت شروع استفاده شود: یکی با پرسش مستقیم، یکی با وظیفه تنها، و یکی با محدودیت نوشته‌شده.

می‌توان نسخه چهارمی را افزود: همان وضعیت اما با جایگزینی حقیقت تعیین‌کننده با یک داده جعلی (Decoy) هم‌شکل و هم‌اندازه، یا حذف کامل آن. با گزارش تفاوت بین اجرای «با حقیقت» و «بدون حقیقت»، توسعه‌دهندگان می‌توانند تعیین کنند آیا سامانه حافظه واقعاً در نتیجه اثرگذار بوده است یا خیر، بدون اینکه نیازی به مشاهده بستر بازیابی‌شده باشد.

محدوده و محدودیت‌ها

مطالعه InMind از ۱۲۵ وظیفه ساخته‌شده استفاده کرد که ۱۱۳ مورد آن‌ها بر اساس منابع عمومی قابل استناد بود. پژوهشگران عمداً جفت‌هایی را که نشانه‌های بازیابی معمولی پاسخ را لو می‌دادند حذف کردند تا این حالت شکست خاص را به استرس بکشند.

همچنین یک شکاف متدولوژیک در مورد داور وجود دارد. این مطالعه از GPT-5-mini هم به عنوان پاسخ‌دهنده و هم داور استفاده کرد. بررسی ۱۰۰ رکورد نشان داد داور کاربردِ آگاه-به-بستر، ۸۵.۰٪ صحت داشت و تمام ۱۵ خطای آن «مثبت کاذب» بودند. این یعنی امتیازدهی، به‌کارگیری حقیقت را پاداش می‌دهد اما زیاده‌روی در پاسخ را جریمه نمی‌کند.

این تحلیل نشان می‌دهد هر سامانه حافظه‌ای که تنها زمانی فعال می‌شود که پرسش صراحتاً نام یک حقیقت را می‌برد، اساساً معیوب است. شکاف بین ۱۶.۰٪ و ۸۴.۰٪ در واقع «مالیات» فعلی بر خودمختاری عامل‌محور است. هیچ‌یک از این موارد یک دستیار مستقر خاص را اندازه‌گیری نمی‌کند، اما این استدلال برای هر سیستمی که بر بازیابی برداری ساده متکی است، صادق است.

افشا: من روی Mnemoverse کار می‌کنم، یک موتور حافظه برای عامل‌های هوش مصنوعی که از طریق MCP متصل شده‌اند، بنابراین استدلال را با در نظر گرفتن این موضوع بسنجید.

گام بعدی شما

  • اگر از RAG برای عامل‌های خود استفاده می‌کنید، تست‌های «درخواست غیرمستقیم» را به باتری ارزیابی خود اضافه کنید تا نرخ شکست واقعی را بسنجید.
  • برای کاهش اثر دانش عمومی در ارزیابی‌ها، از متدولوژی «داده جعلی» (Decoy) برای تفکیک اثر حافظه از آموزش مدل استفاده کنید.
  • به جای تکیه بر بازیابی برداری ساده، روی مکانیزم‌های مسیریابی فعال (Active Routing) سرمایه‌گذاری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی سخت‌گیرانه، نشان می‌دهد که استقلال عامل‌های هوش مصنوعی در حال حاضر یک توهم است و آن‌ها هنوز به «راهنمایی مستقیم» کاربر برای دسترسی به حافظه نیاز دارند. این موضوع اعتبار ادعاهای مربوط به خودمختاری کامل (Full Autonomy) را در سامانه‌های مبتنی بر RAG زیر سؤال می‌برد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان عامل‌های هوشمند در ایران اهمیت دارد تا بازار مصرف؛ چرا که مسیر بهینه‌سازی حافظه در مدل‌های فارسی‌زبان را از سمت افزایش داده به سمت بهبود مسیریابی تغییر می‌دهد.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها فرضیه رایج مبنی بر اینکه «افزایش حجم پنجره متنی یا دقت بردارها مشکل حافظه را حل می‌کند» را رد می‌کند. مشکل اصلی در لایه استنتاج و تصمیم‌گیری برای فعال‌سازی حافظه است، نه در لایه ذخیره‌سازی. این یعنی آینده عامل‌های خودمختار در گرو توسعه مدل‌های مسیریابی است که بتوانند بدون اشاره مستقیم کاربر، نیازهای اطلاعاتی را پیش‌بینی کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.