پرش به محتوای اصلی
پرش به محتوای مقاله

محک LOCOMO با حذف پرسش‌های خصمانه، توهمِ دقت در حافظهٔ عامل‌ها را می‌سازد

·۹ مرداد ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
تحلیل
معیار سنجش حافظه هوش مصنوعی که همه از آن نقل می‌کنند، گفتن «نمی‌دانم» را ممنوع کرده است
معیار سنجش حافظه هوش مصنوعی که همه از آن نقل می‌کنند، گفتن «نمی‌دانم» را ممنوع کرده است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای مکانیسم حذف عمدی پرسش‌های خصمانه در LOCOMO و اثبات اینکه بهبود بازیابی (Retrieval) لزوماً منجر به کاهش توهمات در پاسخ نمی‌شود.

«متعهد شو و پاسخ بده»؛ این دستور صریح، در ترکیب با حذف تعمدی پرسش‌های خصمانه، سازوکاری است که بنچمارک LOCOMO از طریق آن مدل‌های هوش مصنوعی را به صورت ساختاری مجبور می‌کند تا هرگز اعتراف نکنند که پاسخی برای یک سؤال ندارند. از آنجایی که این بنچمارک به عنوان معیار اصلی ارزیابی حافظه هوش مصنوعی عمل می‌کند، محیط آزمایش آن ادراکی منحرف از «دقت» ایجاد می‌کند که هیچ شباهتی به قابلیت اطمینان در دنیای واقعی ندارد.

این مشکل در بحبوحه یک «جنگ بنچمارک» میان لایه‌های حافظه مانند Mem0 و Zep رخ می‌دهد. در حالی که توسعه‌دهندگان برای ساخت عامل‌هایی با تداوم بلندمدت در رقابت هستند، صنعت به‌جای تمرکز بر اینکه سیستم چگونه با «خلأ» یا نبودِ پاسخ برخورد می‌کند، تنها بر تعداد پاسخ‌های درست تمرکز کرده است. این رقابت برای تثبیت حافظه در حالی صورت می‌گیرد که برخی چارچوب‌ها مانند EdosAI از لایه‌های شناختی متعددی برای مقابله با فراموشی عامل‌ها استفاده می‌کنند. با تکیه بر پوشش پیشین ما درباره‌ی اینکه چگونه کوئری‌های نامتقارن می‌توانند باعث Timeout شدن عامل‌ها شوند، این مسئله یک نقص معماری عمیق‌تر را برجسته می‌کند: شکاف میان بازیابی یک سند مرتبط و تعیین اینکه آیا آن سند واقعاً حاوی پاسخ مورد نظر هست یا خیر.

مکانیسم‌های شکاف امتیازدهی

طبق یک تحلیل فنی که در ۳۰ جولای ۲۰۲۶ منتشر شد، بنچمارک LOCOMO دارای پنج دسته‌بندی پرسش است. چهار دسته بر صحت پاسخ تمرکز دارند، اما دسته پنجم شامل ۴۴۶ پرسش خصمانه است — یعنی حدود ۲۲.۵٪ از کل داده‌ها — که در آن‌ها پاسخ درست دقیقاً این است که «این اطلاعات در اینجا نیست».

بررسی دقیق کد در مخزن mem0ai/memory-benchmarks دو محدودیت بحرانی را آشکار می‌کند:

  • در کد منبع، تعریف متغیر CATEGORIES_TO_EVALUATE = [1, 2, 3, 4] به‌طور صریح تمام ۴۴۶ پرسش خصمانه را از محاسبه امتیاز نهایی حذف می‌کند.
  • در پرامپت ارسالی به مدل، یک دستور سخت‌گیرانه گنجانده شده است: «هرگز نگویید ذکر نشده است... متعهد شو و پاسخ بده» (NEVER say 'not specified' … COMMIT AND ANSWER).

معیار سنجش حافظه هوش مصنوعی که همه از آن نقل‌قول می‌کنند، گفتن «نمی‌دانم» را ممنوع کرده است.

سقف دقت مخدوش شده

این طراحی به این معناست که اعداد گزارش‌شده تنها دقت مدل در پاسخ به سوالاتی را می‌سنجند که لزوماً «پاسخ دارند». اما حتی این اعداد نیز به‌دلیل فرآیند داوری سهل‌گیرانه متورم شده‌اند. داور سیستم، هر پاسخی را که تنها با یکی از موارد لیست مرجع (Gold List) تطبیق داشته باشد، «درست» علامت می‌زند و حتی برای تاریخ‌ها، بازه تغییرات ±۱۴ روز را می‌پذیرد.

یک حسابرسی مستقل توسط dial481/locomo-audit نشان داد که داور این بنچمارک، ۶۲.۸٪ از پاسخ‌هایی که تعمداً اشتباه بودند را پذیرفته است. علاوه بر این، این حسابرسی اشاره می‌کند که کلید پاسخ‌های LOCOMO تا حدی مخدوش (Corrupted) است و این موضوع سقف واقعی دستیافتنی برای یک مدل صادق را در حدود ۹۳.۶٪ محدود می‌کند. در نتیجه، گزارش یک امتیاز ۹۲.۵٪ به معنای «نزدیک به کمال» بودن مدل نیست، بلکه نتیجه مستقیم یک بنچمارک معیوب و یک داور تساهل‌آمیز است.

تلاش برای کالیبراسیون امتناع

برای حل این بحران، نویسنده تحلیل، متریکی جدید به نام «تمایز» (Discrimination) را پیشنهاد می‌کند. این معیار به عنوان تفاوت میان «امتناع درست» (پاسخ ندادن صحیح به سوالات خصمانه) و «امتناع غلط» (پاسخ ندادن اشتباه به سوالات واقعی) تعریف می‌شود. این رویکرد از ایجاد یک «سیاست فاسد» (Degenerate Policy) جلوگیری می‌کند؛ وضعیتی که در آن مدل برای کسب امتیاز کامل، به‌سادگی از پاسخ دادن به همه چیز امتناع می‌کند.

وقتی این معیار روی سیستم RE-call (MIT) آزمایش شد، نتایج تکان‌دهنده بود. با وجود بهره‌گیری از یک لایه اعتماد، آستانه کالیبره شده شباهت کسینوسی و یک داور استنتاج (Entailment Judge)، امتیاز تمایز این سیستم در حالت پیش‌فرض ۰.۰۰۰ بود. حتی با استفاده از پیکربندی حد-بالای کالیبره شده، سیستم برای رسیدن به امتیاز تمایز ۰.۱۵۴، از پاسخ دادن به ۶۰.۳٪ از سوالاتی که کاربران واقعاً پاسخشان را می‌خواستند، امتناع کرد.

تله «مرتبط بودن» در برابر «پاسخ‌پذیری»

یکی از کلیدی‌ترین یافته‌ها این است که بهبود بازیابی (Retrieval) لزوماً منجر به بهبود قضاوت درباره «پاسخ‌پذیری» نمی‌شود. در آزمایش‌ها، افزایش دقت بازیابی در سطح hit@5 به میزان +۰.۱۰۶، تأثیر دقیقا صفر بر نرخ امتناع داشت. این ثابت می‌کند که یک قطعه متن که بهتر بازیابی شده و موضوعش مرتبط است اما در نهایت پاسخ را ندارد، در واقع احتمال توهم (Hallucination) را افزایش می‌دهد، نه احتمال امتناع درست را. جالب است که برخی رویکردها برای عبور از این بن‌بست، به جای بازیابی غیرفعال، از لایه‌های استدلالی برای تحلیل دقیق‌تر محتوا استفاده کرده‌اند.

این وضعیت نشان می‌دهد که صنعت در حال حاضر «مرتبط بودن» (یافتن سند مشابه) را با «پاسخ‌پذیری» (تأیید اینکه سند حاوی حقیقت خاص مورد نظر است) اشتباه می‌گیرد. هرچند بنچمارک‌های جدیدتری مانند BEAM از Mem0 دسته‌های امتناع را معرفی کرده‌اند، اما تکیه صنعت بر معیارهایی که صرفاً بر پایه صحت (Accuracy-only) هستند، همچنان یک نقطه کور استراتژیک است.

برای کسانی که عامل‌های مبتنی بر بازیابی می‌سازند، این تغییر رویکرد نشان می‌دهد که مزیت رقابتی بعدی نه در جست‌وجوی برداری پیشرفته‌تر، بلکه در توانایی صادقانهٔ مدل برای گفتن «نمی‌دانم» بدون تخریب تجربه کاربر نهفته است.

اگر امروز تنها یک درصد صحت را برای حافظه عامل خود گزارش می‌کنید، احتمالاً در حال اندازه‌گیری سقفی هستید که توسط آرتیفکت‌های داده‌ای ساخته شده، نه توانایی واقعی مدل. گام بعدی برای توسعه‌دهندگان، ردیابی موازنه‌ی میان «امتناع درست خصمانه» و «امتناع غلط» روی یک مجموعه ثابت از سوالات بدون پاسخ است.

گام بعدی شما

  • به‌جای تکیه بر یک عدد صحت، نرخ «امتناع درست» در برابر «امتناع غلط» را روی یک مجموعه ثابت از سوالات بدون پاسخ ردیابی کنید. برای شروع، می‌توانید پرسش‌های کلیدی مربوط به رفع نشت حافظه و خطاهای بازیابی را بررسی کنید تا نقاط ضعف سیستم خود را شناسایی نمایید.
  • در لایه‌های داوری، سخت‌گیری در تطبیق تاریخ‌ها و عبارات را افزایش دهید تا اثر سهل‌گیری بنچمارک‌ها خنثی شود.
  • بررسی کنید آیا مدل شما در صورت نبود پاسخ، تمایل به توهم دارد یا طبق پروتکل‌های جدید، صادقانه امتناع می‌کند.

این تنها لایه نرم‌افزاری ماجراست؛ تأثیر این نقص‌های ارزیابی بر هزینه استنتاج در مقیاس تجاری را در تحلیل بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این تحلیل با تکیه بر مستندات کد و حسابرسی مستقل، اعتبار یکی از رایج‌ترین معیارهای حافظه AI را زیر سؤال می‌برد. این موضوع باعث می‌شود توسعه‌دهندگان از معیارهای توهم‌زای «صحت مطلق» فاصله گرفته و به سمت معیارهای «تمایز» حرکت کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی عامل‌های هوشمند، این خبر هشدار می‌دهد که به ادعاهای تبلیغاتی شرکت‌های خارجی درباره صحت حافظه اعتماد نکنند و معیارهای ارزیابی داخلی خود را بر پایه «امتناع صادقانه» تعریف کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر «تولید پاسخ» به‌جای «مدیریت جهل»، منجر به ایجاد سیستم‌هایی شده که در محیط‌های عملیاتی خطرناک هستند. وقتی بنچمارک‌ها مدل را مجبور به پاسخ می‌دهند، در واقع در حال تشویق توهمات سیستماتیک‌اند. ارزش واقعی عامل‌های نسل بعد در «کالیبراسیون اعتماد» است؛ یعنی مدلی که دقیقاً بداند چه زمانی نمی‌داند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.