پرش به محتوای اصلی
پرش به محتوای مقاله

«فراتر از بازیابی ساده»؛ رویکرد جدید Glasshouse برای سنجش حافظه AI

·۳۱ شهریور ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
نسخه ۰.۱ گلاس‌هاوس منتشر شد: معیار سنجش حافظه برای سیستم‌های هوش مصنوعی
نسخه ۰.۱ گلاس‌هاوس منتشر شد: معیار سنجش حافظه برای سیستم‌های هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی سیستمی که به‌جای پاداش به بازیابی ساده، توهمات با اعتمادبه‌نفس را جریمه می‌کند و محور «تناقضات» را برای سنجش حافظه پویا اضافه کرده است.

اگر امروز به اعداد میلیونی «پنجره متنی» مدل‌ها اعتماد می‌کنید، احتمالاً بخشی از این ظرفیت صرفاً حدس‌های هوشمندانه است، نه حافظه واقعی. محک Glasshouse v0.1 آمده است تا تفاوت میان «به یاد آوردن» و «الگوبرداری» را با جریمه کردن توهمات (Hallucination) — شبیه به معلمی که به‌جای نمره دادن به جواب درست، به دانش‌آموزی که با اطمینان اشتباه می‌گوید نمره منفی می‌دهد — به چالش بکشد.

طبق اعلام توسعه‌دهندگان در ۲۲ سپتامبر ۲۰۲۶، این ابزار روی یک نقطه ضعف کلیدی در محک‌های فعلی دست گذاشته است: وابستگی نتایج به مدلِ داور به‌جای خودِ سیستم مورد آزمایش. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تکیه بر معیارهای سطحی می‌تواند منجر به نتایج گمراه‌کننده شود. این مسئله دقیقاً همان شکاف میان بنچمارک و واقعیت است که پیش‌تر بررسی کردیم و توضیح می‌دهد چرا برخی عامل‌های هوش مصنوعی با وجود نمرات بالا، در محیط عملیاتی شکست می‌خورند. در دنیای واقعی، یک دستیار دیجیتال باید بتواند وقتی شما ترجیحات خود را تغییر می‌دهید، حافظه‌اش را به‌روز کند؛ در غیر این صورت، حافظه بلندمدت تبدیل به یک بار اضافی می‌شود.

بر اساس مستندات مخزن گیت‌هاب این پروژه، Glasshouse v0.1 شامل ۲٬۸۴۷ پرسش است که در دل یک مکالمه با حجم ۱.۹۷ میلیون توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — جای گرفته‌اند. ویژگی‌های فنی این محک عبارتند از:

  • پشتیبانی چندزبانه: ارزیابی در ۱۰ زبان مختلف.
  • داده‌های چندوجهی (Multimodal): ادغام ۵۰ عکس در جریان مکالمه برای سنجش درک بصری.
  • مقیاس متغیر: چهار اندازه مکالمه از ۱٬۸۸۲ تا ۱۰۳٬۵۷۲ نوبت گفتگو.
  • محورهای حقیقت: ردیابی دقیق حقایق قدیمی، تناقضات و تلاش برای ایجاد حافظه کاذب.

این رویکرد، هدف را از «پیدا کردن سوزن در انبار کاه» به «حفظ یک وضعیت منسجم» تغییر می‌دهد. Glasshouse با پاداش دادن به پاسخ «نمی‌دانم» به‌جای پاسخ‌های قدیمی اما با اعتمادبه‌نفس، مدل‌ها را مجبور می‌کند محدودیت‌های پنجره زمینه (Context Window) — شبیه به میز کاری که فقط جای چند ورق دارد و نمی‌تواند کل کتابخانه را روی آن باز کرد — را بپذیرند. در واقع، حافظه اینجا نه یک فایل متنی ایستا، بلکه یک پایگاه‌داده پویا دیده می‌شود. این نگاه به حافظه، یادآور نبرد میان ذخیره‌سازهای معنایی و حافظه خطی است که برای حفظ دستورات اولیه در سیستم‌های پیچیده حیاتی است.

برای توسعه‌دهندگان، این یعنی عدد تبلیغاتی پنجره متنی دیگر اهمیتی ندارد؛ آنچه مهم است نرخ افت دقت با افزایش حجم تاریخچه است. اگر سیستمی در بازیابی قوی باشد اما در محور تناقضات شکست بخورد، برای گردش‌های کاری عامل‌محور (Agentic) پیچیده و بلندمدت غیرقابل‌اعتماد است. در همین راستا، پیشرفت‌هایی مانند موتور حافظه NylonME تلاش کرده‌اند تا با معماری‌های لایه‌ای، نرخ بازیابی داده‌ها را به سطح قابل‌قبولی برسانند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، این محک را روی مدل‌های محلی خود اجرا کنید و نتایج را در گیت‌هاب ثبت کنید.
  • در گزارش‌های آتی، نرخ افت دقت مدل‌های پیشرو را در حجم ۲ میلیون توکن مقایسه کنید.
  • بررسی کنید آیا مدل شما در مواجهه با داده‌های متناقض، صادقانه «نمی‌دانم» می‌گوید یا توهم می‌زند.

اما داستان سخت‌افزاری مدیریت این حجم از حافظه حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی بهینه‌سازی KV Cache مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر متدولوژی سخت‌گیرانه، اعتبار ادعاهای شرکت‌های AI درباره حافظه بلندمدت را به چالش می‌کشد. از نظر صنعتی، این یعنی انتقال از معیارهای کمی (تعداد توکن) به معیارهای کیفی (پایداری حقیقت).

تأثیر برای ایران

این ابزار به‌صورت باز در گیت‌هاب منتشر شده و برای برنامه‌نویسان ایرانی که روی عامل‌های هوش مصنوعی با حافظه بلندمدت کار می‌کنند، یک معیار رایگان و دقیق برای تست مدل‌هاست.

·نگاه ما
تحریریه دات‌هوش

تمرکز Glasshouse بر «صداقت» به‌جای «بازیابی»، پارادایم ارزیابی حافظه را تغییر می‌دهد. این یعنی دوران رقابت بر سر اعداد نجومی پنجره متنی به پایان رسیده و حالا نبرد بر سر مدیریت پویا و حذف داده‌های منسوخ در حافظه است. مدل‌هایی برنده خواهند بود که بدانند چه زمانی فراموش کنند یا اعتراف کنند که اطلاعاتشان قدیمی شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.