اگر امروز به اعداد میلیونی «پنجره متنی» مدلها اعتماد میکنید، احتمالاً بخشی از این ظرفیت صرفاً حدسهای هوشمندانه است، نه حافظه واقعی. محک Glasshouse v0.1 آمده است تا تفاوت میان «به یاد آوردن» و «الگوبرداری» را با جریمه کردن توهمات (Hallucination) — شبیه به معلمی که بهجای نمره دادن به جواب درست، به دانشآموزی که با اطمینان اشتباه میگوید نمره منفی میدهد — به چالش بکشد.
طبق اعلام توسعهدهندگان در ۲۲ سپتامبر ۲۰۲۶، این ابزار روی یک نقطه ضعف کلیدی در محکهای فعلی دست گذاشته است: وابستگی نتایج به مدلِ داور بهجای خودِ سیستم مورد آزمایش. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تکیه بر معیارهای سطحی میتواند منجر به نتایج گمراهکننده شود. این مسئله دقیقاً همان شکاف میان بنچمارک و واقعیت است که پیشتر بررسی کردیم و توضیح میدهد چرا برخی عاملهای هوش مصنوعی با وجود نمرات بالا، در محیط عملیاتی شکست میخورند. در دنیای واقعی، یک دستیار دیجیتال باید بتواند وقتی شما ترجیحات خود را تغییر میدهید، حافظهاش را بهروز کند؛ در غیر این صورت، حافظه بلندمدت تبدیل به یک بار اضافی میشود.
بر اساس مستندات مخزن گیتهاب این پروژه، Glasshouse v0.1 شامل ۲٬۸۴۷ پرسش است که در دل یک مکالمه با حجم ۱.۹۷ میلیون توکن (Token) — تکههای کوچکی از متن که مدل تکهتکه میخورد — جای گرفتهاند. ویژگیهای فنی این محک عبارتند از:
- پشتیبانی چندزبانه: ارزیابی در ۱۰ زبان مختلف.
- دادههای چندوجهی (Multimodal): ادغام ۵۰ عکس در جریان مکالمه برای سنجش درک بصری.
- مقیاس متغیر: چهار اندازه مکالمه از ۱٬۸۸۲ تا ۱۰۳٬۵۷۲ نوبت گفتگو.
- محورهای حقیقت: ردیابی دقیق حقایق قدیمی، تناقضات و تلاش برای ایجاد حافظه کاذب.
این رویکرد، هدف را از «پیدا کردن سوزن در انبار کاه» به «حفظ یک وضعیت منسجم» تغییر میدهد. Glasshouse با پاداش دادن به پاسخ «نمیدانم» بهجای پاسخهای قدیمی اما با اعتمادبهنفس، مدلها را مجبور میکند محدودیتهای پنجره زمینه (Context Window) — شبیه به میز کاری که فقط جای چند ورق دارد و نمیتواند کل کتابخانه را روی آن باز کرد — را بپذیرند. در واقع، حافظه اینجا نه یک فایل متنی ایستا، بلکه یک پایگاهداده پویا دیده میشود. این نگاه به حافظه، یادآور نبرد میان ذخیرهسازهای معنایی و حافظه خطی است که برای حفظ دستورات اولیه در سیستمهای پیچیده حیاتی است.
برای توسعهدهندگان، این یعنی عدد تبلیغاتی پنجره متنی دیگر اهمیتی ندارد؛ آنچه مهم است نرخ افت دقت با افزایش حجم تاریخچه است. اگر سیستمی در بازیابی قوی باشد اما در محور تناقضات شکست بخورد، برای گردشهای کاری عاملمحور (Agentic) پیچیده و بلندمدت غیرقابلاعتماد است. در همین راستا، پیشرفتهایی مانند موتور حافظه NylonME تلاش کردهاند تا با معماریهای لایهای، نرخ بازیابی دادهها را به سطح قابلقبولی برسانند.
گام بعدی شما
- اگر توسعهدهنده هستید، این محک را روی مدلهای محلی خود اجرا کنید و نتایج را در گیتهاب ثبت کنید.
- در گزارشهای آتی، نرخ افت دقت مدلهای پیشرو را در حجم ۲ میلیون توکن مقایسه کنید.
- بررسی کنید آیا مدل شما در مواجهه با دادههای متناقض، صادقانه «نمیدانم» میگوید یا توهم میزند.
اما داستان سختافزاری مدیریت این حجم از حافظه حتی شگفتانگیزتر است — به تحلیل ما دربارهی بهینهسازی KV Cache مراجعه کنید.




گفتگو