اگر امروز یک عامل هوش مصنوعی برای مدیریت پروژههای طولانیمدت میسازید، احتمالاً با این واقعیت تلخ روبهرو هستید که مدل یا حافظهاش را از دست میدهد یا کاربر را دقایقی برای یک پاسخ ساده منتظر میگذارد. سیستم Muninn این معادله را تغییر داده و تأخیر استنتاج را از چندین دقیقه به زیر ۳ ثانیه رسانده است. در حالی که بنچمارکهای حافظه در رتبههای برتر معمولاً نیازمند سربار محاسباتی عظیمی هستند، این سیستم جدید توانسته است عملکردی نزدیک به مرزهای پیشرو (Frontier Performance) را با کاهش شدید زمان انتظار به دست آورد.
به نقل از گزارشی در The Organism Files، این سیستم میتواند در عین حفظ دقتِ مدلهای پیشرو و سنگین، سرعت پاسخدهی را بهطور چشمگیری افزایش دهد و تأخیرهای پردازشی مرتبط با آنها را حذف کند. در دنیای عاملهای هوش مصنوعی (AI Agents) — شبیه به کارمندی که باید تمام جزئیات جلسات هفتههای گذشته را به خاطر داشته باشد تا پروژه را پیش ببرد — حافظه همان مرز میان یک بات فراموشکار که هر ده دقیقه نام شما را فراموش میکند و یک دستیار حرفهای است که میتواند یک پروژه پیچیده را در طول چندین هفته مدیریت کند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی حافظه در مدلهای زبانی اشاره کردیم، اکثر سیستمهای فعلی در یک تضاد شدید میان دقت بازیابی و سرعت پاسخدهی گیر کردهاند. برای اکثر توسعهدهندگان، وضعیت فعلی مستلزم حلقههای استدلالی سنگینی است که تعامل در لحظه (Real-time) را غیرممکن میکند.
سیستم Muninn در یک شب ساخته شد و هدف آن رقابت در یک جدول ردهبندی عمومی در برابر رقبای بزرگی مانند Tencent، Mem0، Cognee و MemOS بود. با این حال، توسعهدهنده پنجره زمانی ارسال آثار برای Agent Memory Leaderboard را از دست داد. چرخه بعدی برای ثبتنامهای رسمی در ماه سپتامبر باز خواهد شد.
این سیستم به عنوان یک بازیاب ترکیبی عمل میکند. این مدل، جستوجوی کلمات کلیدی را با بردار معنایی (Embedding) — که مثل یک کارت معرفی عددی برای هر واژه است و همسایگی معنایی کلمات را مشخص میکند — و یک مرحله گسترش پرسوجو (Query-expansion pass) برای یافتن اطلاعات صحیح ترکیب میکند. همچنین از قاعدهای خاص به نام «ثبت/خروج» (Check-in/Check-out) استفاده میکند که طبق آن، هر حقیقت جدید که بعداً در گفتگو بازگو شود، بهطور خودکار جایگزین نسخه قدیمی همان حقیقت میشود.
به دلیل از دست رفتن فرصت ثبت رسمی، توسعهدهنده خط لوله (Pipeline) عمومی را بهطور مستقل و با استفاده از مجموعه داده LoCoMo اجرا کرد. در جدول ردهبندی حافظه عاملها، معمولاً دو وظیفه تعریف میشود: «افزودن» (پردازش تاریخچه گفتگو) و «جستوجو» (بازگرداندن خاطرات برای پاسخ به یک سؤال).
برای شبیهسازی محیط رسمی، توسعهدهنده از مدل gpt-4o-mini هم به عنوان مدل پاسخدهنده و هم به عنوان داور جایگزین استفاده کرد. تحت این شرایط، تخمین داخلی برای بهترین پیکربندی روی صحت ۷۲.۹٪ (تقریباً ۶۶٪ در کل مجموعه داده) قرار گرفت.
در یک محک مستقل دیگر به نام LongMemEval-V2، این سیستم با نام Perpetual Recall در برابر استانداردهای صنعت قرار گرفت. برخلاف اجرای داخلی، این مورد توسط خواننده و داورِ خودِ بنچمارک نمره داده شد تا مقایسهای شفافتر ارائه شود. نتایج این مقایسه را در فهرست زیر ببینید:
- Perpetual Recall (ارسال ما): صحت ۵۶.۹۸٪ با تأخیر ۲.۳ ثانیه
- Perpetual Recall (بدون متن هدایتکننده خواننده): صحت ۵۴.۳۲٪ با تأخیر ۲.۸ ثانیه
- RAG + notes (پایه): صحت ۵۱.۰٪ با تأخیر ۰.۲ ثانیه
- AgentRunbook-R: صحت ۵۸.۶٪ با تأخیر ۲۶.۹ ثانیه
- Codex (ساده): صحت ۶۹.۹٪ با تأخیر ۱۷۷.۲ ثانیه
- AgentRunbook-C (بهترین): صحت ۷۴.۹٪ با تأخیر ۱۰۸.۳ ثانیه
اگرچه AgentRunbook-C از نظر صحت پیشتاز است، اما پاسخ به یک پرسش ساده بیش از ۱۰۰ ثانیه زمان میبرد. در مقابل، Muninn کارایی مشابهی را در کسری از این زمان ارائه میدهد. حتی زمانی که سیستم به حالت «منشأ سختگیرانه» (Strict-provenance) برگردد و هیچ متنی برای هدایت خواننده ارسال نشود، صحت ۵۴.۳۲٪ را حفظ میکند که همچنان بالاتر از خط پایه تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب را باز میکند تا نقلقول بیاورد — است.
جنجالیترین بخش این گزارش به «هدر مبنیسازی» (Grounding Header) مربوط میشود. این هدر یک بلوک دستورالعمل ثابت است که قبل از شواهد به مدل داده میشود و یک داربست کدگذاری شده با سه قانون سختگیرانه دارد:
۱. پاسخ را فقط بر اساس آنچه ثبت شده است مبنی کن.
۲. اگر مورد درخواستی در دادهها نیست، بگو که وجود ندارد.
۳. اگر سؤال حاوی یک پیشفرض غلط است (مثلاً درخواست تب چهارم در حالی که فقط سه تب وجود دارد)، آن را به عنوان پیشفرض غلط شناسایی کن.
طبق گزارش توسعهدهنده، افزودن این ساختار، صحت مدل را به ۶۵.۴۱٪ رساند که ۱۲ درصد بالاتر از اجرای بدون هدر بود. این نتیجه میتوانست سیستم را در رتبه سوم جدول قرار دهد و تنها پس از دو سیستم بسیار سنگین باشد که برای هر پرسش بیش از ۱۰۰ ثانیه زمان میبرند.
اما او عمداً این عدد ۶۵.۴۱٪ را در ارسال رسمی حذف کرد؛ زیرا معتقد است این هدر بیشتر «به داور آموزش میدهد» تا حافظه مدل را بهبود بخشد. جالب است که تقریباً تمام ۵۰ موردی که با این روش درست پاسخ داده شدند، سؤالات «تله» بودند — یعنی سؤالاتی مبنی بر امتناع از پاسخ یا پیشفرضهای غلط که مدل در حالت عادی برای آنها دچار توهم (Hallucination) — شبیه دوستی که خاطرهای را اشتباه و با اطمینان تعریف میکند — میشد.
این موضوع یک شکاف فلسفی در توسعه AI ایجاد میکند: آیا این ساختارها یک «تقلب» در بنچمارک هستند یا یک ضرورت برای محیط تولید؟ برای یک توسعهدهنده، این یعنی برنده شدن در دنیای واقعی، لزوماً به معنای داشتن یک پایگاهداده برداری بهتر نیست، بلکه داشتن یک ساختار دستوری سختگیرانه است. این رویکرد بهینهسازی برای رسیدن به نتایج دقیق در کمترین زمان، یادآور توانمندیهای سیستمهای نظارتی است که مانند NexaVerify توانستهاند با سرعت خیرهکننده و دقت بالا متخصصان انسانی را در شناسایی حفرههای امنیتی شکست دهند.
در محصولات واقعی، این هدرها مانع از توهم مدل میشوند. شواهد نشان میدهد که برنده اصلی جدول LongMemEval-V2 نیز برتری خود را مدیون یک «مانیفست» ساختاریافته دقیقاً به همین شکل است. این تغییر نشان میدهد بنچمارکهایی که سعی میکنند حافظه را بهصورت ایزوله بسنجند، شاید مکانیسمهایی را نادیده میگیرند که AI را در میدان عمل قابلاعتماد میکند. اگر یک بنچمارک برای منصفانه بودن مجبور باشد این داربستها را حذف کند، ممکن است هرگز به جزئی که بیشترین کار را در محیط تولید انجام میدهد، اعتبار ندهد.
گام بعدی شما
- اگر از RAG ساده استفاده میکنید، یک «هدر مبنیسازی» با قوانین صریح (مانند اعتراف به نبود پاسخ) را به پرامپت خود اضافه کنید تا نرخ توهم کاهش یابد.
- در ارزیابی عاملهای خود، تأخیر (Latency) را به عنوان یک معیار کلیدی در کنار صحت (Accuracy) قرار دهید؛ دقتی که ۱۰۰ ثانیه زمان میبرد در محیط تولید بیفایده است.
- بازگشایی Agent Memory Leaderboard در سپتامبر را دنبال کنید تا ببینید آیا Muninn میتواند این نسبت سرعت به دقت را در محیط رسمی حفظ کند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو