پرش به محتوای اصلی
پرش به محتوای مقاله

سیستم Muninn تأخیر بازیابی حافظه در عامل‌های AI را به ۳ ثانیه رساند

·۳ شهریور ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
ددلاین را از دست دادم — بنابراین خودم بنچمارک را اجرا کردم تا برای بازگشایی آماده شوم
ددلاین را از دست دادم — بنابراین خودم بنچمارک را اجرا کردم تا برای بازگشایی آماده شوم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش تأخیر بازیابی حافظه از سطح دقیقه به زیر ۳ ثانیه در حالی که صحت مدل در سطح بنچمارک‌های پیشرو باقی مانده است؛ این اولین بار است که چنین شکاف بزرگی در سرعت پاسخ‌دهی حافظه‌های عامل‌محور مشاهده می‌شود.

اگر امروز یک عامل هوش مصنوعی برای مدیریت پروژه‌های طولانی‌مدت می‌سازید، احتمالاً با این واقعیت تلخ رو‌به‌رو هستید که مدل یا حافظه‌اش را از دست می‌دهد یا کاربر را دقایقی برای یک پاسخ ساده منتظر می‌گذارد. سیستم Muninn این معادله را تغییر داده و تأخیر استنتاج را از چندین دقیقه به زیر ۳ ثانیه رسانده است. در حالی که بنچمارک‌های حافظه در رتبه‌های برتر معمولاً نیازمند سربار محاسباتی عظیمی هستند، این سیستم جدید توانسته است عملکردی نزدیک به مرزهای پیشرو (Frontier Performance) را با کاهش شدید زمان انتظار به دست آورد.

به نقل از گزارشی در The Organism Files، این سیستم می‌تواند در عین حفظ دقتِ مدل‌های پیشرو و سنگین، سرعت پاسخ‌دهی را به‌طور چشم‌گیری افزایش دهد و تأخیرهای پردازشی مرتبط با آن‌ها را حذف کند. در دنیای عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندی که باید تمام جزئیات جلسات هفته‌های گذشته را به خاطر داشته باشد تا پروژه را پیش ببرد — حافظه همان مرز میان یک بات فراموش‌کار که هر ده دقیقه نام شما را فراموش می‌کند و یک دستیار حرفه‌ای است که می‌تواند یک پروژه پیچیده را در طول چندین هفته مدیریت کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی حافظه در مدل‌های زبانی اشاره کردیم، اکثر سیستم‌های فعلی در یک تضاد شدید میان دقت بازیابی و سرعت پاسخ‌دهی گیر کرده‌اند. برای اکثر توسعه‌دهندگان، وضعیت فعلی مستلزم حلقه‌های استدلالی سنگینی است که تعامل در لحظه (Real-time) را غیرممکن می‌کند.

سیستم Muninn در یک شب ساخته شد و هدف آن رقابت در یک جدول رده‌بندی عمومی در برابر رقبای بزرگی مانند Tencent، Mem0، Cognee و MemOS بود. با این حال، توسعه‌دهنده پنجره زمانی ارسال آثار برای Agent Memory Leaderboard را از دست داد. چرخه بعدی برای ثبت‌نام‌های رسمی در ماه سپتامبر باز خواهد شد.

این سیستم به عنوان یک بازیاب ترکیبی عمل می‌کند. این مدل، جست‌وجوی کلمات کلیدی را با بردار معنایی (Embedding) — که مثل یک کارت معرفی عددی برای هر واژه است و همسایگی معنایی کلمات را مشخص می‌کند — و یک مرحله گسترش پرس‌وجو (Query-expansion pass) برای یافتن اطلاعات صحیح ترکیب می‌کند. همچنین از قاعده‌ای خاص به نام «ثبت/خروج» (Check-in/Check-out) استفاده می‌کند که طبق آن، هر حقیقت جدید که بعداً در گفتگو بازگو شود، به‌طور خودکار جایگزین نسخه قدیمی همان حقیقت می‌شود.

به دلیل از دست رفتن فرصت ثبت رسمی، توسعه‌دهنده خط لوله (Pipeline) عمومی را به‌طور مستقل و با استفاده از مجموعه داده LoCoMo اجرا کرد. در جدول رده‌بندی حافظه عامل‌ها، معمولاً دو وظیفه تعریف می‌شود: «افزودن» (پردازش تاریخچه گفتگو) و «جست‌وجو» (بازگرداندن خاطرات برای پاسخ به یک سؤال).

برای شبیه‌سازی محیط رسمی، توسعه‌دهنده از مدل gpt-4o-mini هم به عنوان مدل پاسخ‌دهنده و هم به عنوان داور جایگزین استفاده کرد. تحت این شرایط، تخمین داخلی برای بهترین پیکربندی روی صحت ۷۲.۹٪ (تقریباً ۶۶٪ در کل مجموعه داده) قرار گرفت.

در یک محک مستقل دیگر به نام LongMemEval-V2، این سیستم با نام Perpetual Recall در برابر استانداردهای صنعت قرار گرفت. برخلاف اجرای داخلی، این مورد توسط خواننده و داورِ خودِ بنچمارک نمره داده شد تا مقایسه‌ای شفاف‌تر ارائه شود. نتایج این مقایسه را در فهرست زیر ببینید:

  • Perpetual Recall (ارسال ما): صحت ۵۶.۹۸٪ با تأخیر ۲.۳ ثانیه
  • Perpetual Recall (بدون متن هدایت‌کننده خواننده): صحت ۵۴.۳۲٪ با تأخیر ۲.۸ ثانیه
  • RAG + notes (پایه): صحت ۵۱.۰٪ با تأخیر ۰.۲ ثانیه
  • AgentRunbook-R: صحت ۵۸.۶٪ با تأخیر ۲۶.۹ ثانیه
  • Codex (ساده): صحت ۶۹.۹٪ با تأخیر ۱۷۷.۲ ثانیه
  • AgentRunbook-C (بهترین): صحت ۷۴.۹٪ با تأخیر ۱۰۸.۳ ثانیه

اگرچه AgentRunbook-C از نظر صحت پیشتاز است، اما پاسخ به یک پرسش ساده بیش از ۱۰۰ ثانیه زمان می‌برد. در مقابل، Muninn کارایی مشابهی را در کسری از این زمان ارائه می‌دهد. حتی زمانی که سیستم به حالت «منشأ سخت‌گیرانه» (Strict-provenance) برگردد و هیچ متنی برای هدایت خواننده ارسال نشود، صحت ۵۴.۳۲٪ را حفظ می‌کند که همچنان بالاتر از خط پایه تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب را باز می‌کند تا نقل‌قول بیاورد — است.

جنجالی‌ترین بخش این گزارش به «هدر مبنی‌سازی» (Grounding Header) مربوط می‌شود. این هدر یک بلوک دستورالعمل ثابت است که قبل از شواهد به مدل داده می‌شود و یک داربست کدگذاری شده با سه قانون سخت‌گیرانه دارد:
۱. پاسخ را فقط بر اساس آنچه ثبت شده است مبنی کن.
۲. اگر مورد درخواستی در داده‌ها نیست، بگو که وجود ندارد.
۳. اگر سؤال حاوی یک پیش‌فرض غلط است (مثلاً درخواست تب چهارم در حالی که فقط سه تب وجود دارد)، آن را به عنوان پیش‌فرض غلط شناسایی کن.

طبق گزارش توسعه‌دهنده، افزودن این ساختار، صحت مدل را به ۶۵.۴۱٪ رساند که ۱۲ درصد بالاتر از اجرای بدون هدر بود. این نتیجه می‌توانست سیستم را در رتبه سوم جدول قرار دهد و تنها پس از دو سیستم بسیار سنگین باشد که برای هر پرسش بیش از ۱۰۰ ثانیه زمان می‌برند.

اما او عمداً این عدد ۶۵.۴۱٪ را در ارسال رسمی حذف کرد؛ زیرا معتقد است این هدر بیشتر «به داور آموزش می‌دهد» تا حافظه مدل را بهبود بخشد. جالب است که تقریباً تمام ۵۰ موردی که با این روش درست پاسخ داده شدند، سؤالات «تله» بودند — یعنی سؤالاتی مبنی بر امتناع از پاسخ یا پیش‌فرض‌های غلط که مدل در حالت عادی برای آن‌ها دچار توهم (Hallucination) — شبیه دوستی که خاطره‌ای را اشتباه و با اطمینان تعریف می‌کند — می‌شد.

این موضوع یک شکاف فلسفی در توسعه AI ایجاد می‌کند: آیا این ساختارها یک «تقلب» در بنچمارک هستند یا یک ضرورت برای محیط تولید؟ برای یک توسعه‌دهنده، این یعنی برنده شدن در دنیای واقعی، لزوماً به معنای داشتن یک پایگاه‌داده برداری بهتر نیست، بلکه داشتن یک ساختار دستوری سخت‌گیرانه است. این رویکرد بهینه‌سازی برای رسیدن به نتایج دقیق در کمترین زمان، یادآور توانمندی‌های سیستم‌های نظارتی است که مانند NexaVerify توانسته‌اند با سرعت خیره‌کننده و دقت بالا متخصصان انسانی را در شناسایی حفره‌های امنیتی شکست دهند.

در محصولات واقعی، این هدرها مانع از توهم مدل می‌شوند. شواهد نشان می‌دهد که برنده اصلی جدول LongMemEval-V2 نیز برتری خود را مدیون یک «مانیفست» ساختاریافته دقیقاً به همین شکل است. این تغییر نشان می‌دهد بنچمارک‌هایی که سعی می‌کنند حافظه را به‌صورت ایزوله بسنجند، شاید مکانیسم‌هایی را نادیده می‌گیرند که AI را در میدان عمل قابل‌اعتماد می‌کند. اگر یک بنچمارک برای منصفانه بودن مجبور باشد این داربست‌ها را حذف کند، ممکن است هرگز به جزئی که بیشترین کار را در محیط تولید انجام می‌دهد، اعتبار ندهد.

گام بعدی شما

  • اگر از RAG ساده استفاده می‌کنید، یک «هدر مبنی‌سازی» با قوانین صریح (مانند اعتراف به نبود پاسخ) را به پرامپت خود اضافه کنید تا نرخ توهم کاهش یابد.
  • در ارزیابی عامل‌های خود، تأخیر (Latency) را به عنوان یک معیار کلیدی در کنار صحت (Accuracy) قرار دهید؛ دقتی که ۱۰۰ ثانیه زمان می‌برد در محیط تولید بی‌فایده است.
  • بازگشایی Agent Memory Leaderboard در سپتامبر را دنبال کنید تا ببینید آیا Muninn می‌تواند این نسبت سرعت به دقت را در محیط رسمی حفظ کند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تجربه عملی در بهینه‌سازی بازیابی، ثابت می‌کند که می‌توان بدون نیاز به محاسبات سنگین، به دقتی نزدیک به مدل‌های پیشرو رسید. این موضوع برای شرکت‌هایی که به دنبال استقرار عامل‌های AI در مقیاس واقعی با تأخیر کم هستند، یک نقطه عطف است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت منابع GPU رو‌به‌رو هستند، می‌توانند از رویکرد ترکیبی Muninn برای ساخت عامل‌هایی با سرعت بالا و هزینه استنتاج کم استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بنچمارک‌های فعلی بر ایزوله‌سازی حافظه، باعث می‌شود ابزارهای عملیاتی مانند «هدرهای مبنی‌سازی» به عنوان تقلب دیده شوند، در حالی که این‌ها دقیقاً همان چیزی هستند که در محیط تولید تفاوت بین یک محصول تجاری و یک دموی آزمایشگاهی را می‌سازند. برتری Muninn نشان می‌دهد که آینده عامل‌های AI نه در مدل‌های بزرگ‌تر، بلکه در لایه‌های مدیریت بازیابی است که بتوانند تعادل میان تأخیر و صحت را به نفع تجربه کاربر تغییر دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.