اگر در حال توسعهٔ عاملهای هوش مصنوعی هستید، احتمالاً میدانید که حافظهٔ بلندمدت بزرگترین نقطه ضعف این سیستمهاست. امتیاز ۸۱.۶ درصدی در محک LongMemEval-S، عملکرد فعلی Engrava 0.6.0 را به عنوان یک لایهٔ حافظهٔ محلی برای عاملها تعریف میکند. طبق گزارش فنی منتشر شده در ۲۷ اوت ۲۰۲۶، این نتیجه بهگونهای طراحی شده که کاملاً بازتولیدپذیر باشد. این یعنی توسعهدهندگان بهجای اعتماد به یک پست وبلاگی ایستا، میتوانند خودشان عدد نهایی را تأیید کنند.
بسیاری از محکهای حافظه در فضای فعلی هوش مصنوعی مبهم هستند. آنها معمولاً پنهان میکنند که کدام مدل خواننده (Reader) به پرسشها پاسخ داده، داور چگونه امتیازها را محاسبه کرده، چه مقدار زمینه (Context) به بازیاب اجازه داده شده تا تغذیه کند، یا اینکه آیا یک مدل زبانی (LLM) پنهان در لایهٔ حافظه کارهای سخت را انجام داده است یا خیر. این فقدان شفافیت باعث میشود مقایسهٔ دقیق سیستمهای مختلف حافظه تقریباً غیرممکن شود، زیرا یک گزارش «X درصدی» اغلب هیچ راهی برای بررسی مکانیسمهای زیربنایی ارائه نمیدهد. در همین راستا، برخی از استانداردهای فعلی مانند محک LOCOMO با حذف پرسشهای خصمانه، متهم به ایجاد توهمِ دقت در حافظهٔ عاملها شدهاند.
Engrava برای حل این مشکل، مخزن کد عمومی و مصنوعات (Artifacts) خاص مربوط به اجرای اوت ۲۰۲۶ را منتشر کرده است. تیم توسعه با تثبیت نسخهٔ کد (commit) اجراکننده و ویرایش مجموعه داده، تضمین کرده که هر توسعهدهندهای میتواند با کلون کردن مخزن، دقیقاً همان امتیاز را تکرار کند. این رویکرد، بنچمارک را از یک ادعای ساده به یک رکورد قابل تأیید تبدیل میکند.
معماری فنی
رویکرد Engrava به حافظه با پایگاهدادههای برداری استاندارد بنیاداً متفاوت است. این سیستم صرفاً یک ایندکس برداری نیست که یک گراف به آن چسبانده شده باشد؛ بلکه یک سیستم منسجم است که تمام اجزای اثرگذار بر امتیاز در بستهٔ رایگان آن گنجانده شده است. این سیستم برای مدیریت وضعیت داخلی خود به مدلهای مولد تکیه نمیکند، بلکه از یک خط لوله قطعی (Deterministic Pipeline) استفاده میکند:
- گراف دانش تایپشده (Typed Knowledge Graph): افکار را بهصورت گرههایی ذخیره میکند که هفت نوع یال متمایز بین آنها وجود دارد.
- جستوجوی ترکیبی (Hybrid Search): این سیستم شباهت برداری، جستوجوی متنی BM25 روی متن و تازگی دادهها (Recency) را در یک پرسوجوی واحد ادغام میکند.
- دقت در سطح نوبت (Turn-Level Granularity): بازیاب دقیقاً نوبت کاربر مورد نیاز برای یک پرسش را هدف قرار میدهد تا از «تاری» یا ابهام ناشی از میانگینهای سطح نشست (Session-level) جلوگیری شود.
- ذخیرهسازی محلی: تمام این اجزا در یک ذخیرهٔ SQLite تعبیه شده (Embedded) زندگی میکنند و به هیچ سرور خارجی نیاز ندارند.

جزئیات محک و نتایج
در اجرای اوت ۲۰۲۶، نسخه 0.6.0 امتیاز ۸۱.۶٪ (micro) و ۸۱.۷۶٪ (macro) را در شش دستهٔ پرسشی به دست آورد. این نتیجه با استفاده از مجموعه کامل ۵۰۰ پرسشی LongMemEval-S اندازهگیری شد. در این اجرا از امتیازدهنده استاندارد LongMemEval (تثبیت شده روی یک commit شناخته شده در بالادست)، مقدار top_k برابر با ۲۰ نوبت بازیابی شده و مدل gpt-4o-2024-08-06 بهعنوان خواننده و داور از طریق API شرکت OpenAI استفاده شد.
این عدد کاهش اندکی نسبت به نسخه 0.5.0 (جولای ۲۰۲۶) دارد که در همان ۵۰۰ پرسش و با همان خواننده، داور، امتیازدهنده و top_k امتیاز ۸۲.۴٪ (micro) و ۸۲.۵۸٪ (macro) را کسب کرده بود. تیم توسعه تصمیم گرفت نتیجه 0.6.0 را به عنوان نتیجه اصلی ارائه دهد چون نسخه فعلی است، اما ردیف نسخه 0.5.0 را در جدول امتیازات نگه داشت تا از عادت رایج حذف اعداد پایینتر جلوگیری کند؛ عادتی که به باور آنها صفحات بنچمارک را بیارزش میکند.
تحلیل شکاف چهار پرسشی
کاهش اعداد معمولاً نشانهٔ پسرفت (Regression) است، اما تیم توسعه با تحلیل مصنوعات، حقیقت را جستوجو کرد. شکاف بین این دو اجرا دقیقاً چهار پرسش از ۵۰۰ مورد بود. آنها دریافتند که در ۴۵۷ مورد از ۵۰۰ پرسش، زمینهٔ بازیابی شده (Retrieved Context) بین دو نسخه کاملاً یکسان بود. در ۴۳ موردی که زمینهٔ بازیابی تفاوت داشت، حتی یک پاسخ هم تغییر نکرد.
تمام ۳۲ پرسشی که نتیجهشان تغییر کرد (۱۸ مورد کاهش و ۱۴ مورد افزایش که در مجموع منجر به تفاوت ۴ پرسشی شد)، در هر دو اجرا متن بازیابی کاملاً یکسانی دریافت کرده بودند؛ یعنی همان قطعات متن با همان ترتیب. این موضوع ثابت میکند که تفاوت ناشی از لایهٔ حافظه نبوده است. از آنج که ورودی مدل خواننده تغییر نکرده بود، نوسان از خودِ مدل خواننده و داور نشأت گرفته است که حتی در دمای صفر (Temperature 0) نیز قطعی (Deterministic) نیستند.
هزینه و بهرهوری
یکی از حیاتیترین تمایزات این معماری، نبود مدلهای زبانی (LLMs) در خط لولهٔ حافظه است. در اصطلاحات بنچمارک، این یک اجرای «گروه A» است، به این معنی که لیست memory_pipeline_llms خالی است. فرآیند جذب (Ingestion) و بازیابی کاملاً قطعی است و از جستوجوی ترکیبی روی یک گراف تایپشده استفاده میکند، بدون اینکه مدلی برای استخراج، خلاصهسازی یا بازرتبهبندی (Reranking) پشت پرده فعالیت کند.
بسیاری از سیستمهای حافظه در هر بار نوشتن، یک مدل مولد را فراخوانی میکنند تا تصمیم بگیرند چه چیزی ذخیره شود، آن را خلاصه کنند یا در هنگام خواندن، نتایج را بازرتبهبندی کنند. این امر ساختار هزینهای ایجاد میکند که در آن صورتحساب شما بر اساس میزان خواندن و نوشتن عامل است، نه مقدار دادهٔ ذخیره شده. Engrava با تضمین اینکه خواندن و نوشتن در حافظه توکنهای مدل زبانی مولد را مصرف نمیکند، از این هزینه اجتناب میکند. این رویکرد در مقایسه با سنجش کارآمدی معماریهای حافظه مانند Mem0، Zep و Letta، بر کاهش وابستگی به مدلهای مولد در لایه ذخیرهسازی تأکید دارد.
اگرچه جستوجوی برداری همچنان در زمان نوشتن به یک Embedding نیاز دارد، اما این کار توسط یک مدل Embedder ارزان و قابل تعویض انجام میشود که میتواند کاملاً محلی اجرا شود. این امر تضمین میکند که برای هر عملیات، نیازی به کارهای گرانقیمت یک مدل مولد نباشد.
بازتولید نتایج
برای تأیید این ادعاها، تیم توسعه مخزن sovantica/engrava-benchmark را تحت لایسنس MIT منتشر کرده است. فرآیند بازتولید شامل کلون کردن مخزن، تثبیت اجراکننده روی commit a45dde9 و نصب engrava==0.6.0 از طریق PyPI است.
گردش کار بازتولید به شرح زیر است:
git clone https://github.com/sovantica/engrava-benchmark.gitgit checkout a45dde9make installpip install "engrava==0.6.0"export OPENAI_API_KEY=...export ENGRAVA_BENCH_LONGMEMEVAL_S=<path>/longmemeval_s_cleaned.jsonpython runners/longmemeval/run.py
کاربران باید از مجموعه داده پاکسازی شده LongMemEval-S در Hugging Face (xiaowu0162/longmemeval-cleaned) استفاده کنند و نه فایل خام longmemeval_s.json. ردیف نتایج این مجموعه داده را با sha256 تثبیت میکند؛ هر ویرایش متفاوتی منجر به امتیاز متفاوتی میشود. سیستم همچنین شامل یک پرچم --smoke است که به توسعهدهندگان اجازه میدهد پیش از صرف اعتبار API، اتصالات را با یک Embedder محلی و یک خواننده شبیهساز (Mock Reader) بهصورت رایگان تست کنند.
محدودیتهای صادقانه دادهها
باید توجه داشت که این نتایج بهطور خاص بخش بازیابی (Retrieval) را میسنجند. تضمینهای ساختاری دیگری که Engrava ارائه میدهد — مانند ژورنال متصل با هش (Hash-linked journal)، یالهای تایپشده و MindQL — ویژگیهای جداگانهای هستند و توسط این عدد اندازهگیری نمیشوند. علاوه بر این، قابلیت تثبیت پسزمینه یا «رؤیاپردازی» (Consolidation) که یک بهداشت حافظهٔ قطعی است، برای این اجرا خاموش بود؛ بنابراین، این عدد تأثیر تثبیت حافظه بر یادآوری در افقهای زمانی بلند را نمیسنجد.
دو ردیف نتایج در بخشهای مقایسهای جداگانهای قرار دارند. اگرچه آنها ویرایش مجموعه داده، اسنپشاتهای خواننده/داور و top_k یکسانی دارند، اما توسط commit مربوط به Harness از هم جدا شدهاند. یک عدد تنها زمانی قابل مقایسه است که در بخشی باشد که تمام این محورها با هم مطابقت داشته باشند. هر پرچمی که مدل یا نقطه انتهایی (Endpoint) را تغییر دهد، نتیجه را از بخش قابل مقایسه خارج میکند.
تحلیل: تغییر استاندارد بنچمارکها
این انتشار نشاندهنده تغییری به سمت بنچمارکهای «آمادهٔ حسابرسی» (Audit-ready) در هوش مصنوعی است. Engrava با امتناع از حذف امتیاز بالاتر نسخه 0.5.0، عادت صنعت به گلچین کردن (Cherry-picking) بهترین عدد ممکن برای ارائه به عموم را به چالش میکشد.
برای توسعهدهندگانی که عاملهای هوش مصنوعی میسازند، ارزش واقعی در اینجا جداسازی کیفیت بازیابی از هزینهٔ تولید است. اگر یک سیستم محلی و قطعی بتواند دقت حدود ۸۲٪ را در یادآوری بلندمدت حفظ کند، استدلال برای استفاده از لایههای حافظه گرانقیمت که توسط LLM مدیریت میشوند، بهشدت تضعیف میشود. این روند با برتری مدلهای کوچک در محاسبات محلی همسو است که نشان میدهد بهرهوری لبهای در حال تبدیل شدن به یک اولویت است.
این رویکرد، حوزهٔ حافظه را از «جعبه سیاه» دور کرده و به سمت یک دیسیپلین مهندسی قابل تأیید میبرد. این امر سایر ارائهدهندگان حافظه را مجبور میکند تا اگر میخواهند در محیطهای عملیاتی (Production) جدی گرفته شوند، مقادیر top_k، مدلهای داور و میزان قطعی بودن خط لوله خود را افشا کنند.
اگر در حال حاضر در حال ارزیابی حافظهٔ عاملها هستید، قابلاعتمادترین مسیر دیگر خواندن جدول امتیازات نیست. در عوض، باید یک آداپتور واحد برای لایهٔ حافظه انتخابی خود بنویسید و آن را از طریق یک خواننده و امتیازدهنده ثابت اجرا کنید تا تفاوت واقعی را در حجم کاری خاص خود مشاهده کنید. این تنها مقایسهای است که سیگنال واقعی ارائه میدهد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو