پرش به محتوای اصلی
پرش به محتوای مقاله

بازیابی قطعی در برابر لایه‌های مولد در مدیریت حافظه Engrava

·۶ شهریور ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
نمودار مقایسه دقت بازیابی در طول زمان برای مدل‌های مختلف حافظه طولانی‌مدت
نمودار مقایسه دقت بازیابی در طول زمان برای مدل‌های مختلف حافظه طولانی‌مدت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه حافظه برای عامل‌ها که به‌جای استفاده از مدل‌های زبانی برای مدیریت وضعیت داخلی، از یک خط لوله قطعی و بازتولیدپذیر استفاده می‌کند تا هزینه را حذف و شفافیت را افزایش دهد.

اگر در حال توسعهٔ عامل‌های هوش مصنوعی هستید، احتمالاً می‌دانید که حافظهٔ بلندمدت بزرگ‌ترین نقطه ضعف این سیستم‌هاست. امتیاز ۸۱.۶ درصدی در محک LongMemEval-S، عملکرد فعلی Engrava 0.6.0 را به عنوان یک لایهٔ حافظهٔ محلی برای عامل‌ها تعریف می‌کند. طبق گزارش فنی منتشر شده در ۲۷ اوت ۲۰۲۶، این نتیجه به‌گونه‌ای طراحی شده که کاملاً بازتولیدپذیر باشد. این یعنی توسعه‌دهندگان به‌جای اعتماد به یک پست وبلاگی ایستا، می‌توانند خودشان عدد نهایی را تأیید کنند.

بسیاری از محک‌های حافظه در فضای فعلی هوش مصنوعی مبهم هستند. آن‌ها معمولاً پنهان می‌کنند که کدام مدل خواننده (Reader) به پرسش‌ها پاسخ داده، داور چگونه امتیازها را محاسبه کرده، چه مقدار زمینه (Context) به بازیاب اجازه داده شده تا تغذیه کند، یا اینکه آیا یک مدل زبانی (LLM) پنهان در لایهٔ حافظه کارهای سخت را انجام داده است یا خیر. این فقدان شفافیت باعث می‌شود مقایسهٔ دقیق سیستم‌های مختلف حافظه تقریباً غیرممکن شود، زیرا یک گزارش «X درصدی» اغلب هیچ راهی برای بررسی مکانیسم‌های زیربنایی ارائه نمی‌دهد. در همین راستا، برخی از استانداردهای فعلی مانند محک LOCOMO با حذف پرسش‌های خصمانه، متهم به ایجاد توهمِ دقت در حافظهٔ عامل‌ها شده‌اند.

Engrava برای حل این مشکل، مخزن کد عمومی و مصنوعات (Artifacts) خاص مربوط به اجرای اوت ۲۰۲۶ را منتشر کرده است. تیم توسعه با تثبیت نسخهٔ کد (commit) اجراکننده و ویرایش مجموعه داده، تضمین کرده که هر توسعه‌دهنده‌ای می‌تواند با کلون کردن مخزن، دقیقاً همان امتیاز را تکرار کند. این رویکرد، بنچمارک را از یک ادعای ساده به یک رکورد قابل تأیید تبدیل می‌کند.

معماری فنی

رویکرد Engrava به حافظه با پایگاه‌داده‌های برداری استاندارد بنیاداً متفاوت است. این سیستم صرفاً یک ایندکس برداری نیست که یک گراف به آن چسبانده شده باشد؛ بلکه یک سیستم منسجم است که تمام اجزای اثرگذار بر امتیاز در بستهٔ رایگان آن گنجانده شده است. این سیستم برای مدیریت وضعیت داخلی خود به مدل‌های مولد تکیه نمی‌کند، بلکه از یک خط لوله قطعی (Deterministic Pipeline) استفاده می‌کند:

  • گراف دانش تایپ‌شده (Typed Knowledge Graph): افکار را به‌صورت گره‌هایی ذخیره می‌کند که هفت نوع یال متمایز بین آن‌ها وجود دارد.
  • جست‌وجوی ترکیبی (Hybrid Search): این سیستم شباهت برداری، جست‌وجوی متنی BM25 روی متن و تازگی داده‌ها (Recency) را در یک پرس‌وجوی واحد ادغام می‌کند.
  • دقت در سطح نوبت (Turn-Level Granularity): بازیاب دقیقاً نوبت کاربر مورد نیاز برای یک پرسش را هدف قرار می‌دهد تا از «تاری» یا ابهام ناشی از میانگین‌های سطح نشست (Session-level) جلوگیری شود.
  • ذخیره‌سازی محلی: تمام این اجزا در یک ذخیرهٔ SQLite تعبیه شده (Embedded) زندگی می‌کنند و به هیچ سرور خارجی نیاز ندارند.

نمودار مقایسه دقت مدل‌های مختلف در بازیابی بلندمدت بر روی مجموعه داده LongMemEval-S

جزئیات محک و نتایج

در اجرای اوت ۲۰۲۶، نسخه 0.6.0 امتیاز ۸۱.۶٪ (micro) و ۸۱.۷۶٪ (macro) را در شش دستهٔ پرسشی به دست آورد. این نتیجه با استفاده از مجموعه کامل ۵۰۰ پرسشی LongMemEval-S اندازه‌گیری شد. در این اجرا از امتیازدهنده استاندارد LongMemEval (تثبیت شده روی یک commit شناخته شده در بالادست)، مقدار top_k برابر با ۲۰ نوبت بازیابی شده و مدل gpt-4o-2024-08-06 به‌عنوان خواننده و داور از طریق API شرکت OpenAI استفاده شد.

این عدد کاهش اندکی نسبت به نسخه 0.5.0 (جولای ۲۰۲۶) دارد که در همان ۵۰۰ پرسش و با همان خواننده، داور، امتیازدهنده و top_k امتیاز ۸۲.۴٪ (micro) و ۸۲.۵۸٪ (macro) را کسب کرده بود. تیم توسعه تصمیم گرفت نتیجه 0.6.0 را به عنوان نتیجه اصلی ارائه دهد چون نسخه فعلی است، اما ردیف نسخه 0.5.0 را در جدول امتیازات نگه داشت تا از عادت رایج حذف اعداد پایین‌تر جلوگیری کند؛ عادتی که به باور آن‌ها صفحات بنچمارک را بی‌ارزش می‌کند.

تحلیل شکاف چهار پرسشی

کاهش اعداد معمولاً نشانهٔ پس‌رفت (Regression) است، اما تیم توسعه با تحلیل مصنوعات، حقیقت را جست‌وجو کرد. شکاف بین این دو اجرا دقیقاً چهار پرسش از ۵۰۰ مورد بود. آن‌ها دریافتند که در ۴۵۷ مورد از ۵۰۰ پرسش، زمینهٔ بازیابی شده (Retrieved Context) بین دو نسخه کاملاً یکسان بود. در ۴۳ موردی که زمینهٔ بازیابی تفاوت داشت، حتی یک پاسخ هم تغییر نکرد.

تمام ۳۲ پرسشی که نتیجه‌شان تغییر کرد (۱۸ مورد کاهش و ۱۴ مورد افزایش که در مجموع منجر به تفاوت ۴ پرسشی شد)، در هر دو اجرا متن بازیابی کاملاً یکسانی دریافت کرده بودند؛ یعنی همان قطعات متن با همان ترتیب. این موضوع ثابت می‌کند که تفاوت ناشی از لایهٔ حافظه نبوده است. از آنج که ورودی مدل خواننده تغییر نکرده بود، نوسان از خودِ مدل خواننده و داور نشأت گرفته است که حتی در دمای صفر (Temperature 0) نیز قطعی (Deterministic) نیستند.

هزینه و بهره‌وری

یکی از حیاتی‌ترین تمایزات این معماری، نبود مدل‌های زبانی (LLMs) در خط لولهٔ حافظه است. در اصطلاحات بنچمارک، این یک اجرای «گروه A» است، به این معنی که لیست memory_pipeline_llms خالی است. فرآیند جذب (Ingestion) و بازیابی کاملاً قطعی است و از جست‌وجوی ترکیبی روی یک گراف تایپ‌شده استفاده می‌کند، بدون اینکه مدلی برای استخراج، خلاصه‌سازی یا بازرتبه‌بندی (Reranking) پشت پرده فعالیت کند.

بسیاری از سیستم‌های حافظه در هر بار نوشتن، یک مدل مولد را فراخوانی می‌کنند تا تصمیم بگیرند چه چیزی ذخیره شود، آن را خلاصه کنند یا در هنگام خواندن، نتایج را بازرتبه‌بندی کنند. این امر ساختار هزینه‌ای ایجاد می‌کند که در آن صورت‌حساب شما بر اساس میزان خواندن و نوشتن عامل است، نه مقدار دادهٔ ذخیره شده. Engrava با تضمین اینکه خواندن و نوشتن در حافظه توکن‌های مدل زبانی مولد را مصرف نمی‌کند، از این هزینه اجتناب می‌کند. این رویکرد در مقایسه با سنجش کارآمدی معماری‌های حافظه مانند Mem0، Zep و Letta، بر کاهش وابستگی به مدل‌های مولد در لایه ذخیره‌سازی تأکید دارد.

اگرچه جست‌وجوی برداری همچنان در زمان نوشتن به یک Embedding نیاز دارد، اما این کار توسط یک مدل Embedder ارزان و قابل تعویض انجام می‌شود که می‌تواند کاملاً محلی اجرا شود. این امر تضمین می‌کند که برای هر عملیات، نیازی به کارهای گران‌قیمت یک مدل مولد نباشد.

بازتولید نتایج

برای تأیید این ادعاها، تیم توسعه مخزن sovantica/engrava-benchmark را تحت لایسنس MIT منتشر کرده است. فرآیند بازتولید شامل کلون کردن مخزن، تثبیت اجراکننده روی commit a45dde9 و نصب engrava==0.6.0 از طریق PyPI است.

گردش کار بازتولید به شرح زیر است:

  • git clone https://github.com/sovantica/engrava-benchmark.git
  • git checkout a45dde9
  • make install
  • pip install "engrava==0.6.0"
  • export OPENAI_API_KEY=...
  • export ENGRAVA_BENCH_LONGMEMEVAL_S=<path>/longmemeval_s_cleaned.json
  • python runners/longmemeval/run.py

کاربران باید از مجموعه داده پاک‌سازی شده LongMemEval-S در Hugging Face (xiaowu0162/longmemeval-cleaned) استفاده کنند و نه فایل خام longmemeval_s.json. ردیف نتایج این مجموعه داده را با sha256 تثبیت می‌کند؛ هر ویرایش متفاوتی منجر به امتیاز متفاوتی می‌شود. سیستم همچنین شامل یک پرچم --smoke است که به توسعه‌دهندگان اجازه می‌دهد پیش از صرف اعتبار API، اتصالات را با یک Embedder محلی و یک خواننده شبیه‌ساز (Mock Reader) به‌صورت رایگان تست کنند.

محدودیت‌های صادقانه داده‌ها

باید توجه داشت که این نتایج به‌طور خاص بخش بازیابی (Retrieval) را می‌سنجند. تضمین‌های ساختاری دیگری که Engrava ارائه می‌دهد — مانند ژورنال متصل با هش (Hash-linked journal)، یال‌های تایپ‌شده و MindQL — ویژگی‌های جداگانه‌ای هستند و توسط این عدد اندازه‌گیری نمی‌شوند. علاوه بر این، قابلیت تثبیت پس‌زمینه یا «رؤیاپردازی» (Consolidation) که یک بهداشت حافظهٔ قطعی است، برای این اجرا خاموش بود؛ بنابراین، این عدد تأثیر تثبیت حافظه بر یادآوری در افق‌های زمانی بلند را نمی‌سنجد.

دو ردیف نتایج در بخش‌های مقایسه‌ای جداگانه‌ای قرار دارند. اگرچه آن‌ها ویرایش مجموعه داده، اسنپ‌شات‌های خواننده/داور و top_k یکسانی دارند، اما توسط commit مربوط به Harness از هم جدا شده‌اند. یک عدد تنها زمانی قابل مقایسه است که در بخشی باشد که تمام این محورها با هم مطابقت داشته باشند. هر پرچمی که مدل یا نقطه انتهایی (Endpoint) را تغییر دهد، نتیجه را از بخش قابل مقایسه خارج می‌کند.

تحلیل: تغییر استاندارد بنچمارک‌ها

این انتشار نشان‌دهنده تغییری به سمت بنچمارک‌های «آمادهٔ حسابرسی» (Audit-ready) در هوش مصنوعی است. Engrava با امتناع از حذف امتیاز بالاتر نسخه 0.5.0، عادت صنعت به گلچین کردن (Cherry-picking) بهترین عدد ممکن برای ارائه به عموم را به چالش می‌کشد.

برای توسعه‌دهندگانی که عامل‌های هوش مصنوعی می‌سازند، ارزش واقعی در اینجا جداسازی کیفیت بازیابی از هزینهٔ تولید است. اگر یک سیستم محلی و قطعی بتواند دقت حدود ۸۲٪ را در یادآوری بلندمدت حفظ کند، استدلال برای استفاده از لایه‌های حافظه گران‌قیمت که توسط LLM مدیریت می‌شوند، به‌شدت تضعیف می‌شود. این روند با برتری مدل‌های کوچک در محاسبات محلی هم‌سو است که نشان می‌دهد بهره‌وری لبه‌ای در حال تبدیل شدن به یک اولویت است.

این رویکرد، حوزهٔ حافظه را از «جعبه سیاه» دور کرده و به سمت یک دیسیپلین مهندسی قابل تأیید می‌برد. این امر سایر ارائه‌دهندگان حافظه را مجبور می‌کند تا اگر می‌خواهند در محیط‌های عملیاتی (Production) جدی گرفته شوند، مقادیر top_k، مدل‌های داور و میزان قطعی بودن خط لوله خود را افشا کنند.

اگر در حال حاضر در حال ارزیابی حافظهٔ عامل‌ها هستید، قابل‌اعتمادترین مسیر دیگر خواندن جدول امتیازات نیست. در عوض، باید یک آداپتور واحد برای لایهٔ حافظه انتخابی خود بنویسید و آن را از طریق یک خواننده و امتیازدهنده ثابت اجرا کنید تا تفاوت واقعی را در حجم کاری خاص خود مشاهده کنید. این تنها مقایسه‌ای است که سیگنال واقعی ارائه می‌دهد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر شفافیت و بازتولیدپذیری، استانداردهای بنچمارک‌های AI را به سمت مدل‌های «آمادهٔ حسابرسی» می‌برد. حذف LLM از لایه حافظه، هزینه استنتاج را برای توسعه‌دهندگان در مقیاس صنعتی به‌طور چشم‌گیری کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل محلی بودن ذخیره‌سازی و امکان استفاده از مدل‌های Embedding ارزان، این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت بودجهٔ دلاری برای APIها مواجه‌اند، بسیار کاربردی است.

·نگاه ما
تحریریه دات‌هوش

جدا کردن کیفیت بازیابی از هزینهٔ مدل‌های مولد، یک چرخش استراتژیک در طراحی عامل‌هاست. وقتی یک سیستم قطعی و محلی می‌تواند دقت ۸۲ درصدی را حفظ کند، توجیه استفاده از لایه‌های حافظهٔ گران‌قیمت و ابری به‌شدت کاهش می‌یابد. این رویکرد، حافظهٔ عامل را از یک «جعبه سیاه» به یک دیسیپلین مهندسی قابل حسابرسی تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.