اگر امروز برای توکنهای ورودی عاملهای هوش مصنوعی هزینه میپردازید، احتمالاً با مشکل افزایش قیمت همزمان با رشد حافظه مدل دستوپنجه نرم میکنید. شرکت Wontopos در ۱۸ سپتامبر ۲۰۲۶ با معرفی سیستم WOS، این وابستگی مستقیم را شکست و راهی برای ذخیره یکباره خاطرات و بازیابی تکهای آنها فراهم کرد.
بسیاری از عاملها با پدیده «تورم زمینه» (Context Bloat) را میشناسند؛ وضعیتی که در آن افزودن تاریخچه بیشتر، هزینه هر پرسوجو را بالا میبرد. سیستم WOS — شبیه به یک کتابدار هوشمند که بهجای آوردن کل کتابخانه، فقط برگه مورد نیاز شما را پیدا میکند — این مشکل را حل میکند. این رویکرد در واقع پاسخی به چالشهای ذخیرهسازهای معنایی در برابر حافظههای خطی است که پیشتر برای حفظ دستورات اولیه عاملها بررسی شده بود. طبق گزارش وبسایت dev.to، این معماری تضمین میکند که هزینه خواندن از یک آرشیو عظیم، با هزینه خواندن از یک حافظه تازه برابر باشد.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی توکنها اشاره کردیم، جداسازی لایه بازیابی از پردازش اصلی، کلید مقیاسپذیری است. توسعهدهندگان میتوانند از طریق یک SDK یا با استفاده از پروتکل زمینه مدل (MCP) برای ادغام بدون کدنویسی با ابزارهایی مثل Cursor و VS Code از این سیستم استفاده کنند. بر اساس مستندات فنی، این سیستم در چهار مدل عرضه شده است:
- Tablet 1: موتور سبک و بدون مدل زبانی که حدود ۱۲۰۰ توکن برمیگرداند.
- Tablet 2: مدل پیشفرض (۱۰۰۰ توکن) با قابلیت ثبت گوینده، حافظه تصویری و تابع تأیید برای بازبینی پاسخهای گمشده.
- Scroll 1: مدل با زمینه بالاتر (۳۷۰۰ توکن) که از یک مدل زبانی بزرگ (LLM) — مثل دستیاری که ابتدا سؤال شما را بازنویسی میکند تا دقیقتر شود — فقط برای اصلاح پرسوجو استفاده میکند.
- Scroll 1.2: نسخه بازیابی در سطح جمله (۲۸۰۰ توکن) برای استخراج حقایق مبهم.
به نقل از Wontopos، این شرکت در حال توسعه مدل Book است که تمرکز آن بر پیشگیری از خطا است تا عاملها اشتباهات قبلی خود را تکرار نکنند. این تلاش برای بهینهسازی حافظه، در کنار مقایسهی کارآمدی معماریهای Mem0، Zep و Letta، مسیر تکامل حافظه در عاملهای هوشمند را روشنتر میکند.
این تغییر، صنعت را از موازنه «دقت در برابر حجم زمینه» دور میکند. با ایزوله کردن بازیابی حافظه از حلقه اصلی پردازش، عاملها میتوانند بدون برخورد با محدودیت توکن یا افزایش صورتحساب API، وضعیتی دائمی و چندزبانه داشته باشند.
گام بعدی شما
- اگر از Cursor یا Claude Desktop استفاده میکنید، پروتکل MCP را برای اتصال حافظه بلندمدت بررسی کنید.
- مدلهای Tablet و Scroll را بر اساس نیاز خود به دقت بازیابی یا حجم توکن مقایسه کنید.
- بنچمارکهای موجود در سایت Wontopos را برای سنجش نرخ خطای بازیابی در محیط عملیاتی مطالعه کنید.
اما تأثیر این معماری بر کاهش تأخیر در پاسخدهی حتی حیاتیتر است — به تحلیل ما دربارهی بهینهسازی KV Cache مراجعه کنید. در همین راستا، بررسی توزیع حافظه در خوشههای پردازشی نشان میدهد که چگونه رفع گلوگاههای سختافزاری میتواند مکمل این بهینهسازیهای نرمافزاری باشد.




گفتگو