پرش به محتوای اصلی
پرش به محتوای مقاله

Wontopos: جداسازی حافظه بلندمدت از هزینه‌های پردازش توکن

·۲۷ شهریور ۱۴۰۵۲ دقیقه مطالعه
مقدمه‌ای بر ونتوپوس، API حافظه‌ای که روی آن کار می‌کنم
مقدمه‌ای بر ونتوپوس، API حافظه‌ای که روی آن کار می‌کنم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن هزینه ورودی (Input Cost) از حجم کل حافظه ذخیره شده؛ به طوری که هزینه بازیابی از یک سال داده با یک روز داده یکسان است.

اگر امروز برای توکن‌های ورودی عامل‌های هوش مصنوعی هزینه می‌پردازید، احتمالاً با مشکل افزایش قیمت هم‌زمان با رشد حافظه مدل دست‌وپنجه نرم می‌کنید. شرکت Wontopos در ۱۸ سپتامبر ۲۰۲۶ با معرفی سیستم WOS، این وابستگی مستقیم را شکست و راهی برای ذخیره یک‌باره خاطرات و بازیابی تکه‌ای آن‌ها فراهم کرد.

بسیاری از عامل‌ها با پدیده «تورم زمینه» (Context Bloat) را می‌شناسند؛ وضعیتی که در آن افزودن تاریخچه بیشتر، هزینه هر پرس‌وجو را بالا می‌برد. سیستم WOS — شبیه به یک کتابدار هوشمند که به‌جای آوردن کل کتابخانه، فقط برگه مورد نیاز شما را پیدا می‌کند — این مشکل را حل می‌کند. این رویکرد در واقع پاسخی به چالش‌های ذخیره‌سازهای معنایی در برابر حافظه‌های خطی است که پیش‌تر برای حفظ دستورات اولیه عامل‌ها بررسی شده بود. طبق گزارش وب‌سایت dev.to، این معماری تضمین می‌کند که هزینه خواندن از یک آرشیو عظیم، با هزینه خواندن از یک حافظه تازه برابر باشد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی توکن‌ها اشاره کردیم، جداسازی لایه بازیابی از پردازش اصلی، کلید مقیاس‌پذیری است. توسعه‌دهندگان می‌توانند از طریق یک SDK یا با استفاده از پروتکل زمینه مدل (MCP) برای ادغام بدون کدنویسی با ابزارهایی مثل Cursor و VS Code از این سیستم استفاده کنند. بر اساس مستندات فنی، این سیستم در چهار مدل عرضه شده است:

  • Tablet 1: موتور سبک و بدون مدل زبانی که حدود ۱۲۰۰ توکن برمی‌گرداند.
  • Tablet 2: مدل پیش‌فرض (۱۰۰۰ توکن) با قابلیت ثبت گوینده، حافظه تصویری و تابع تأیید برای بازبینی پاسخ‌های گم‌شده.
  • Scroll 1: مدل با زمینه بالاتر (۳۷۰۰ توکن) که از یک مدل زبانی بزرگ (LLM) — مثل دستیاری که ابتدا سؤال شما را بازنویسی می‌کند تا دقیق‌تر شود — فقط برای اصلاح پرس‌وجو استفاده می‌کند.
  • Scroll 1.2: نسخه بازیابی در سطح جمله (۲۸۰۰ توکن) برای استخراج حقایق مبهم.

به نقل از Wontopos، این شرکت در حال توسعه مدل Book است که تمرکز آن بر پیشگیری از خطا است تا عامل‌ها اشتباهات قبلی خود را تکرار نکنند. این تلاش برای بهینه‌سازی حافظه، در کنار مقایسه‌ی کارآمدی معماری‌های Mem0، Zep و Letta، مسیر تکامل حافظه در عامل‌های هوشمند را روشن‌تر می‌کند.

این تغییر، صنعت را از موازنه «دقت در برابر حجم زمینه» دور می‌کند. با ایزوله کردن بازیابی حافظه از حلقه اصلی پردازش، عامل‌ها می‌توانند بدون برخورد با محدودیت توکن یا افزایش صورت‌حساب API، وضعیتی دائمی و چندزبانه داشته باشند.

گام بعدی شما

  • اگر از Cursor یا Claude Desktop استفاده می‌کنید، پروتکل MCP را برای اتصال حافظه بلندمدت بررسی کنید.
  • مدل‌های Tablet و Scroll را بر اساس نیاز خود به دقت بازیابی یا حجم توکن مقایسه کنید.
  • بنچمارک‌های موجود در سایت Wontopos را برای سنجش نرخ خطای بازیابی در محیط عملیاتی مطالعه کنید.

اما تأثیر این معماری بر کاهش تأخیر در پاسخ‌دهی حتی حیاتی‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی KV Cache مراجعه کنید. در همین راستا، بررسی توزیع حافظه در خوشه‌های پردازشی نشان می‌دهد که چگونه رفع گلوگاه‌های سخت‌افزاری می‌تواند مکمل این بهینه‌سازی‌های نرم‌افزاری باشد.

چرا این موضوع مهم است؟

این فناوری با حذف هزینه خطی حافظه، استقرار عامل‌های هوشمند در مقیاس سازمانی را اقتصادی می‌کند. اعتبار این ادعا از طریق تفکیک لایه بازیابی از استنتاج مدل‌های گران‌قیمت تأمین شده است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت بودجه دلاری برای APIها مواجه‌اند، می‌توانند با این معماری هزینه‌های عملیاتی عامل‌های خود را به شدت کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Wontopos بر جداسازی هزینه از حجم حافظه، نقطه پایان استراتژی «بزرگ‌تر کردن پنجره متنی» برای حل مشکل حافظه است. این رویکرد نشان می‌دهد که آینده عامل‌های هوشمند نه در مدل‌هایی با Context Window بی‌نهایت، بلکه در لایه‌های بازیابی (Retrieval) فوق‌سریع و ارزان نهفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.