اگر از مدلهای محلی برای مدیریت اسناد استفاده میکنید، احتمالاً با اتلاف شدید منابع پردازشی هنگام هر پرسوجو مواجه شدهاید. MyZubster در ۱۸ سپتامبر ۲۰۲۶ با تغییر معماری خود، این گلوگاه را در خط لوله تولید بازیابیافزا (RAG) برطرف کرد.
این رویکرد جدید بر پایه ایجاد یک حافظه محلی پایدار است. تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — اکنون بهجای تکرار عملیات برای هر سؤال، از یک لایه ذخیرهشده استفاده میکند. همانطور که در پوشش پیشین ما از توزیعهای لینوکس برای استقرار هوش مصنوعی محلی دیدیم، بهینهسازی جریان داده بین مدلها و پایگاهدادههای برداری، اولویت اصلی توسعهدهندگان شده است.
طبق مستندات فنی این شرکت، معماری جدید از ترکیب MyZubster API، پایگاهداده Qdrant برای ذخیرهسازی برداری، و Ollama برای اجرای مدل Mistral و مدل nomic-embed-text استفاده میکند.
جزئیات بازطراحی فنی
- گردش کار قدیمی: هر پرسش باعث تولید مجدد تمام بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی کلمات را مشخص میکند — برای تمامی مشاهدات میشد.
- گردش کار جدید: دادهها تنها یکبار هنگام ثبت، تبدیل به بردار و نمایهسازی میشوند. در زمان پرسش، سیستم فقط بردارِ خودِ سؤال را تولید میکند تا محتوای مرتبط را بازیابی کند.
- اعتبارسنجی: به نقل از تیم فنی، این تغییرات از طریق یک مجموعه آزمون خودکار با نرخ موفقیت ۱۰۰٪ (۲۵ از ۲۵ تست) تأیید شده است.
این تغییر، هوش مصنوعی را از یک چتبات گذرا به یک لایه دانش محلی تبدیل میکند. تیم MyZubster با اجرای اصل «اولیت شواهد»، دادههای ثبتشده روی زنجیره (on-chain) را از ادعاهای تأییدنشده تفکیک کرده است تا مدل فقط بر اساس شواهد قابل اثبات استدلال کند.
برای کاربر نهایی، این یعنی پاسخهای سریعتر و سیستمی که بدون فشار به CPU، مستندات پروژه را «به خاطر میسپارد».
گام بعدی شما
- بررسی جایگزینی مدلهای Embedding لحظهای با سیستمهای نمایهسازی پایدار در پروژههای محلی.
- پیادهسازی تفکیک دادههای تأییدشده از غیرتأییدشده برای کاهش توهم مدل.
- ارزیابی عملکرد Qdrant در مقیاسهای کوچک برای کاهش تأخیر استنتاج.
اما اثر این بهینهسازی بر مصرف حافظه VRAM حتی حیاتیتر است — به تحلیل ما درباره کوانتش وزنها مراجعه کنید.




گفتگو