اگر امروز در حال انتقال یک سیستم RAG از محیط دموی گیتهاب به دنیای واقعی هستید، احتمالاً با پاسخهای «پذیرفتنی اما غلط» یا نشت دادههای حساس دستوپنجه نرم میکنید. طبق اعلام توسعهدهنده این پروژه در ۶ اوت ۲۰۲۶، Project Aether دقیقاً برای حل همین شکاف میان آموزشهای ساده و مستندات پیچیده دنیای واقعی طراحی شده است.
بسیاری از ساختارهای ابتدایی تولید بازیابیافزا (RAG) — که شبیه دانشآموزی است که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — بر پایه اسکریپتهای خطی بنا شدهاند: تکهبندی متن، جستوجوی شباهت و تزریق به پرامپت. این روش در مواجهه با پرسوجوهای متناقض کاربران یا دادههای حساس، بهسرعت فرو میپاشد. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، مدیریت داده در لایه بازیابی حیاتیترین بخش استقرار است. به همین دلیل Project Aether از LlamaIndex Workflows استفاده میکند تا فرآیند جذب داده و پرسوجو را بهجای یک توالی ساده، به شکل گرافهای رویداد مدیریت کند. این رویکرد تکاملی در مدیریت جریان دادهها، یادآور تلاشهای اخیر برای بهینهسازی بیزی در کاهش تأخیر RAG و افزایش نرخ بازیابی است که دقت سیستمهای تولیدی را به شدت ارتقا داد.

بر اساس مستندات این پروژه، سه نقطه شکست بحرانی در این معماری هدف قرار گرفتهاند:
- زوال حافظه معنایی: حافظه پنهان (Cache) بر اساس تطابق دقیق رشتهها بیفایده است چون کاربران هرگز یک سؤال را دو بار دقیقاً یکسان نمیپرسند. نویسنده با استفاده از Redis و تنظیم آستانه شباهت کسینوسی (Cosine Similarity) — که مثل یک خطکش برای اندازهگیری نزدیکی معنایی دو جمله است — از پاسخهای اشتباه اما متقاعدکننده جلوگیری کرده است.
- کوری نسبت به کلمات کلیدی: بردار معنایی (Embedding) — که شبیه کارت معرفی عددی برای هر واژه است تا همسایگانش را بشناسد — گاهی شماره قطعات یا کدهای SKU را نادیده میگیرد. Aether این مشکل را با جستوجوی ترکیبی (Hybrid Search) در Chroma Cloud و استفاده از مدلهای Qwen/Splade حل کرده است.
- نشت دادههای حساس (PII): بسیاری از آموزشها ریسک ذخیره دائمی اطلاعات شناسایی شخصی در پایگاهداده برداری را نادیده میگیرند. در این خط لوله، یک مرحله اجباری برای ماسک کردن دادههای حساس پیش از تکهبندی اضافه شده است.
در لایه تولید، این سیستم برای کاهش هزینههای GPU از Groq برای اجرای مدل Llama 3.3 70B استفاده میکند تا استنتاج (Inference) — یعنی همان لحظه آشپزی و تولید جواب نهایی — با بیشترین سرعت رخ دهد. همچنین برای دقت بیشتر، یک مرحله بازرتبهبندی با استفاده از BAAI/bge-reranker-v2-m3 در انتهای مسیر قرار گرفته است.
این چرخش به سمت معماریهای رویدادمحور نشان میدهد که عصر اسکریپتهای خطی در RAG به پایان رسیده است. برای توسعهدهندگان، چالش اصلی از «بازیابی ساده» به «مایل آخر» تولید منتقل شده است: مدیریت شکستهای جزئی، بهینهسازی حافظه و تضمین حریم خصوصی. این تمرکز بر کنترل دقیق خروجیها، با مفاهیمی نظیر جلوگیری از انحراف عاملها در ابزار goal-anchor همسو است تا اطمینان حاصل شود مدل در مسیر هدف باقی میماند.
گام بعدی شما
- مخزن گیتهاب Project Aether را برای بررسی پیادهسازی LlamaIndex Workflows بررسی کنید.
- اگر از RAG استفاده میکنید، لایه ماسک کردن PII را به ابتدای خط لوله جذب داده خود اضافه کنید.
- برای بهبود دقت در جستوجوی کدهای فنی، مدلهای Sparse را در کنار Dense تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو