پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل و NYU: کاهش ۸ برابری حافظه مورد نیاز برای جستجوی برداری بدون آموزش

·۴ خرداد ۱۴۰۵۲ دقیقه مطالعه
اشتراک‌گذاری

اگر یک سیستم تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — محلی با ۱۰ میلیون سند دارید، نیاز حافظه شما همین حالا از ۶۰ گیگابایت به ۷.۵ گیگابایت رسید. این تغییر، «دیوار حافظه» را می‌شکند؛ همان مانعی که توسعه‌دهندگان را مجبور می‌کرد برای فرار از کمبود رم لپ‌تاپ، به سرورهای ابری گران‌قیمت پناه ببرند.

بسیاری از برنامه‌نویسان با بردار معنایی (Embedding) — که مثل کارت معرفی عددی برای هر واژه است و همسایگی کلمات را مشخص می‌کند — مشکل دارند، چون این بردارها حجم عظیمی از رم را می‌بلعند. طبق گزارش‌های فنی، ابزارهایی مثل FAISS این مشکل را با فشرده‌سازی حل می‌کنند، اما یک شرط سخت دارند: باید ابتدا یک نمونه از داده‌ها را برای آموزش ایندکس دریافت کنند. اگر توزیع داده‌های شما تغییر کند، کل ایندکس باید از ابتدا ساخته شود.

به نقل از مقاله‌ای که در آوریل ۲۰۲۵ توسط Google Research و NYU منتشر شد، روش TurboQuant این مرحله‌ی آموزشی را به‌طور کامل حذف می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های محلی اشاره کردیم، حذف وابستگی به داده‌های اولیه، سرعت استقرار سیستم را به‌شدت بالا می‌برد. این روش با اعمال یک چرخش تصادفی روی بردارها، آن‌ها را به توزیع گاوسی می‌برد تا بتوان از دسته‌های کوانتایز پیش‌ساخته استفاده کرد.

برای جلوگیری از خطای رایج در کوانتایزرهای بهینه شده با MSE، این سیستم از یک فرآیند دو مرحله‌ای استفاده می‌کند: ابتدا کوانتایز MSE و سپس یک تصویرسازی تصادفی ۱ بیتی به نام QJL.

بر اساس بنچمارک‌های وب‌سایت dev.to، کتابخانه turbovec که این ریاضیات را پیاده کرده، در سخت‌افزارهای ARM بین ۱۲ تا ۲۰ درصد سریع‌تر از FAISS IndexPQFastScan عمل می‌کند. این کتابخانه اکنون جایگزینی مستقیم برای ذخیره‌سازهای درون‌حافظه‌ای در LangChain، LlamaIndex، Haystack و Agno است.

این تحول یعنی استقرار RAG با تراکم بالا روی یک لپ‌تاپ معمولی اکنون شدنی است. اگرچه در حالت ۴ بیتی، دقت بازیابی کمی کاهش می‌یابد، اما با استفاده از یک cross-encoder برای رتبه‌بندی نهایی نتایج، این افت عملاً بی‌اثر می‌شود.

گام بعدی شما

  • اگر از LangChain استفاده می‌کنید، InMemoryVectorStore را با یکپارچگی turbovec جایگزین کنید.
  • پیش از انتقال به محیط عملیاتی، میزان دقت بازیابی (Recall) را روی یک مجموعه‌داده‌ی جداگانه بسنجید.
  • در صورت افت دقت، یک لایه‌ی رتبه‌بندی (Reranking) به انتهای زنجیره اضافه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی گوگل و NYU، دسترسی به جستجوی برداری مقیاس‌بزرگ را از مراکز داده به سخت‌افزارهای لبه منتقل می‌کند. این تغییر باعث می‌شود هزینه‌ی عملیاتی سیستم‌های بازیابی اطلاعات برای شرکت‌های کوچک به‌شدت کاهش یابد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.