پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه مدل‌های Ettin با حذف توکن‌های اضافی، سرعت RAG را ۸ برابر کردند؟

·۲۹ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
چگونه مدل‌های Ettin با حذف توکن‌های اضافی، سرعت RAG را ۸ برابر کردند؟
اشتراک‌گذاری

اگر امروز برای تأخیر زیاد در پاسخ‌های سیستم جستجوی خود هزینه می‌پردازید، باید بدانید که می‌توانید با تغییر یک خط کد، سرعت رتبه‌بندی اسناد خود را دو برابر کنید. تصور کنید سیستمی داشته باشید که بدون کاهش کیفیت، پاسخ‌ها را در کسری از ثانیه بازبینی و مرتب کند.

بیشتر سیستم‌های جستجوی مدرن از یک خط لوله «بازیابی و سپس رتبه‌بندی» استفاده می‌کنند. در این روش، ابتدا یک مدل بردار معنایی (Embedding) — که شبیه کارت معرفی عددی برای هر واژه است و می‌گوید این کلمه همسایه چه کلمات دیگری است — چند صد کاندید احتمالی را پیدا می‌کند و سپس یک رتبه‌بند (Reranker) دقیق، آن‌ها را مرتب می‌کند. این فرآیند در واقع همان تولید بازیابی‌افزا (RAG) است؛ یعنی مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد. همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی مدل‌های زبانی اشاره کردیم، چالش اصلی توسعه‌دهندگان همیشه یافتن تعادل بین سرعت و دقت در این مرحله بوده است.

در ۱۹ مه ۲۰۲۶، شرکت Hugging Face شش مدل از خانواده Ettin Reranker را بر پایه رمزگذارهای ModernBERT منتشر کرد. به نقل از وبلاگ رسمی این شرکت، این مدل‌ها تحت لایسنس Apache 2.0 عرضه شده‌اند و از پنجره متنی تا ۸ هزار توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — پشتیبانی می‌کنند.

طبق مستندات فنی، نتایج بنچمارک‌ها خیره‌کننده است:

  • مدل ۱۷ میلیون پارامتری در هر ثانیه ۷,۵۱۷ جفت داده را روی پردازنده NVIDIA H100 پردازش می‌کند که تقریباً دو برابر سریع‌تر از مدل ms-marco-MiniLM-L6-v2 است.
  • مدل ۱ میلیارد پارامتری در حالی که ۲.۴ برابر سریع‌تر است، نمره MTEB مدل mxbai-rerank-large-v2 را با دقت خیره‌کننده‌ای بازتولید می‌کند.
  • مدل ۱۵۰ میلیون پارامتری در وظایف بازیابی MTEB، حتی از مدل ۵۹۶ میلیون پارامتری Qwen3-Reranker-0.6B پیشی گرفته است.

Embedding vs Reranker Models

Our six rerankers paired with embeddinggemma-300m on MTEB(eng, v2) Retrieval

MTEB(eng, v2) Retrieval with embeddinggemma-300m + reranker

این جهش سرعت مدیون معماری ترنسفورمر ماژولار است که امکان حذف توکن‌های اضافی (unpadding) را فراهم می‌کند. در مدل‌های استاندارد، بخشی از قدرت محاسباتی روی توکن‌های خالی (Padding) تلف می‌شود، اما Ettin فقط متن واقعی را پردازش می‌کند. این تغییر ساختاری بسته به اندازه مدل، سرعت استنتاج (Inference) — یعنی همان لحظه تولید جواب، شبیه خودِ آشپزی و نه دوره آموزش آشپز — را ۱.۷ تا ۸.۳ برابر افزایش داده است.

این عرضه، استاندارد مدل‌های بهینه برای RAG را تغییر می‌دهد. توسعه‌دهندگان اکنون می‌توانند مدل‌های قدیمی MiniLM را با نسخه‌های ۱۷ یا ۳۲ میلیون پارامتری جایگزین کنند تا بدون ریسک، کیفیت سیستم خود را بالا ببرند.

گام بعدی شما

  • اگر از کتابخانه sentence-transformers استفاده می‌کنید، همین امروز مدل‌های Ettin را جایگزین رتبه‌بندهای قدیمی کنید.
  • برای آموزش رتبه‌بند اختصاصی در حوزه کاری خود، مجموعه داده ۱۴۳ میلیون تایی Ettin را در Hugging Face بررسی کنید.
  • تأثیر کاهش تأخیر (Latency) را روی نرخ تبدیل کاربران در سیستم جستجوی خود اندازه بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه چگونه تراشه‌های جدید این سرعت‌ها را ممکن می‌کنند، به تحلیل ما درباره نسل Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت باعث می‌شود سیستم‌های RAG با هزینه کمتر و سرعت بسیار بالاتر در مقیاس تجاری قابل استقرار باشند. اعتبار این ادعا از نتایج بنچمارک‌های سخت‌افزاری روی H100 تأیید شده که تأخیر استنتاج را به شدت کاهش می‌دهد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.