پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Nemotron-3-Embed-8B انویدیا رتبه نخست محک بازیابی RTEB را به دست آورد

·۲۶ تیر ۱۴۰۵۵ دقیقه مطالعه
مجموعه جاسازی باز نمرات ۳ با مدل ۸ میلیارد پارامتری، رتبه اول در بنچمارک RTEB را کسب کرد.
مجموعه جاسازی باز نمرات ۳ با مدل ۸ میلیارد پارامتری، رتبه اول در بنچمارک RTEB را کسب کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

بهره‌گیری از خط لوله NAS و تقطیر برای رسیدن به دقت مدل‌های بزرگ در یک مدل 1B؛ در حالی که توان عملیاتی روی سخت‌افزار Blackwell دو برابر شده است.

بسیاری از پیشرفت‌های هوش مصنوعی روی تولید متن متمرکز شده‌اند، اما گلوگاه واقعی در مقیاس صنعتی برای RAG (تولید تقویت‌شده با بازیابی)، بازیابی عامل‌محور (Agentic Retrieval)، بازیابی کد و حافظه بلندمدت عامل‌ها، لایه اول و حیاتی است: تصمیم‌گیری در مورد اینکه مدل دقیقاً کدام تکه از داده‌ها را ببیند. طبق اعلام انویدیا در ۱۷ ژوئیه ۲۰۲۶، مدل Nemotron-3-Embed-8B-BF16 با کسب رتبه اول overall در محک بازیابی (Retrieval Embedding Benchmark - RTEB)، این چالش بنیادی را هدف قرار داده است.

در فضای فعلی، کارآمدی این لایه بازیابی تعیین می‌کند که یک عامل (Agent) در میان میلیون‌ها سند، محتوای درست را پیدا کند یا شکست بخورد. به گزارش marktechpost.com، مجموعه Nemotron 3 شامل سه نقطه بازرسی (Checkpoint) باز است که تحت توافق‌نامه مجوز OpenMDW نسخه ۱.۱ (OpenMDW-1.1) منتشر شده‌اند. همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به وزن‌های مدل‌ها، امکان بهینه‌سازی محلی را برای شرکت‌ها فراهم می‌کند.

بستر معماری

هر سه نقطه بازرسی از ترنسفورمر (Transformer)های رمزگذار (Encoder) استفاده می‌کنند که با استفاده از ماسک توجه دوطرفه (Bidirectional Attention Masking) آموزش دیده‌اند. بردار نهایی (Embedding) از طریق میانگین‌گیری (Average Pooling) روی نمایش‌های سطح توکن تولید می‌شود. ویژگی برجسته این مدل‌ها، پنجره زمینه (Context Window) عظیم با حداکثر طول توالی ۳۲,۷۶۸ توکن در تمامی نسخه‌ها است. علاوه‌بر این، هر مدل برای اطمینان از کاربرد جهانی، به‌طور دقیق در ۳۴ زبان مختلف ارزیابی شده است.

مشخصات فنی مدل‌ها

  • Nemotron-3-Embed-8B-BF16: این گزینه اولویت را بر صحت (Accuracy) گذاشته و بر پایه مدل پایه Ministral-3-8B-Instruct-2512 ساخته شده است. این مدل میانگین امتیاز NDCG@10 معادل ۷۸.۴۶ را در RTEB کسب کرده است. این مدل از ابعاد بردار ۴۰۹۶ استفاده می‌کند و امتیاز ۶۰.۶۰ را در ViDoRe-V3 (متنی) و ۷۵.۴۵ را در MMTEB (بخش بازیابی) به دست آورده است.
  • Nemotron-3-Embed-1B-BF16: مدلی با ردپای کوچک‌تر که بر پایه Ministral-3-3B-Instruct-2512 ساخته شده است. این مدل دارای ابعاد بردار ۲۰۴۸ است و امتیاز ۷۲.۳۸ را در RTEB و ۷۱.۰۴ را در MMTEB (بخش بازیابی) کسب کرده است.
  • Nemotron-3-Embed-1B-NVFP4: نسخه‌ای ۴ بیتی و بهینه برای سخت‌افزارهای Blackwell که بر پایه Ministral-3-3B-Instruct-2512 است. این مدل ۹۹.۵٪ از صحت مدل مادر خود را حفظ کرده (امتیاز ۷۲.۰۰ در RTEB) اما توان عملیاتی (Throughput) را تا ۲ برابر روی سخت‌افزارهای Blackwell افزایش می‌دهد.

نکته قابل توجه این است که مدل 1B جهشی چشمگیر در عملکرد داشته و ۱۰.۴ امتیاز در RTEB نسبت به خط پایه نسل قبلی یعنی llama-nemotron-embed-vl-1b-v2 بیشتر کسب کرده است.

خط لوله فشرده‌سازی

انویدیا برای ساخت نسخه‌های 1B صرفاً یک مدل کوچک را آموزش نداده است. بلکه آن‌ها یک خط لوله فشرده‌سازی دقیق را با استفاده از mcore_minitron Neural Architecture Search (NAS) در NVIDIA ModelOpt پیاده‌سازی کردند.

در مرحله اول، یک مدل مادر ۳ میلیارد پارامتری (nemotron-3-embed-3b) به ۲ میلیارد پارامتر هرس (Prune) شد. جست‌وجوی NAS به‌طور خاص موارد زیر را پوشش داد: عرض پنهان (Hidden Width)، اندازه FFN، سرهای توجه (Attention Heads) و عمق مدل. سپس بهترین کاندید از میان ۱۰ گزینه برتر جبهه پارتو (Pareto front) انتخاب شد. این امتیازدهی با استفاده از یک مجموعه داده کالیبراسیون در-دامنه (in-domain) شامل ۵۰ هزار نمونه انجام شد.

در مرحله بعد، مدل 2B از مدل «معلم» 8B که پیش‌تر تنظیم دقیق (Fine-tune) شده بود، تقطیر (Distill) شد. این فرآیند تقطیر ترکیبی از تابع ضرر فاصله کسینوسی (COS) و میانگین مربعات خطا (MSE) را با استفاده از ترکیبی از داده‌های چندزبانه و در-دامنه به کار گرفت. کل این رویه سپس تکرار شد تا نقطه بازرسی نهایی ۱.۱۴ میلیارد پارامتری تولید شود.

سرویس‌دهی و کوانتش NVFP4

برای بهینه‌سازی بیشتر نسخه NVFP4، تیم توسعه از nvidia-modelopt v0.45.0 برای اعمال کوانتش (Quantization) روی وزن‌ها و فعال‌سازهای لایه‌های خطی استفاده کرد. پس از آن، از تقطیر آگاه از کوانتش (QAD) استفاده شد تا به‌طور خاص دقت در ورودی‌های طولانی بازیابی شود.

  • کالیبراسیون: از ۵۱۲ نمونه (۲۵۶ پرس‌وجو و ۲۵۶ تکه متن) از مجموعه داده abisee/cnn_dailymail استفاده شد.
  • آموزش QAD: برای این مرحله از ۲۰ هزار نمونه استفاده به عمل آمد.

ماتریس استقرار و یکپارچه‌سازی

این مدل‌ها طیف گسترده‌ای از سخت‌افزارها را پشتیبانی می‌کنند. نسخه‌های BF16 (۸ میلیارد و ۱ میلیارد) برای معماری‌های Ampere، Hopper و Blackwell هدف‌گذاری شده‌اند (تست شده روی A100 80GB و H100 80GB). در مقابل، نسخه 1B-NVFP4 پشتیبانی را تا معماری Lovelace و RTX 6000 PRO گسترش می‌دهد.

برای سرویس‌دهی، انویدیا یک میکروسرویس NIM مبتنی بر زبان Rust برای مدل 1B عرضه کرده است که روی سخت‌افزار GB200، عملکردی برابر یا بهتر از vLLM (نسخه ۰.۲۵.۰) دارد. توسعه‌دهندگان می‌توانند این مدل‌ها را از طریق sentence-transformers با استفاده از پیشوندهای خاص ادغام کنند: query: برای جست‌وجوها و passage: برای اسناد. از آنجایی که بردارها L2-نرمال شده‌اند، یک ضرب داخلی (Dot Product) ساده، امتیاز شباهت کسینوسی را فراهم می‌کند.

قابلیت‌های پیشرفته بازیابی

مدل 1B امکان تغییر دینامیک اندازه بردار را فراهم می‌کند؛ کاربر می‌تواند بردار ۲۰۴۸ بعدی را به ۱۰۲۴ یا ۵۱۲ کاهش دهد و سپس آن را مجدداً نرمال‌سازی کند. برای کسانی که نیاز به راهنمای بصری دارند، یک توضیح‌دهنده تعاملی، مسیر پنج‌مرحله‌ای بازیابی را به صورت انیمیشن نمایش می‌دهد: پیشوندگذاری (Prefixing)، رمزگذاری دوطرفه، میانگین‌گیری، نرمال‌سازی L2 و امتیازدهی ضرب داخلی.

کاربردهای دنیایی واقعی

  • جست‌وجوی سازمانی چندزبانه: امکان بازیابی متقاطع؛ مثلاً یک پرس‌وجوی آلمانی می‌تواند یک یادداشت راهنمای ژاپنی را از میان مجموعه‌ای از تیکت‌های هندی، ژاپنی و انگلیسی پیدا کند.
  • بازیابی کد: آموزش تخصصی روی مجموعه‌های coir_apps ،coir_cosqa ،synthetic_text2sql و SWE-bench برای تبدیل دقیق زبان طبیعی به کد.
  • حافظه عامل: پنجره ۳۲,۷۶۸ توکنی اجازه می‌دهد عامل‌ها خلاصه‌های طولانی گفتگو را بدون نیاز به تکه‌بندی (Chunking) تهاجمی به بردار تبدیل کنند.
  • RAG چندلایه (Cost-tiered): استقرار مدل 1B-NVFP4 برای بازیابی حجم بالای داده‌ها و ارجاع پرس‌وجوهای پیچیده به مدل 8B جهت به حداقل رساندن تأخیر و هزینه.

این عرضه، این فرض فنی را که بازیابی با دقت بالا لزوماً به مدل‌های عظیم نیاز دارد، به چالش می‌کشد. شما اکنون می‌توانید این نقاط بازرسی را در Hugging Face تست کنید یا دستورالعمل‌های NeMo AutoModel را برای تنظیم دقیق و تقطیر سفارشی بررسی کنید.

گام بعدی شما

  • اگر از RAG در مقیاس تولید استفاده می‌کنید، مدل 1B-NVFP4 را برای کاهش هزینه‌های استنتاج و افزایش سرعت تست کنید.
  • برای کاربردهای چندزبانه، دقت مدل Nemotron را در زبان‌های غیرانگلیسی با مدل‌های رقبا مقایسه کنید.
  • بررسی کنید که آیا پنجره متنی ۳۲ هزار توکنی می‌تواند نیاز شما به تکه‌بندی‌های پیچیده متن را حذف کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل‌ها با افزایش دقت بازیابی اطلاعات، نرخ توهم را در سیستم‌های RAG کاهش می‌دهند. اعتبار این پیشرفت از طریق جایگاه نخست در محک RTEB و بهینه‌سازی مستقیم برای سخت‌افزارهای Blackwell تایید شده است.

تأثیر برای ایران

به‌دلیل باز بودن وزن‌های این مدل‌ها، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی و محدود، آن‌ها را روی سرورهای داخلی مستقر کرده و برای جست‌وجوی معنایی در زبان فارسی بهینه کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا بر لایه بردار معنایی نشان می‌دهد که رقابت در عصر هوش مصنوعی زاینده از «تولید محتوا» به «مدیریت دقیق دانش» تغییر جهت داده است. استفاده از تقطیر (distillation) برای تبدیل مدل 8B به 1B ثابت می‌کند که مدل‌های کوچک‌تر می‌توانند با معماری درست، شکاف عملکردی با غول‌های پارامتریک را ببندند. این رویکرد، استقرار مدل‌های هوش مصنوعی در لبه (Edge) را به شدت تسهیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.