پرش به محتوای اصلی
پرش به محتوای مقاله

Nemotron 3 Embed چگونه دقت گردش‌کارهای عامل‌محور را افزایش می‌دهد؟

·۲۵ تیر ۱۴۰۵۹ دقیقه مطالعه
رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور
رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی لایه‌ی بردار معنایی تخصصی برای سخت‌افزار Blackwell که با استفاده از کوانتش NVFP4 و دیستیل-شدن، توان عملیاتی را ۲ برابر کرده بدون اینکه دقت مدل ۸ میلیاردی را به‌طور چشم‌گیر از دست بدهد.

یک خطای کوچک در بازیابی داده‌ها در یک گردش‌کار چندمرحله‌ای، می‌تواند کل بودجهٔ توکنی یک هوش مصنوعی را با پردازش محتواهای بی‌ربط هدر دهد. در ۱۶ ژوئیه ۲۰۲۶، شرکت انویدیا (NVIDIA) برای رفع این گلوگاه، Nemotron 3 Embed را معرفی کرد؛ مجموعه‌ای از مدل‌ها که پرچم‌دار آن (نسخه 8B) در حال حاضر رتبه‌ی اول جدول RTEB را دارد.

بازیابی ضعیف اغلب باعث می‌شود عامل‌های هوشمند در حلقه‌های تکرار گیر کنند، مجدداً پرس‌وجو کنند و نویز را به مراحل نهایی استدلال خود منتقل کنند. برای توسعه‌دهندگانی که سیستم‌های تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — یا حافظه برای عامل‌ها را در مقیاس صنعتی می‌سازند، هدف یافتن «منحنی دقت-بهره‌وری» است؛ نقطه‌ای که در آن بازیابی به‌قدری دقیق باشد که توکن‌ها در چرخه استدلال‌های غیرضروری هدر نروند و به‌قدر کافی سریع باشد که مقرون‌به‌صرفه بماند. در این راستا، پیاده‌سازی‌های پیچیده‌تر مانند معماری چندعاملی بایر نشان می‌دهد که چگونه سیستم‌های RAG پیشرفته می‌توانند حجم عظیمی از داده‌های تخصصی را به دستیاران پژوهشی تبدیل کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی حافظهٔ عامل‌ها اشاره کردیم، دقت در لایهٔ بازیابی کلید بهره‌وری است. تصور کنید عامل هوش مصنوعی شما پژوهشگری در یک کتابخانه عظیم است؛ اگر کتابدار کتاب اشتباهی به او بدهد، پژوهشگر ساعتها وقت خود را صرف خواندن زباله می‌کند تا اینکه متوجه اشتباه شود. Nemotron 3 Embed دقیقاً همان کتابدار خبره‌ای است که تضمین می‌کند عامل در اولین تلاش، شواهد درست را دریافت کند.

مجموعه‌ مدل‌ها و اهداف سخت‌افزاری

انویدیا سه نسخه مختلف را برای ایجاد تعادل بین دقت و توان عملیاتی (Throughput) متناسب با مقیاس‌های مختلف استقرار ارائه کرده است:

  • Nemotron-3-Embed-8B-BF16: مدل پرچم‌دار و لنگر کیفی مجموعه که برای بازیابی‌های حساس به دقت و RAGهای سازمانی با ریسک بالا طراحی شده است. این مدل دارای بالاترین عملکرد در کل این مجموعه است.
  • Nemotron-3-Embed-1B-BF16: استانداردی با بهره‌وری بالا برای محیط‌های عملیاتی (Production) که در آن تأخیر (Latency) و هزینه، محدودیت‌های اصلی هستند.
  • Nemotron-3-Embed-1B-NVFP4: نسخه‌ای شتاب‌یافته در سطح سخت‌افزار که به‌طور خاص برای معماری‌های NVIDIA Blackwell بهینه‌سازی شده است تا توان عملیاتی فوق‌العاده بالا را با اشغال حافظه کمتر به دست آورد.

رتبه اول NVIDIA Nemotron 3 در بنچمارک RTEB برای بازیابی عامل‌محور

ویژگی‌های کلیدی برای سازمان‌ها

به نقل از مستندات انویدیا، این مدل‌ها فراتر از امتیازات خام بنچمارک، مجموعه‌ای از ویژگی‌های آماده برای تولید در مقیاس جهانی دارند:

  • پنجرهٔ زمینه (Context Window) ۳۲ هزار توکنی: پشتیبانی از بازیابی در اسناد طولانی، زمینه‌های گسترده کد و تاریخچه‌های چند-مرحله‌ای عامل‌ها که ریسک بریدگی متن (Truncation) را به‌طور قابل‌توجهی کاهش می‌دهد.
  • بازیابی چندزبانه و کد: پشتیبانی تخصصی برای جست‌وجو در داده‌های سازمانی جهانی، مستندات فنی و مخازن کد شامل چندین فایل.
  • وزن‌های باز و دستورالعمل‌ها (Recipes): فراهم کردن کنترل کامل برای تیم‌ها جهت بازرسی، تنظیم (Tune) و استقرار مدل‌های بازیابی روی زیرساخت‌های خصوصی خودشان.
  • بهره‌وری NVIDIA NVFP4: ارائه یک مسیر استقرار ۴ بیتی برای کاربرانی که از زیرساخت‌های مبتنی بر Blackwell استفاده می‌کنند تا توان عملیاتی را به حداکثر برسانند.
  • یکپارچگی اکوسیستم: در دسترس بودن فوری در Hugging Face، قابلیت استقرار به عنوان میکروسرویس NVIDIA NIM و پشتیبانی توسط vLLM و شرکای پیشرو در حوزه ابر هوش مصنوعی.

بنچمارک‌ها و عملکرد

طبق گزارش رسمی در huggingface.co، مدل 8B سقف کیفی این خانواده را تعیین می‌کند. این مدل امتیاز ۷۸.۵٪ در RTEB و ۷۵.۵٪ در MMTEB Retrieval کسب کرد. ارزیابی‌ها همچنین شامل ViDoRe V3 Text و LongEmbed بود و برای اندازه‌گیری موفقیت از میانگین NDCG@10 استفاده شد.

رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور

مدل 1B-BF16 نیز کیفیت قابل‌توجهی را حفظ کرده است در حالی که اثر (Footprint) مدل را به‌شدت کاهش می‌دهد. این مدل امتیاز ۷۲.۴٪ در RTEB گرفت که نشان‌دهنده کاهش ۲۷ درصدی نرخ خطا نسبت به نسل پیشین (llama-nemotron-embed-vl-1b-v2) است. همچنین امتیاز ۷۱.۰٪ در MMTEB Retrieval به دست آمد که به معنای بهبود ۲۸ درصدی نرخ خطا است.

رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور

اثر بر بهره‌وری عامل‌ها

انویدیا این مدل‌ها را با استفاده از یک عامل جست‌وجو که توسط Nemotron 3 Ultra هدایت می‌شد، آزمایش کرد. آن‌ها مدل‌های برداری (Embedding) مختلف را تغییر دادند تا مشاهده کنند کیفیت بازیابی چگونه بر رفتار عامل اثر می‌گذارد. آن‌ها دریافتند که دقت بالاتر در بردار معنایی — مثل کارت معرفی عددی برای هر واژه که می‌گوید این کلمه همسایه چه کلمات دیگری است — مستقیماً هزینه توکن‌های پایین‌دستی را در هر پرس‌وجو در بنچمارک‌هایی مانند ViDoRe V3، BRIGHT و BrowseComp-Plus کاهش می‌دهد. این بهینه‌سازی در لایه برداری یادآور راهکارهای مقیاس‌پذیری است که پلتفرم Milvus برای مدیریت میلیاردها بردار به کار می‌گیرد تا تأخیر را در حجم داده‌های عظیم به حداقل برساند.

رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور

وقتی یک بازیاب دقیق‌تر باشد، عامل زودتر شواهد مرتبط را برمی‌گرداند. این امر از افتادن عامل در الگوهای جست‌وجوهای مکرر و مراحل استدلال غیرضروری جلوگیری می‌کند. برای اهداف این ارزیابی‌ها، هزینه‌های توکن پایین‌دستی از روی تعداد ورودی/خروجی Nemotron 3 Ultra و با استفاده از فرمول قیمت‌گذاری GPT-5.5 تخمین زده شد. مدل 8B هم بالاترین میانگین دقت بازیابی و هم کمترین هزینه توکن تخمینی را در این محیط‌های عامل‌محور به ثبت رساند.

شتاب‌دهنده Blackwell و کوانتش

مدل Nemotron-3-Embed-1B-NVFP4 طراحی شده است تا شکاف بین بهره‌وری سرویس‌دهی و کیفیت بازیابی را پر کند. این مدل از شتاب‌دهنده بومی NVFP4 در معماری‌های NVIDIA Blackwell استفاده می‌کند که وزن‌ها و فعال‌سازهای لایه‌های خطی را برای استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی نه دوره آموزش آن — به فرمت NVFP4 کوانتیده می‌کند.

رتبه‌بندی اول NVIDIA Nemotron 3 در بنچمارک RTEB برای بازیابی عامل‌محور

با استفاده از «دیستیل شدن آگاه از کوانتش» (Quantization-Aware Distillation یا QAD)، نسخه NVFP4 کمک می‌کند تا دقت برای توالی‌های ورودی طولانی بازیابی شود. این مدل بیش از ۹۹٪ از دقت بازیابی نسخه BF16 را حفظ کرده در حالی که اثر حافظه را کاهش داده است. در سخت‌افزار Blackwell، این مدل تا ۲ برابر توان عملیاتی بالاتری نسبت به BF16 برای سرویس‌دهی با تأخیر کم ارائه می‌دهد و از مدل‌های باز کوچکتری مانند Qwen3-Embedding-0.6B و EmbeddingGemma-300M پیشی می‌گیرد.

استقرار و پشته NIM

برای اطمینان از اینکه این مدل‌ها امروز در مقیاس سازمانی کار می‌کنند، انویدیا یک میکروسرویس بهینه‌شده NVIDIA NIM برای مدل 1B منتشر کرد. این امر حیاتی است زیرا پشته‌های سرویس‌دهی باید بهره‌وری را تحت بارهای واقعی درخواست در طول‌های مختلف توالی ورودی حفظ کنند.

رتبه اول NVIDIA Nemotron 3 Embed در بنچمارک RTEB برای بازیابی عامل‌محور

این NIM مبتنی بر زبان Rust در پردازنده‌های NVIDIA GB200 و RTX PRO 6000، عملکرد چک‌پوینت‌های vLLM را می‌برابر می‌کند یا از آن‌ها پیشی می‌گیرد. آزمایش‌ها روی طول توالی‌های ورودی (ISLs) ۲۵۶ و ۱۰۲۴ انجام شد تا از عملکرد سازگار اطمینان حاصل شود.

معماری فنی و آموزش

مدل پرچم‌دار 8B
این مدل از بدنه Ministral-3-8B-Instruct-2512 بهره می‌برد. مهندسان رمزگذار (encoder) آن را از حالت دکودر علی (Causal Decoder) به یک رمزگذار دوطرفه تبدیل کردند تا بازیابی کامل توالی ممکن شود. این مدل ابتدا روی ترکیبی از جفت-متن‌های استخراج شده از وب و داده‌های مصنوعی پیش‌آموزش دید و سپس روی مجموعه‌داده‌های بازیابی چندزبانه گلچین شده در دامنه‌های حقوقی، مالی، پزشکی، تجاری و آموزشی تنظیم دقیق (Fine-tuning) شد.

کاهش مقیاس به 1B
مدل 1B از ابتدا آموزش ندید بلکه از طریق یک خط‌لوله چندمرحله‌ای فشرده شد:

۱. تطبیق پایه: مهندسان دستورالعمل تطبیق دوطرفه را روی بدنه Ministral-3-3B-Instruct-2512 اعمال کردند تا یک پایه بازیاب 3B ایجاد کنند.
۲. هرس ساختاری: با استفاده از موتور جست‌وجوی معماری عصبی (NAS) در NVIDIA ModelOpt، والد 3B به یک اثر میانی 2B فشرده شد. خط‌لوله NAS اندازه FFN، عرض مخفی، عمق و سرهای توجه را تحت یک بودجه پارامتر سخت جست‌وجو کرد.
۳. دیستیل شدن معلم: مدل 2B از یک چک‌پوینت معلم 8B دیستیل شد تا دقت رتبه‌بندی بازیابی شود. در این مرحله از ترکیبی از خطای میانگین مربعات (MSE) و خطای فاصله کسینوسی روی ترکیبی از داده‌های چندزبانه و درون-دامنه استفاده شد.
۴. فشرده‌سازی نهایی: این توالی هرس ModelOpt و دیستیل شدن معلم برای دومین بار تکرار شد تا به تعداد نهایی ۱.۱۴ میلیارد پارامتر رسیدند.

مقیاس‌بندی زمینه
آموزش نهایی شامل یک برنامه دو مرحله‌ای پیش‌رونده بود:

  • مرحله ۱: تمرکز بر همراستاسازی گسترده چندزبانه در طول زمینه ۱۰۲۴ توکن برای بازسازی رفتار هسته‌ای بازیابی.
  • مرحله ۲: گستران طول زمینه به ۴۰۹۶ توکن و افزودن مجموعه‌داده‌های مصنوعی استدلالی و زمینه-طولانی برای کمک به مدل 1B جهت حفظ بازخوانی تمایزیافته برای ورودی‌های بلندتر.

خلاصه مشخصات فنی

مدل اندازه بُعد بردار پنجره زمینه تجمع (Pooling) سخت‌افزار هدف
Nemotron-3-8B-BF16 ۸.۰B ۴۰۹۶ ۳۲k میانگین پرس‌وجو/سند GPUهای عمومی
Nemotron-3-1B-BF16 ۱.۱۴B ۲۰۴۸ ۳۲k میانگین پرس‌وجو/سند CPU/GPU کم-تأخیر
Nemotron-3-1B-NVFP4 ۱.۱۴B ۲۰۴۸ ۳۲k میانگین پرس‌وجو/سند Blackwell/GB200

پذیرش صنعتی و بازخورد شرکا

چندین شریک سازمانی در حال حاضر این وزن‌ها را در حافظه داخلی عامل‌ها، بازیابی کد و گردش‌کارهای عملیاتی ارزیابی می‌کنند:

  • Automation Anywhere: ادی کوروگانتی، مدیر ارشد هوش مصنوعی، اشاره کرد که نتایج اولیه برای پاسخ به سوالات امیدوارکننده است و گراف هوشمندی زمینه و عامل‌هایی مانند EnterpriseClaw را بهبود می‌بخشد.
  • Zoom: در حال ارزیابی مدل‌ها برای لایه بازیابی جست‌وجوی عامل‌محور سازمانی خود است تا زمینه را در جلسات، اسناد، چت‌ها و تیکت‌ها بازیابی کند.
  • You.com: راهول موهان، مهندس ارشد هوش مصنوعی، از یک «جهش قابل‌توجه در عملکرد» هنگام استفاده از این مدل در پشته بازرتبه‌بندی (Re-ranking) برای انتخاب تکه‌های مرتبط با پرس‌وجو از صفحات وب خبر داد.
  • Zep: بنچمارک‌های داخلی نشان می‌دهد مدل 1B در تمام وظایف بازیابی حافظه رتبه اول را کسب کرده و چندین مدل بزرگ‌تر را شکست داده است. آن‌ها به‌طور خاص چک‌پوینت FP4 را از نظر ذخیره‌سازی و تأخیر رقابتی دانستند.
  • Boomi: مانی گیل، نایب رئیس ارشد، اشاره کرد که انعطاف‌پذیری داشتن هر دو نسخه 1B و 8B به تیم‌ها اجازه می‌دهد بین کیفیت و تأخیر تعادل برقرار کنند.
  • Mem0: استفاده از این بردارها برای پیوند دادن زمینه‌های مرتبط و ردیابی روابط در راهکارهای حافظه عامل هوش مصنوعی.
  • Palantir: همکاری در بارهای کاری بازیابی لبه (Edge) از طریق کاتالوگ مدل AIP.
  • IBM: اجرای ارزیابی اثبات مفهوم (PoC) روی watsonx.data.
  • ServiceNow: ارزیابی مدل‌ها برای بازیابی مستندات با تمرکز بر تنظیم دقیق درون-دامنه.
  • turbopuffer: ادغام Nemotron 3 Embed در سرویس بردار بومی و موتور جست‌وجوی معنایی خود.

شخصی‌سازی و وزن‌های باز

این مدل‌ها در Hugging Face و از طریق شرکایی مانند Baseten، Bitdeer AI، DeepInfra، Friendli AI و OpenRouter در دسترس هستند.

برای بارهای کاری که نیاز به تطبیق دامنه دارند، انویدیا دستورات آموزشی NeMo AutoModel را به‌صورت متن‌باز منتشر کرد. این شامل یک دستور تنظیم دقیق برای مجموعه‌های داده سازمانی و یک دستور دیستیل برای فشرده‌سازی مدل‌های بزرگ‌تر بدون از دست دادن کیفیت رتبه‌بندی است.

به عنوان یک مثال کاربردی، تنظیم دقیق مدل Nemotron-3-Embed-1B-BF16 بر روی ارزیابی NV Docs، معیار NDCG@10 را از ۵۶.۷٪ به ۶۳.۳٪ (افزایش ۱۱.۶ درصدی) و Recall@5 را از ۵۶.۱٪ به ۶۲.۸٪ (افزایش ۱۱.۹ درصدی) رساند.

این تغییر رویکرد به سمت ترکیب مدل‌های «معلم» با ظرفیت بالا و مدل‌های «شاگرد» به‌شدت دیستیل‌شده، نشان‌دهنده آینده‌ای است که در آن لایه‌های بردار معنایی دیگر عمومی نخواهند بود. در عوض، آن‌ها برای سخت‌افزارهای خاص مانند Blackwell به‌شدت بهینه می‌شوند تا جریمه تأخیر در RAG به‌طور کلی حذف شود.

برای کسانی که گردش‌کارهای عامل‌محور را مستقر می‌کنند، اولویت فوری آزمایش این نکته است که آیا نسخه 1B-NVFP4 می‌تواند جایگزین مدل‌های بزرگ‌تر شود بدون آنکه پایداری استدلال عامل را به قربانی کند. شما می‌توانید همین امروز به وزن‌ها در Hugging Face دسترسی داشته باشید یا آن‌ها را از طریق میکروسرویس‌های NIM مستقر کنید.

گام بعدی شما

  • اگر از RAGهای سنگین استفاده می‌کنید، نسخه 1B-NVFP4 را جایگزین مدل‌های بزرگ‌تر کنید تا پایداری استدلال عامل و هزینه توکن را بسنجید.
  • برای داده‌های تخصصی سازمان خود، از دستورات NeMo AutoModel برای تنظیم دقیق مدل 1B استفاده کنید تا دقت بازیابی را بدون افزایش تأخیر بالا ببرید.
  • استقرار مدل را از طریق میکروسرویس‌های NIM تست کنید تا تفاوت توان عملیاتی در سخت‌افزارهای Blackwell را مشاهده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل‌ها با کاهش نرخ خطای بازیابی، هزینه‌ی عملیاتی عامل‌های هوش مصنوعی را به‌طور مستقیم کاهش می‌دهند. اعتبار فنی انویدیا در ادغام این مدل‌ها با سخت‌افزار Blackwell، سرعت استنتاج در سازمان‌ها را به سطح جدیدی می‌برد.

تأثیر برای ایران

به‌دلیل نیاز به سخت‌افزارهای تخصصی Blackwell برای بهره‌برداری کامل از نسخه‌ی NVFP4، این تحول فعلاً بیشتر برای مراکز داده‌های بزرگ اهمیت دارد تا توسعه‌دهندگان مستقل ایرانی.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا بر مدل‌های 1B و تکنیک‌های دیستیل-شدن نشان می‌دهد که رقابت در لایه‌ی بازیابی از «بزرگ‌تر شدن مدل» به «بهینه‌سازی سخت‌افزاری» تغییر مسیر داده است. انویدیا را نمی‌خواهد فقط تراشه بفروشد، بلکه می‌خواهد با ادغام مدل و سخت‌افزار (مثل NVFP4)، استانداردی خلق کند که در آن مدل‌های کوچک‌تر اما تخصصی، مدل‌های عمومی بزرگ را در محیط‌های عملیاتی شکست دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.