پرش به محتوای اصلی
پرش به محتوای مقاله

نمودار توانمندی انویدیا: مدل Nemotron 3.5 با پنجره متنی یک میلیون توکنی

·۲۰ مرداد ۱۴۰۵۲۸ دقیقه مطالعه۱ بازدید
نمودار مقایسه دقت مدل ان‌ویدیا نمترون ۳.۵ لایتنینگ ۳۰B با فرمت NVFP4 در برابر دقت کامل (BF16) در معیارهای مختلف.
نمودار مقایسه دقت مدل ان‌ویدیا نمترون ۳.۵ لایتنینگ ۳۰B با فرمت NVFP4 در برابر دقت کامل (BF16) در معیارهای مختلف.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب معماری MoE و Mamba-2 برای دستیابی به پنجره متنی یک میلیون توکنی با تنها ۳ میلیارد پارامتر فعال؛ این یعنی بهره‌وری حافظه در مقیاسی که پیش‌تر فقط در مدل‌های بسیار سنگین ممکن بود.

یک واحد پردازش گرافیکی NVIDIA H100 اکنون می‌تواند یک مدل استدلالی با پنجره متنی یک میلیون توکنی را سرویس‌دهی کند. در ۱۱ اوت ۲۰۲۶، شرکت انویدیا (NVIDIA) از مدل Nemotron-3.5-Lightning-30B-A3B-NVFP4 پرده‌برداری کرد؛ ابزاری که به‌طور خاص برای تبدیل شدن به «اسب بارکش» عامل‌های خودکار (Autonomous Agents) در عملیات‌های طولانی‌مدت طراحی شده است.

این عرضه در حالی رخ می‌دهد که صنعت از چت‌بات‌های ساده به سمت سامانه‌های عامل‌محور (Agentic Systems) حرکت می‌کند؛ سامانه‌هایی که باید وضعیت (State) خود را در میان مستندات حجیم حفظ کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی اتوماسیون توزیع مهارت‌ها در Hugging Face اشاره کردیم، انویدیا اکنون زیرساخت محاسباتی لازم را فراهم کرده تا این عامل‌ها بدون برخورد با سد حافظه، به‌صورت محلی اجرا شوند.

تصور کنید می‌خواهید یک قرارداد حقوقی هزار صفحه‌ای یا یک پایگاه کد عظیم را یک‌باره تحلیل کنید. اکثر مدل‌ها یا ابتدای فایل را فراموش می‌کنند یا باعث کرش کردن سخت‌افزار می‌شوند. Nemotron 3.5 این مشکل را با ترکیب معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) — شبیه به تیمی از متخصصان که در هر لحظه فقط فرد مناسب برای پاسخ به سؤال فراخوانده می‌شود — و لایه‌های Mamba-2 حل کرده است. این ساختار اجازه می‌دهد مدل تا یک میلیون توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — را مدیریت کند، در حالی که در هر لحظه تنها ۳ میلیارد پارامتر فعال هستند.

معماری و بهره‌وری

این مدل یک ساختار هیبریدی دارد. انویدیا لایه‌های Mamba-2 و MoE را با لایه‌های منتخب توجه (Attention) ترکیب کرده تا تعادلی میان سرعت و حافظه ایجاد کند. اگرچه تعداد کل پارامترها ۳۰ میلیارد است، اما تعداد پارامترهای فعال تنها ۳ میلیارد است که هزینه محاسباتی هر توکن را به‌شدت کاهش می‌دهد. طبق مستندات فنی، این معماری بر پایه Nemotron-3-Lightning و تکنیک پیش‌بینی چند-توکنی (Multi-Token Prediction یا MTP) بنا شده است.

انویدیا از یک دستورالعمل کوانتش (Quantization) خاص به نام NVFP4 (Four Over Six) استفاده کرده است. این روش در واقع گونه‌ای از کالیبراسیون استاتیک MSE است. این دستورالعمل W4A16 را روی خبره‌های مسیریابی‌شده (Routed) و مشترک اعمال می‌کند، در حالی که از مقیاس‌های دینامیک FP8 در سطح تانسور برای mamba in_proj/out_proj و KV cache استفاده می‌کند. این رویکرد اجازه می‌دهد مدل روی سخت‌افزارهای NVIDIA Blackwell (از جمله RTX 5090، GB200 و DGX Spark / GB10)، Hopper (H100 و H200) و حتی نسل Ampere از طریق کرنل‌های W4A16 اجرا شود.

لوگوی انویدیا و نام مدل زبانی Nemotron 3.5 Lightning 30B A3B با فرمت NVFP4 در پلتفرم Hugging Face

پیش‌آموزش و تبار داده‌ها

به نقل از کارت مدل در Hugging Face، مرحله پیش‌آموزش (Pre-training) شامل بیش از ۲۰ تریلیون توکن بوده است. بازه جمع‌آوری داده‌ها از سال ۲۰۱۳ تا دسامبر ۲۰۲۵ است. نقطه قطع داده‌ها برای پیش‌آموزش سپتامبر ۲۰۲۵ تعیین شده، هرچند داده‌های پس‌آموزش تا مه ۲۰۲۶ ادامه دارند.

انویدیا یک خط لوله آموزشی پنج‌مرحله‌ای را به کار گرفته است:

  • پیش‌آموزش: استفاده از Megatron-LM با ترکیبی از کدهای خزش‌شده و داده‌های مصنوعی در حوزه‌های ریاضی و علوم. بنیاد این مرحله، پیکره Nemotron 3 است که شامل Nemotron-CC-v2 (۹.۱ تریلیون توکن)، Nemotron-Pretraining-Code (۱.۷ تریلیون توکن) و داده‌های تخصصی استدلال STEM است. این رویکرد در راستای بهینه‌سازی‌های گسترده‌تری است که NeMo Automodel برای رفع محدودیت‌های مقیاس‌پذیری در مدل‌های پخش به کار می‌گیرد.
  • پیش‌بینی چند-توکنی (MTP): یک مرحله پیش‌آموزش مستمر که در آن مدل یاد گرفت چندین توکن آینده را به‌طور هم‌زمان پیش‌بینی کند. این کار لایه‌های MTP را با توزیع مدل پایه هم‌راستا می‌کند تا سیگنال‌های آموزشی غنی‌تری فراهم شود.
  • تنظیم نظارت‌شده (SFT): تمرکز بر فراخوانی ابزار (Tool Calling)، خروجی‌های ساختاریافته و بازیابی (Retrieval) دوربرد. در این مرحله از داده‌های مصنوعی برای تجمیع چند-سندی و بازیابی دوربرد استفاده شد.
  • یادگیری تقویتی (RL): استفاده از بهینه‌سازی سیاست نسبی گروهی (GRPO) در محیط‌های ریاضی، کدنویسی، علوم و استفاده از ابزارهای چندمرحله‌ای از طریق NeMo RL و NeMo Gym. این مرحله از یک معماری RL ناهمگام (Asynchronous) برای جداسازی آموزش از استنتاج استفاده کرد.
  • کوانتش پس‌آموزش (PTQ): اعمال شده توسط NVIDIA Model Optimizer. کالیبراسیون با استفاده از ۱۰۰۰ نمونه از مجموعه اعتبارسنجی Nemotron Ultra با طول ۳۲ هزار توکن انجام شد.

جزئیات ترکیب مجموعه‌داده‌ها

هوش این مدل حاصل یک استراتژی داده‌ای هیبریدی است. انویدیا خزش‌های عمومی وب را با تولیدات مصنوعی هدفمند ترکیب کرده است:

  • وب و کد عمومی: شامل Common Crawl انگلیسی (۳.۳۶ تریلیون توکن)، نسخه‌های چندزبانه (۸۱۲.۷ میلیارد توکن) و خزش‌های GitHub (در مجموع بیش از ۹۰۰ میلیارد توکن). Common Crawl انگلیسی شامل اسنپ‌شات‌هایی از CC-MAIN-2013-20 تا CC-MAIN-2025-13 است. خزش‌های چندزبانه ۱۵ زبان از جمله عربی، چینی، دانمارکی، هلندی، فرانسوی، آلمانی، ایتالیایی، ژاپنی، کره‌ای، لهستانی، پرتغالی، روسی، اسپانیایی، سوئدی و تایلندی را پوشش داده است.
  • داده‌های مصنوعی تخصصی:
    • حقوقی: ۴.۳ میلیارد توکن از منابعی مانند مقررات کد کالیفرنیا، نظرات اخلاق قضایی و پیکره ToSDR (شرایط خدمات).
    • ریاضی و علوم: ۴۰ میلیارد توکن داده‌های "Art of Problem Solving" از DeepSeek-R1 و ۴.۶ میلیارد توکن از Nemotron-PrismMath. همچنین شامل ۷۳ میلیارد توکن داده‌های ریاضی بازنویسی‌شده از phi-4 و ۵۲.۳ میلیارد توکن داده‌های ریاضی مصنوعی از Common Crawl 4plus است.
    • کدنویسی: ردپاهای مصنوعی CUDA از GLM-4.7 و کدهای Verilog/SystemVerilog (۱.۲ میلیون توکن) تولید شده توسط DeepSeek-R1-0528 و GPT-OSS-120B. همچنین ۱.۲ میلیارد توکن کدنویسی علمی از Qwen3-235B-A22B را شامل می‌شود.
  • پشتیبانی چندزبانه: اگرچه تمرکز اصلی بر انگلیسی و کدنویسی است، اما مدل از اسپانیایی، فرانسوی، آلمانی، ایتالیایی، ژاپنی و چینی پشتیبانی می‌کند. پس‌آموزش بر این زبان‌ها از طریق وظایف استدلال و ترجمه متمرکز بود. پیش‌آموزش همچنین ۱۵ زبان از جمله عربی، کره‌ای، لهستانی، پرتغالی، روسی، سوئدی و تایلندی را در بر گرفت.
  • داده‌های عامل‌محور: شامل بیش از ۷۰۰ هزار نمونه از طرح‌واره‌های فراخوانی ابزار مصنوعی و مهارت‌های CLI/Web تولید شده توسط gpt-oss-120b. این بخش شامل ۶۱۴ هزار توکن از وظایف عامل‌محور OpenCode و ۲۴۲ هزار توکن داده‌های SWE بدون عامل از gpt-oss-120b است.

کنترل کیفیت و فیلترینگ

برای تضمین کیفیت، انویدیا یک خط لوله فیلترینگ یکپارچه اجرا کرد. در این فرآیند، نمونه‌های بدشکل (مانند فراخوانی‌های ابزار بدون تعریف) حذف شدند. همچنین ردپاهای استدلالی که دچار تکرارهای بیمارگونه بودند (مانند تکرار n-gramها در یک پنجره لغزان)، به‌شدت فیلتر شدند تا از توهم (Hallucination) جلوگیری شود.

علاوه بر این، انویدیا از فیلترهای هدفمند مبتنی بر کلمات کلیدی و Regex استفاده کرد تا مسیرهایی (Trajectories) را که به‌طور ضمنی با نهادهای سیاسی خاص هم‌راستا بودند یا روایت‌های ملی‌گرایانه را ترویج می‌کردند (که گاهی توسط مدل‌های معلم تولید می‌شدند)، حذف کند.

محک‌ها و عملکرد عامل‌محور

انویدیا مدل را با استفاده از NeMo Gym و SDK ارزیابی‌کننده NeMo سنجید. نتایج نشان‌دهنده تمایل شدید مدل به کدنویسی و وظایف عامل‌محور است. دقت با استفاده از چک‌پوینت رسمی NVFP4 اندازه‌گیری شد:

  • دانش عمومی: امتیاز ۸۱.۶۲ در MMLU Pro و ۱۶.۶۳ در AA-Omniscience.
  • استدلال: امتیاز ۷۵.۵۷ در GPQA Diamond (بدون ابزار) و ۱۰.۴۷ در HLE (فقط متن). همچنین امتیاز ۳۱.۳۸ در SciCode کسب کرد.
  • کدنویسی و عامل‌محور: امتیاز ۵۲.۸۰ در SWE-bench Verified و ۲۳.۴۶ در Terminal-Bench 2.1. همچنین به امتیاز ۸۳.۴۳ در PinchBench و ۳۶.۸۱ در BrowseComp رسید. امتیاز آن در $\tau^3$-bench (بانکداری) ۹.۴۸ و در GDPval-AA-V2 برابر ۸۶۵ بود.
  • پیروی از دستورالعمل: امتیاز ۷۲.۸۸ در IFBench (حالت loose).
  • پنجره متنی بلند: امتیاز ۴۹.۱۹ در AA-LCR.

لوگوی انویدیا و هاگینگ‌فیس در کنار نام مدل زبانی Nemotron 3.5 Lightning 30B A3B با فرمت NVFP4

استقرار و رمزگشایی گمانه‌زنانه

برای حل مشکل تأخیر (Latency) در تولید متن، انویدیا سه استراتژی رمزگشایی گمانه‌زنانه (Speculative Decoding) معرفی کرد:

۱. DSpark: یک پیش‌نویس نیمه‌خودبازگشتی که بلوکی از توکن‌های کاندید را در یک پاس پیشرو پیشنهاد می‌دهد. برای DGX Spark و مراکز داده با تراکم پایین توصیه می‌شود. این تکنیک در کنار DFlash توانسته است سرعت استنتاج مدل‌هایی مانند Qwen3.5 را روی سخت‌افزار DGX Spark به ۷۸ توکن در ثانیه برساند.
۲. DFlash: استفاده از یک مدل انتشار (Diffusion Model) سبک برای تولید یک بلوک پیش‌نویس کامل در یک پاس پیشرو.
۳. MTP: تکنیکی که شبکه را برای پیش‌بینی چندین توکن آینده در هر موقعیت آموزش می‌دهد.

برای توسعه‌دهندگان، این مدل با vLLM، TensorRT-LLM و SGLang سازگار است. تنظیمات نمونه‌برداری (Sampling) توصیه شده، Temperature 1.0 و Top_P 0.95 است.

دستورالعمل‌های سخت‌افزاری

استقرار مدل بسته به سخت‌افزار برای بهینه‌سازی توان عملیاتی (Throughput) و حافظه متفاوت است:

  • یک عدد DGX Spark (GB10): استفاده از vLLM با رمزگشایی DSpark، بک‌اند MoE مدل marlin و نوع داده fp8 برای KV-cache. دستور اجرا از vllm/vllm-openai:v0.27.1 استفاده کرده و max-model-len را روی ۱,۰۴۸,۵۷۶ تنظیم می‌کند.
  • یک عدد H100: برای حداکثر توان عملیاتی، انویدیا توصیه می‌کند از رمزگشایی گمانه‌زنانه استفاده نشود و از بک‌اندهای humming و حافظه Mamba در حالت float16 استفاده شود. برای استفاده تعاملی (بیش از ۴۰ توکن در ثانیه به ازای هر کاربر)، DSpark با هم‌روندی (Concurrency) کمتر یا مساوی ۱۲۸ پیشنهاد می‌شود.
  • هشت عدد H100: پشتیبانی از سرویس‌دهی پنجره متنی بلند با استفاده از موازی‌سازی تانسور (TP8) و موازی‌سازی خبره (Expert Parallelism).
  • یک عدد GB200: بهینه‌شده با DSpark و تعداد توکن‌های گمانه‌زن ۵ عدد.
  • کارت‌های Ampere: پشتیبانی از طریق کرنل‌های W4A16 با استفاده از فلگ کوانتش modelopt_fp4 در vLLM.

کنترل استدلال و API

مدل کنترل استدلال را از طریق kwargs در قالب چت (chat-template) ارائه می‌دهد. توسعه‌دهندگان می‌توانند enable_thinking را برای استدلال‌های مفصل روی True (پیش‌فرض) یا برای پاسخ‌های مستقیم روی False قرار دهند. برای عامل‌های کدنویسی، انویدیا توصیه می‌کند force_nonempty_content: True را به فراخوانی API اضافه کنید تا از خروجی‌های مستحکم در استفاده از ابزار مطمئن شوید.

تحلیل: گذار به اسب‌های بارکش محلی

این مدل نشان‌دهنده حرکتی به دور از رویکرد «یک مدل غول‌پیکر برای همه کارها» است. انویدیا با بهینه‌سازی برای ۳ میلیارد پارامتر فعال و یک میلیون توکن متن، لایه «زیر-عامل» (Sub-agent) را هدف قرار داده است. در یک سیستم پیچیده هوش مصنوعی، شما برای خلاصه‌سازی یک سند یا فراخوانی یک تابع به مدلی با تریلیون‌ها پارامتر نیاز ندارید؛ بلکه به یک مدل سریع و محلی نیاز دارید که متن را فراموش نکند.

برای متخصصان، این بدان معناست که سد ورود به دنیای عامل‌های محلی با پنجره متنی بالا فرو ریخته است. قابلیت اجرای این مدل روی RTX 5090 نشان می‌دهد که جریان‌های کاری حرفه‌ای عامل‌محور در حال انتقال از ابر به ایستگاه‌های کاری (Workstations) هستند. استفاده از توافق‌نامه مجوز OpenMDW (نسخه ۱.۱) نیز استفاده تجاری از این عامل‌های تخصصی را تسهیل می‌کند.

گام بعدی شما

  • مدل را با استفاده از نسخه nightly vLLM (v0.27.1) تست کنید تا ببینید آیا پنجره متنی یک میلیون توکنی می‌تواند جایگزین خط لوله‌های گران‌قیمت تولید بازیابی‌افزا (RAG) در مجموعه‌داده‌های شما شود.
  • اگر از کارت‌های سری RTX 50 استفاده می‌کنید، عملکرد مدل را در حالت استنتاج محلی برای تحلیل کدهای حجیم بسنجید.
  • تنظیمات Sampling را روی Temperature 1.0 و Top_P 0.95 قرار دهید تا تعادل میان خلاقیت و دقت حفظ شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش هزینه استنتاج و افزایش حافظه، ورود به دنیای عامل‌های محلی را برای توسعه‌دهندگان تسهیل می‌کند. اعتبار این پیشرفت بر پایه معماری هیبریدی MoE-Mamba است که سد حافظه در مدل‌های ترنسفورمر سنتی را می‌شکند.

تأثیر برای ایران

به‌دلیل محدودیت‌های سخت‌افزاری و دسترسی به GPUهای سری H100 و Blackwell، این مدل فعلاً بیشتر برای پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد تا توسعه‌دهندگان اپلیکیشن.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا بر پارامترهای فعال کم (۳ میلیارد) در کنار پنجره متنی عظیم، نشان می‌دهد که استراتژی آینده نه در مدل‌های غول‌آسای همه‌منظوره، بلکه در لایه‌ی «زیر-عامل‌ها» (Sub-agents) است. در یک سیستم پیچیده، شما به مدل تریلیونی برای خلاصه‌سازی یک سند نیاز ندارید، بلکه به مدلی سریع و محلی نیاز دارید که حافظه‌اش در میان راه پاک نشود. این یعنی انتقال قدرت از ابرهای متمرکز به ایستگاه‌های کاری حرفه‌ای.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.