یک واحد پردازش گرافیکی NVIDIA H100 اکنون میتواند یک مدل استدلالی با پنجره متنی یک میلیون توکنی را سرویسدهی کند. در ۱۱ اوت ۲۰۲۶، شرکت انویدیا (NVIDIA) از مدل Nemotron-3.5-Lightning-30B-A3B-NVFP4 پردهبرداری کرد؛ ابزاری که بهطور خاص برای تبدیل شدن به «اسب بارکش» عاملهای خودکار (Autonomous Agents) در عملیاتهای طولانیمدت طراحی شده است.
این عرضه در حالی رخ میدهد که صنعت از چتباتهای ساده به سمت سامانههای عاملمحور (Agentic Systems) حرکت میکند؛ سامانههایی که باید وضعیت (State) خود را در میان مستندات حجیم حفظ کنند. همانطور که در تحلیل قبلی ما دربارهی اتوماسیون توزیع مهارتها در Hugging Face اشاره کردیم، انویدیا اکنون زیرساخت محاسباتی لازم را فراهم کرده تا این عاملها بدون برخورد با سد حافظه، بهصورت محلی اجرا شوند.
تصور کنید میخواهید یک قرارداد حقوقی هزار صفحهای یا یک پایگاه کد عظیم را یکباره تحلیل کنید. اکثر مدلها یا ابتدای فایل را فراموش میکنند یا باعث کرش کردن سختافزار میشوند. Nemotron 3.5 این مشکل را با ترکیب معماری ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبیه به تیمی از متخصصان که در هر لحظه فقط فرد مناسب برای پاسخ به سؤال فراخوانده میشود — و لایههای Mamba-2 حل کرده است. این ساختار اجازه میدهد مدل تا یک میلیون توکن (Token) — تکههای کوچکی از متن که مدل تکهتکه میخورد — را مدیریت کند، در حالی که در هر لحظه تنها ۳ میلیارد پارامتر فعال هستند.
معماری و بهرهوری
این مدل یک ساختار هیبریدی دارد. انویدیا لایههای Mamba-2 و MoE را با لایههای منتخب توجه (Attention) ترکیب کرده تا تعادلی میان سرعت و حافظه ایجاد کند. اگرچه تعداد کل پارامترها ۳۰ میلیارد است، اما تعداد پارامترهای فعال تنها ۳ میلیارد است که هزینه محاسباتی هر توکن را بهشدت کاهش میدهد. طبق مستندات فنی، این معماری بر پایه Nemotron-3-Lightning و تکنیک پیشبینی چند-توکنی (Multi-Token Prediction یا MTP) بنا شده است.
انویدیا از یک دستورالعمل کوانتش (Quantization) خاص به نام NVFP4 (Four Over Six) استفاده کرده است. این روش در واقع گونهای از کالیبراسیون استاتیک MSE است. این دستورالعمل W4A16 را روی خبرههای مسیریابیشده (Routed) و مشترک اعمال میکند، در حالی که از مقیاسهای دینامیک FP8 در سطح تانسور برای mamba in_proj/out_proj و KV cache استفاده میکند. این رویکرد اجازه میدهد مدل روی سختافزارهای NVIDIA Blackwell (از جمله RTX 5090، GB200 و DGX Spark / GB10)، Hopper (H100 و H200) و حتی نسل Ampere از طریق کرنلهای W4A16 اجرا شود.

پیشآموزش و تبار دادهها
به نقل از کارت مدل در Hugging Face، مرحله پیشآموزش (Pre-training) شامل بیش از ۲۰ تریلیون توکن بوده است. بازه جمعآوری دادهها از سال ۲۰۱۳ تا دسامبر ۲۰۲۵ است. نقطه قطع دادهها برای پیشآموزش سپتامبر ۲۰۲۵ تعیین شده، هرچند دادههای پسآموزش تا مه ۲۰۲۶ ادامه دارند.
انویدیا یک خط لوله آموزشی پنجمرحلهای را به کار گرفته است:
- پیشآموزش: استفاده از Megatron-LM با ترکیبی از کدهای خزششده و دادههای مصنوعی در حوزههای ریاضی و علوم. بنیاد این مرحله، پیکره Nemotron 3 است که شامل Nemotron-CC-v2 (۹.۱ تریلیون توکن)، Nemotron-Pretraining-Code (۱.۷ تریلیون توکن) و دادههای تخصصی استدلال STEM است. این رویکرد در راستای بهینهسازیهای گستردهتری است که NeMo Automodel برای رفع محدودیتهای مقیاسپذیری در مدلهای پخش به کار میگیرد.
- پیشبینی چند-توکنی (MTP): یک مرحله پیشآموزش مستمر که در آن مدل یاد گرفت چندین توکن آینده را بهطور همزمان پیشبینی کند. این کار لایههای MTP را با توزیع مدل پایه همراستا میکند تا سیگنالهای آموزشی غنیتری فراهم شود.
- تنظیم نظارتشده (SFT): تمرکز بر فراخوانی ابزار (Tool Calling)، خروجیهای ساختاریافته و بازیابی (Retrieval) دوربرد. در این مرحله از دادههای مصنوعی برای تجمیع چند-سندی و بازیابی دوربرد استفاده شد.
- یادگیری تقویتی (RL): استفاده از بهینهسازی سیاست نسبی گروهی (GRPO) در محیطهای ریاضی، کدنویسی، علوم و استفاده از ابزارهای چندمرحلهای از طریق NeMo RL و NeMo Gym. این مرحله از یک معماری RL ناهمگام (Asynchronous) برای جداسازی آموزش از استنتاج استفاده کرد.
- کوانتش پسآموزش (PTQ): اعمال شده توسط NVIDIA Model Optimizer. کالیبراسیون با استفاده از ۱۰۰۰ نمونه از مجموعه اعتبارسنجی Nemotron Ultra با طول ۳۲ هزار توکن انجام شد.
جزئیات ترکیب مجموعهدادهها
هوش این مدل حاصل یک استراتژی دادهای هیبریدی است. انویدیا خزشهای عمومی وب را با تولیدات مصنوعی هدفمند ترکیب کرده است:
- وب و کد عمومی: شامل Common Crawl انگلیسی (۳.۳۶ تریلیون توکن)، نسخههای چندزبانه (۸۱۲.۷ میلیارد توکن) و خزشهای GitHub (در مجموع بیش از ۹۰۰ میلیارد توکن). Common Crawl انگلیسی شامل اسنپشاتهایی از CC-MAIN-2013-20 تا CC-MAIN-2025-13 است. خزشهای چندزبانه ۱۵ زبان از جمله عربی، چینی، دانمارکی، هلندی، فرانسوی، آلمانی، ایتالیایی، ژاپنی، کرهای، لهستانی، پرتغالی، روسی، اسپانیایی، سوئدی و تایلندی را پوشش داده است.
- دادههای مصنوعی تخصصی:
- حقوقی: ۴.۳ میلیارد توکن از منابعی مانند مقررات کد کالیفرنیا، نظرات اخلاق قضایی و پیکره ToSDR (شرایط خدمات).
- ریاضی و علوم: ۴۰ میلیارد توکن دادههای "Art of Problem Solving" از DeepSeek-R1 و ۴.۶ میلیارد توکن از Nemotron-PrismMath. همچنین شامل ۷۳ میلیارد توکن دادههای ریاضی بازنویسیشده از phi-4 و ۵۲.۳ میلیارد توکن دادههای ریاضی مصنوعی از Common Crawl 4plus است.
- کدنویسی: ردپاهای مصنوعی CUDA از GLM-4.7 و کدهای Verilog/SystemVerilog (۱.۲ میلیون توکن) تولید شده توسط DeepSeek-R1-0528 و GPT-OSS-120B. همچنین ۱.۲ میلیارد توکن کدنویسی علمی از Qwen3-235B-A22B را شامل میشود.
- پشتیبانی چندزبانه: اگرچه تمرکز اصلی بر انگلیسی و کدنویسی است، اما مدل از اسپانیایی، فرانسوی، آلمانی، ایتالیایی، ژاپنی و چینی پشتیبانی میکند. پسآموزش بر این زبانها از طریق وظایف استدلال و ترجمه متمرکز بود. پیشآموزش همچنین ۱۵ زبان از جمله عربی، کرهای، لهستانی، پرتغالی، روسی، سوئدی و تایلندی را در بر گرفت.
- دادههای عاملمحور: شامل بیش از ۷۰۰ هزار نمونه از طرحوارههای فراخوانی ابزار مصنوعی و مهارتهای CLI/Web تولید شده توسط gpt-oss-120b. این بخش شامل ۶۱۴ هزار توکن از وظایف عاملمحور OpenCode و ۲۴۲ هزار توکن دادههای SWE بدون عامل از gpt-oss-120b است.
کنترل کیفیت و فیلترینگ
برای تضمین کیفیت، انویدیا یک خط لوله فیلترینگ یکپارچه اجرا کرد. در این فرآیند، نمونههای بدشکل (مانند فراخوانیهای ابزار بدون تعریف) حذف شدند. همچنین ردپاهای استدلالی که دچار تکرارهای بیمارگونه بودند (مانند تکرار n-gramها در یک پنجره لغزان)، بهشدت فیلتر شدند تا از توهم (Hallucination) جلوگیری شود.
علاوه بر این، انویدیا از فیلترهای هدفمند مبتنی بر کلمات کلیدی و Regex استفاده کرد تا مسیرهایی (Trajectories) را که بهطور ضمنی با نهادهای سیاسی خاص همراستا بودند یا روایتهای ملیگرایانه را ترویج میکردند (که گاهی توسط مدلهای معلم تولید میشدند)، حذف کند.
محکها و عملکرد عاملمحور
انویدیا مدل را با استفاده از NeMo Gym و SDK ارزیابیکننده NeMo سنجید. نتایج نشاندهنده تمایل شدید مدل به کدنویسی و وظایف عاملمحور است. دقت با استفاده از چکپوینت رسمی NVFP4 اندازهگیری شد:
- دانش عمومی: امتیاز ۸۱.۶۲ در MMLU Pro و ۱۶.۶۳ در AA-Omniscience.
- استدلال: امتیاز ۷۵.۵۷ در GPQA Diamond (بدون ابزار) و ۱۰.۴۷ در HLE (فقط متن). همچنین امتیاز ۳۱.۳۸ در SciCode کسب کرد.
- کدنویسی و عاملمحور: امتیاز ۵۲.۸۰ در SWE-bench Verified و ۲۳.۴۶ در Terminal-Bench 2.1. همچنین به امتیاز ۸۳.۴۳ در PinchBench و ۳۶.۸۱ در BrowseComp رسید. امتیاز آن در $\tau^3$-bench (بانکداری) ۹.۴۸ و در GDPval-AA-V2 برابر ۸۶۵ بود.
- پیروی از دستورالعمل: امتیاز ۷۲.۸۸ در IFBench (حالت loose).
- پنجره متنی بلند: امتیاز ۴۹.۱۹ در AA-LCR.

استقرار و رمزگشایی گمانهزنانه
برای حل مشکل تأخیر (Latency) در تولید متن، انویدیا سه استراتژی رمزگشایی گمانهزنانه (Speculative Decoding) معرفی کرد:
۱. DSpark: یک پیشنویس نیمهخودبازگشتی که بلوکی از توکنهای کاندید را در یک پاس پیشرو پیشنهاد میدهد. برای DGX Spark و مراکز داده با تراکم پایین توصیه میشود. این تکنیک در کنار DFlash توانسته است سرعت استنتاج مدلهایی مانند Qwen3.5 را روی سختافزار DGX Spark به ۷۸ توکن در ثانیه برساند.
۲. DFlash: استفاده از یک مدل انتشار (Diffusion Model) سبک برای تولید یک بلوک پیشنویس کامل در یک پاس پیشرو.
۳. MTP: تکنیکی که شبکه را برای پیشبینی چندین توکن آینده در هر موقعیت آموزش میدهد.
برای توسعهدهندگان، این مدل با vLLM، TensorRT-LLM و SGLang سازگار است. تنظیمات نمونهبرداری (Sampling) توصیه شده، Temperature 1.0 و Top_P 0.95 است.
دستورالعملهای سختافزاری
استقرار مدل بسته به سختافزار برای بهینهسازی توان عملیاتی (Throughput) و حافظه متفاوت است:
- یک عدد DGX Spark (GB10): استفاده از vLLM با رمزگشایی DSpark، بکاند MoE مدل
marlinو نوع دادهfp8برای KV-cache. دستور اجرا ازvllm/vllm-openai:v0.27.1استفاده کرده وmax-model-lenرا روی ۱,۰۴۸,۵۷۶ تنظیم میکند. - یک عدد H100: برای حداکثر توان عملیاتی، انویدیا توصیه میکند از رمزگشایی گمانهزنانه استفاده نشود و از بکاندهای
hummingو حافظه Mamba در حالتfloat16استفاده شود. برای استفاده تعاملی (بیش از ۴۰ توکن در ثانیه به ازای هر کاربر)، DSpark با همروندی (Concurrency) کمتر یا مساوی ۱۲۸ پیشنهاد میشود. - هشت عدد H100: پشتیبانی از سرویسدهی پنجره متنی بلند با استفاده از موازیسازی تانسور (TP8) و موازیسازی خبره (Expert Parallelism).
- یک عدد GB200: بهینهشده با DSpark و تعداد توکنهای گمانهزن ۵ عدد.
- کارتهای Ampere: پشتیبانی از طریق کرنلهای W4A16 با استفاده از فلگ کوانتش
modelopt_fp4در vLLM.
کنترل استدلال و API
مدل کنترل استدلال را از طریق kwargs در قالب چت (chat-template) ارائه میدهد. توسعهدهندگان میتوانند enable_thinking را برای استدلالهای مفصل روی True (پیشفرض) یا برای پاسخهای مستقیم روی False قرار دهند. برای عاملهای کدنویسی، انویدیا توصیه میکند force_nonempty_content: True را به فراخوانی API اضافه کنید تا از خروجیهای مستحکم در استفاده از ابزار مطمئن شوید.
تحلیل: گذار به اسبهای بارکش محلی
این مدل نشاندهنده حرکتی به دور از رویکرد «یک مدل غولپیکر برای همه کارها» است. انویدیا با بهینهسازی برای ۳ میلیارد پارامتر فعال و یک میلیون توکن متن، لایه «زیر-عامل» (Sub-agent) را هدف قرار داده است. در یک سیستم پیچیده هوش مصنوعی، شما برای خلاصهسازی یک سند یا فراخوانی یک تابع به مدلی با تریلیونها پارامتر نیاز ندارید؛ بلکه به یک مدل سریع و محلی نیاز دارید که متن را فراموش نکند.
برای متخصصان، این بدان معناست که سد ورود به دنیای عاملهای محلی با پنجره متنی بالا فرو ریخته است. قابلیت اجرای این مدل روی RTX 5090 نشان میدهد که جریانهای کاری حرفهای عاملمحور در حال انتقال از ابر به ایستگاههای کاری (Workstations) هستند. استفاده از توافقنامه مجوز OpenMDW (نسخه ۱.۱) نیز استفاده تجاری از این عاملهای تخصصی را تسهیل میکند.
گام بعدی شما
- مدل را با استفاده از نسخه nightly vLLM (v0.27.1) تست کنید تا ببینید آیا پنجره متنی یک میلیون توکنی میتواند جایگزین خط لولههای گرانقیمت تولید بازیابیافزا (RAG) در مجموعهدادههای شما شود.
- اگر از کارتهای سری RTX 50 استفاده میکنید، عملکرد مدل را در حالت استنتاج محلی برای تحلیل کدهای حجیم بسنجید.
- تنظیمات Sampling را روی Temperature 1.0 و Top_P 0.95 قرار دهید تا تعادل میان خلاقیت و دقت حفظ شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو