۶۷۰ توکن در ثانیه. این سرعت تقریباً بیسابقه در مدل جدید Nemotron 3.5 Lightning است که کفِ سرعت برای مدلهای وزنباز (Open Weights) — یعنی مدلهایی که دستور پخت یا همان وزنهایشان علناً منتشر شده و نه فقط غذای آماده — را بازتعریف میکند. طبق گزارش ۱۱ اوت ۲۰۲۶ از وبسایت Artificial Analysis، این توان عملیاتی تقریباً دو برابر سریعتر از مدل Gemini 3.5 Flash-Lite گوگل با ۳۸۶ توکن بر ثانیه است.
سالهاست صنعت هوش مصنوعی تصور میکرد برای رسیدن به هوش بالاتر، به تعداد پارامترهای عظیم نیاز است. انویدیا اکنون این منطق را به چالش کشیده و مدلی «کاربردی» عرضه کرده که بهجای چتهای عمومی، برای خط لولههای عاملمحور (Agentic) با توان عملیاتی بالا طراحی شده است. تصور کنید سیستمی که یک وظیفه پیچیده را در ۳۰ ثانیه انجام میدهد، در حالی که رقبایش نزدیک به ۶ دقیقه زمان میبرند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای کوچک اشاره کردیم، تمرکز بر کارایی در لایههای عملیاتی، اهمیت بیشتری نسبت به نمرات تئوریک دارد. این رویکرد با تلاشهای اخیر برای بهینهسازی زیرساختی همسو است، مشابه آنچه در بهبود سرعت استنتاج مدلهای کمرتبه از طریق کرنلهای Triton مشاهده کردیم.
زمینه و معماری
Nemotron 3.5 Lightning نخستین مدل از خانواده جدید Nemotron 3.5 است و مستقیماً جایگزین مدل Nemotron 3 Nano 30B A3B میشود. این مدل از معماری ترکیبی مامبا-ترنسفورمر (Mamba-Transformer) استفاده میکند. اگرچه مجموع پارامترهای آن ۳۱.۶ میلیارد است، اما در هر گام تنها ۳.۶ میلیارد پارامتر فعال میشوند.
این بهرهوری اجازه میدهد مدل روی یک تککارت NVIDIA H100 یا معماری جدیدتر Blackwell، از جمله کارت گرافیک GeForce RTX 5090، اجرا شود. بر اساس یک مقاله پژوهشی از سال گذشته، محققان انویدیا استدلال کردند که مدلهای زیر ۱۰ میلیارد پارامتر میتوانند اکثر وظایف عاملمحور را با کیفیتی مشابه مدلهای ۷۰ تا ۱۷۵ میلیارد پارامتری، اما با یکدهم تا سیام هزینه انجام دهند. مدل Lightning صریحترین گواه محصولی برای این فرضیه است.
جزئیات و محکهای عملکرد
در بررسی محکهای عملکرد، نتایج زیر به چشم میخورد:
شاخص هوش: کسب امتیاز ۲۴ که با مدل gpt-oss-120b شرکت OpenAI برابری میکند، در حالی که تنها یکچهارم پارامترهای آن را دارد
. این یک جهش ۹ امتیازی نسبت به امتیاز ۱۵ در نسل قبلی است. این مدل درست پشت سر Nemotron 3 Super (با امتیاز ۲۶) قرار دارد که چهار برابر بزرگتر است. با این حال، مدلهایی مانند Qwen3.6 35B A3B (امتیاز ۳۲) و Muse Glimmer متا (امتیاز ۳۵) همچنان پیشتاز هستند.توان عملیاتی: رسیدن به ۶۶۹ توکن در ثانیه که بالاترین مقدار اندازهگیری شده در گروه مقایسهای است
. یک وظیفه در شاخص هوش حدود ۰.۵ دقیقه زمان میبرد، در حالی که برای Qwen3.6 35B A3B حدود ۳.۵ دقیقه و برای Gemma 4 31B حدود ۵.۸ دقیقه زمان لازم است.توانایی عاملمحور: کسب رتبه ۸۲۴ در GDPval-AA v2 که ۳۳۴ امتیاز بالاتر از Nemotron 3 Nano است. این نتیجه حتی از gpt-oss-120b (امتیاز ۸۰۰) و مدل بزرگتر Nemotron 3 Super (امتیاز ۶۹۸) پیشی گرفته است
. همچنین در Terminal-Bench v2.1، امتیاز این مدل از ۷ درصد به ۲۴.۳ درصد جهش کرد که تقریباً با gpt-oss-120b (۲۶.۲ درصد) برابری میکند.پنجره زمینه: پشتیبانی از یک میلیون توکن برای استدلالهای متنی.
جزئیات استقرار و دسترسی
در بخش استقرار، وزنهای این مدل در قالبهای BF16 و NVFP4 عرضه شدهاند. نسخه NVFP4 نیز با کمترین افت کیفیت، امتیاز ۲۴ را در شاخص هوش کسب کرده است. این مدل تحت لایسنس باز و سهلالوصول OpenMDW-1.1 منتشر شده است.
انویدیا برای صیقل دادن عملکرد مدل در حوزههای تخصصی و حرفهای، با شرکایی مانند CodeRabbit و Harvey در مرحله پسآموزش (Post-training) همکاری کرده است.
با این حال، مدلهای انحصاری همچنان مرز کارایی را در دست دارند. Gemini 3.5 Flash-Lite امتیاز ۳۷ را در شاخص هوش با زمان مشابه برای هر وظیفه کسب کرده و GPT-5.6 Luna (max) با امتیاز ۵۲ در کمتر از دو دقیقه پاسخ میدهد. در همین راستا، رقابت بر سر کاهش هزینهها شدت یافته است، بهطوری که مدل DeepSeek V4 Flash توانسته است با هزینهای ۶۰٪ کمتر، عملکردی مشابه GPT-5.6 Luna ارائه دهد.
این چرخش به معنای حرکت به سمت «کارایی تخصصی» است. انویدیا با اولویت دادن به سرعت و عملکرد عاملمحور بر نمرات خام بنچمارک، لایه تولیدی هوش مصنوعی را هدف قرار داده؛ جایی که تأخیر (Latency) — یا همان فاصله زمانی بین درخواست کاربر و دریافت اولین پاسخ — گلوگاه اصلی سودآوری است.
برای صاحبان کسبوکار، این یعنی اتوماسیونهای مبتنی بر عامل، مانند کدنویسی خودکار یا بررسی حقوقی، اکنون با کسری از هزینه و زمان قبلی قابل اجرا هستند. این مدل ثابت میکند که برای اکثر بارهای کاری عاملمحور، یک مدل سبک میتواند با یکسیام هزینه، با غولهای ۱۷۵ میلیارد پارامتری برابری کند.
توسعهدهندگان در حال حاضر میتوانند از طریق ارائهدهندگان استنتاج بدون سرور مانند DeepInfra، Fireworks، CoreWeave، FriendliAI، GMI Cloud، Nebius و Crusoe به این مدل دسترسی داشته باشند.
باید منتظر ماند و دید این معماری پرسرعت چگونه بر موج بعدی هوش مصنوعی روی دستگاه (On-device AI) تأثیر میگذارد؛ چرا که توانایی اجرای بیش از ۶۰۰ توکن در ثانیه روی سختافزارهای مصرفکننده مانند RTX 5090، میتواند امکان ایجاد عاملهای هوش مصنوعی محلی و در لحظه (Real-time) را فراهم کند.
گام بعدی شما
- اگر از عاملهای هوش مصنوعی برای کارهای تکراری استفاده میکنید، مدل Lightning را برای کاهش هزینه استنتاج تست کنید.
- بررسی کنید که آیا سختافزار شما (مانند سری RTX 50) توانایی اجرای محلی این مدل با سرعت ۶۰۰+ توکن را دارد یا خیر.
- برای پیادهسازی گردشکارهای سریع، معماری Mamba-Transformer را در مقایسه با ترنسفورمرهای خالص مطالعه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو