پرش به محتوای اصلی
پرش به محتوای مقاله

نمودار سرعت انویدیا: مدل Nemotron 3.5 Lightning به ۶۷۰ توکن در ثانیه رسید

·۲۰ مرداد ۱۴۰۵۳ دقیقه مطالعه۳ بازدید
نمودار عملکرد مدل‌های زبانی: مقایسه سرعت و دقت در Nemotron 3.5 Lightning و رقبا
نمودار عملکرد مدل‌های زبانی: مقایسه سرعت و دقت در Nemotron 3.5 Lightning و رقبا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به سرعت ۶۷۰ توکن در ثانیه در یک مدل وزن‌باز؛ این مدل ثابت کرد که می‌توان بدون افت شدید هوش، سرعت استنتاج را در مقیاس عامل‌محور دو برابر کرد.

۶۷۰ توکن در ثانیه. این سرعت تقریباً بی‌سابقه در مدل جدید Nemotron 3.5 Lightning است که کفِ سرعت برای مدل‌های وزن‌باز (Open Weights) — یعنی مدل‌هایی که دستور پخت یا همان وزن‌هایشان علناً منتشر شده و نه فقط غذای آماده — را بازتعریف می‌کند. طبق گزارش ۱۱ اوت ۲۰۲۶ از وب‌سایت Artificial Analysis، این توان عملیاتی تقریباً دو برابر سریع‌تر از مدل Gemini 3.5 Flash-Lite گوگل با ۳۸۶ توکن بر ثانیه است.

سال‌هاست صنعت هوش مصنوعی تصور می‌کرد برای رسیدن به هوش بالاتر، به تعداد پارامترهای عظیم نیاز است. انویدیا اکنون این منطق را به چالش کشیده و مدلی «کاربردی» عرضه کرده که به‌جای چت‌های عمومی، برای خط لوله‌های عامل‌محور (Agentic) با توان عملیاتی بالا طراحی شده است. تصور کنید سیستمی که یک وظیفه پیچیده را در ۳۰ ثانیه انجام می‌دهد، در حالی که رقبایش نزدیک به ۶ دقیقه زمان می‌برند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، تمرکز بر کارایی در لایه‌های عملیاتی، اهمیت بیشتری نسبت به نمرات تئوریک دارد. این رویکرد با تلاش‌های اخیر برای بهینه‌سازی زیرساختی همسو است، مشابه آنچه در بهبود سرعت استنتاج مدل‌های کم‌رتبه از طریق کرنل‌های Triton مشاهده کردیم.

زمینه و معماری

Nemotron 3.5 Lightning نخستین مدل از خانواده جدید Nemotron 3.5 است و مستقیماً جایگزین مدل Nemotron 3 Nano 30B A3B می‌شود. این مدل از معماری ترکیبی مامبا-ترنسفورمر (Mamba-Transformer) استفاده می‌کند. اگرچه مجموع پارامترهای آن ۳۱.۶ میلیارد است، اما در هر گام تنها ۳.۶ میلیارد پارامتر فعال می‌شوند.

این بهره‌وری اجازه می‌دهد مدل روی یک تک‌کارت NVIDIA H100 یا معماری جدیدتر Blackwell، از جمله کارت گرافیک GeForce RTX 5090، اجرا شود. بر اساس یک مقاله پژوهشی از سال گذشته، محققان انویدیا استدلال کردند که مدل‌های زیر ۱۰ میلیارد پارامتر می‌توانند اکثر وظایف عامل‌محور را با کیفیتی مشابه مدل‌های ۷۰ تا ۱۷۵ میلیارد پارامتری، اما با یک‌دهم تا سی‌ام هزینه انجام دهند. مدل Lightning صریح‌ترین گواه محصولی برای این فرضیه است.

جزئیات و محک‌های عملکرد

در بررسی محک‌های عملکرد، نتایج زیر به چشم می‌خورد:

  • شاخص هوش: کسب امتیاز ۲۴ که با مدل gpt-oss-120b شرکت OpenAI برابری می‌کند، در حالی که تنها یک‌چهارم پارامترهای آن را دارد نمودار مقایسه سرعت و دقت مدل‌های زبانی مختلف، با برتری Nemotron 3.5 Lightning در سرعت پردازش. این یک جهش ۹ امتیازی نسبت به امتیاز ۱۵ در نسل قبلی است. این مدل درست پشت سر Nemotron 3 Super (با امتیاز ۲۶) قرار دارد که چهار برابر بزرگتر است. با این حال، مدل‌هایی مانند Qwen3.6 35B A3B (امتیاز ۳۲) و Muse Glimmer متا (امتیاز ۳۵) همچنان پیشتاز هستند.

  • توان عملیاتی: رسیدن به ۶۶۹ توکن در ثانیه که بالاترین مقدار اندازه‌گیری شده در گروه مقایسه‌ای است نمودار عملکرد مدل‌های هوش مصنوعی: سرعت بالای نمودار ۳.۵ لایتنینگ انویدیا در مقایسه با مدل‌های بزرگ‌تر. یک وظیفه در شاخص هوش حدود ۰.۵ دقیقه زمان می‌برد، در حالی که برای Qwen3.6 35B A3B حدود ۳.۵ دقیقه و برای Gemma 4 31B حدود ۵.۸ دقیقه زمان لازم است.

  • توانایی عامل‌محور: کسب رتبه ۸۲۴ در GDPval-AA v2 که ۳۳۴ امتیاز بالاتر از Nemotron 3 Nano است. این نتیجه حتی از gpt-oss-120b (امتیاز ۸۰۰) و مدل بزرگتر Nemotron 3 Super (امتیاز ۶۹۸) پیشی گرفته است نمودار عملکرد مدل‌های هوش مصنوعی: سرعت بالای نمودار ۳.۵ لایتنینگ انویدیا در مقایسه با مدل‌های بزرگ‌تر. همچنین در Terminal-Bench v2.1، امتیاز این مدل از ۷ درصد به ۲۴.۳ درصد جهش کرد که تقریباً با gpt-oss-120b (۲۶.۲ درصد) برابری می‌کند.

  • پنجره زمینه: پشتیبانی از یک میلیون توکن برای استدلال‌های متنی.

جزئیات استقرار و دسترسی

در بخش استقرار، وزن‌های این مدل در قالب‌های BF16 و NVFP4 عرضه شده‌اند. نسخه NVFP4 نیز با کمترین افت کیفیت، امتیاز ۲۴ را در شاخص هوش کسب کرده است. این مدل تحت لایسنس باز و سهل‌الوصول OpenMDW-1.1 منتشر شده است.

انویدیا برای صیقل دادن عملکرد مدل در حوزه‌های تخصصی و حرفه‌ای، با شرکایی مانند CodeRabbit و Harvey در مرحله پس‌آموزش (Post-training) همکاری کرده است.

با این حال، مدل‌های انحصاری همچنان مرز کارایی را در دست دارند. Gemini 3.5 Flash-Lite امتیاز ۳۷ را در شاخص هوش با زمان مشابه برای هر وظیفه کسب کرده و GPT-5.6 Luna (max) با امتیاز ۵۲ در کمتر از دو دقیقه پاسخ می‌دهد. در همین راستا، رقابت بر سر کاهش هزینه‌ها شدت یافته است، به‌طوری که مدل DeepSeek V4 Flash توانسته است با هزینه‌ای ۶۰٪ کمتر، عملکردی مشابه GPT-5.6 Luna ارائه دهد.

این چرخش به معنای حرکت به سمت «کارایی تخصصی» است. انویدیا با اولویت دادن به سرعت و عملکرد عامل‌محور بر نمرات خام بنچمارک، لایه تولیدی هوش مصنوعی را هدف قرار داده؛ جایی که تأخیر (Latency) — یا همان فاصله زمانی بین درخواست کاربر و دریافت اولین پاسخ — گلوگاه اصلی سودآوری است.

برای صاحبان کسب‌وکار، این یعنی اتوماسیون‌های مبتنی بر عامل، مانند کدنویسی خودکار یا بررسی حقوقی، اکنون با کسری از هزینه و زمان قبلی قابل اجرا هستند. این مدل ثابت می‌کند که برای اکثر بارهای کاری عامل‌محور، یک مدل سبک می‌تواند با یک‌سی‌ام هزینه، با غول‌های ۱۷۵ میلیارد پارامتری برابری کند.

توسعه‌دهندگان در حال حاضر می‌توانند از طریق ارائه‌دهندگان استنتاج بدون سرور مانند DeepInfra، Fireworks، CoreWeave، FriendliAI، GMI Cloud، Nebius و Crusoe به این مدل دسترسی داشته باشند.

باید منتظر ماند و دید این معماری پرسرعت چگونه بر موج بعدی هوش مصنوعی روی دستگاه (On-device AI) تأثیر می‌گذارد؛ چرا که توانایی اجرای بیش از ۶۰۰ توکن در ثانیه روی سخت‌افزارهای مصرف‌کننده مانند RTX 5090، می‌تواند امکان ایجاد عامل‌های هوش مصنوعی محلی و در لحظه (Real-time) را فراهم کند.

گام بعدی شما

  • اگر از عامل‌های هوش مصنوعی برای کارهای تکراری استفاده می‌کنید، مدل Lightning را برای کاهش هزینه استنتاج تست کنید.
  • بررسی کنید که آیا سخت‌افزار شما (مانند سری RTX 50) توانایی اجرای محلی این مدل با سرعت ۶۰۰+ توکن را دارد یا خیر.
  • برای پیاده‌سازی گردش‌کارهای سریع، معماری Mamba-Transformer را در مقایسه با ترنسفورمرهای خالص مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار مهندسی سخت‌افزاری انویدیا، هزینه عملیاتی عامل‌های هوش مصنوعی را به شدت کاهش می‌دهد. این تغییر باعث می‌شود اتوماسیون‌های پیچیده از حالت آزمایشی به ابزارهای سودآور تجاری تبدیل شوند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به ارائه‌دهندگان سرورلس برای توسعه‌دهندگان ایرانی دشوار است، اما وزن‌های باز مدل امکان میزبانی شخصی (Self-hosting) را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انویدیا با این مدل عملاً اعلام کرد که «بزرگتر بودن» دیگر تنها راه رسیدن به کارایی در دنیای عامل‌ها نیست. تمرکز بر فعال‌سازی بخشی از پارامترها در هر گام، نشان می‌دهد که آینده مدل‌های تجاری نه در ابعاد غول‌آسا، بلکه در معماری‌های پویا و متناسب با نیاز است که تأخیر را به حداقل برسانند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.