اگر امروز برای اجرای مدلهای زبانی هزینه میکنید، احتمالاً متوجه شدهاید که گلوگاه اصلی دیگر قدرت مدل نیست، بلکه هزینه هر توکن است. انویدیا با معرفی خانواده Nemotron 3، بازی را تغییر داد تا مدلها دقیقاً در اندازهٔ حافظهٔ سختافزاری شما جای بگیرند.
به نقل از کریس الکسیوک (Chris Alexiuk)، یکی از چهرههای کلیدی این پروژه، انویدیا در ۱۲ اوت ۲۰۲۶ اعلام کرد که دیگر مدلهای خود را بر اساس قوانین ریاضی انتزاعی مقیاسپذیری نمیسازد، بلکه آنها را بر اساس «ردپای سختافزاری» (Hardware Footprint) طراحی میکند. این استراتژی تضمین میکند که مدلها در هر سطح از GPUها، بیشترین بهرهوری ممکن را داشته باشند.
این رویکرد در حالی رخ میدهد که صنعت از چتباتهای ساده به سمت عاملهای هوش مصنوعی (AI Agents) — شبیه به کارمندانی دیجیتال که میتوانند بهطور مستقل وظایفی را از ابتدا تا انتها انجام دهند — حرکت میکند. همانطور که پیشتر بررسی کردیم، هوش مصنوعی عاملمحور در حال حاضر چرخههای فروش در کشف دارو را از چندین ماه به چند هفته کاهش داده است. اما اکنون گلوگاه از «توانایی» مدل به «هزینهٔ اجرا» تغییر یافته است. انویدیا با ارائه مدلهای وزنهای باز (Open Weights) — یعنی مدلهایی که پارامترهایشان علناً منتشر شده تا هر کسی بتواند آنها را اجرا کند — قصد دارد این شکاف زیرساختی را پر کند.
تکامل خانواده نموترون
مسیر توسعهٔ Nemotron خطی نبوده است. این مسیر با Nemotron-4 340B شروع شد که عمدتاً بهعنوان یک کارخانه تولید دادههای مصنوعی (Synthetic Data Factory) عرضه شد. پس از آن، Llama Nemotron که از یک مدل پایه شخص ثالث استفاده میکرد و مدلهای ترکیبی Nemotron-H از راه رسیدند.
اکنون این خانواده به Nemotron 3 ختم شده است که یک خانوادهٔ مدل باز در سطح پیشرو (Frontier-class) است. الکسیوک این تکامل را تلاشی آگاهانه برای ایجاد یک چرخهٔ بازخورد در علوم باز میداند. انویدیا با بازگرداندن آموختههای خود به اکوسیستم، میخواهد دقیقاً بفهمد چه ابزارهایی لازم است تا GPUها در مقیاس پیشآموزش و یادگیری تقویتی (RL) با حداکثر سرعت یا همان حالت «go BRRRRR» کار کنند.
اگرچه برخی از مسیرهای آزمایشی در چند سال گذشته به مرحلهٔ عرضه نهایی نرسیدند، اما انویدیا این موارد را گامهایی ضروری در فرآیند علمی میبیند تا درک کند اکوسیستم چگونه از هوش مصنوعی بهره میبرد.
لایههای متناسب با سختافزار
برخلاف اکثر مدلهای پیشرو که بر اساس قوانین ریاضی مقیاس میشوند، Nemotron 3 در سه سطح عرضه میشود که هر کدام بهطور خاص از روی سختافزارهای انویدیا مهندسی معکوس شدهاند:
- Nano: حدود ۳۰ میلیارد پارامتر (۳ میلیارد فعال)، طراحی شده برای اینکه روی یک GPU واحد جای بگیرد.
- Super: حدود ۱۰۰ میلیارد پارامتر (۱۲ میلیارد فعال)، بهینه شده برای یک گره (Node) محاسباتی.
- Ultra: حدود ۵۰۰ میلیارد پارامتر (۵۰ میلیارد فعال)، متناسب با یک رک NVL72.
الکسیوک اشاره میکند که این رویکرد پیکربندیهای استقرار بهینه را تضمین میکند و به توسعهدهندگان اجازه میدهد دقیقاً بدانند برای هر اندازهٔ مدل، چه بودجهای برای سختافزار نیاز است. کارتهای مدل (Model Cards) بهطور صریح این پیکربندیهای بهینه را شرح میدهند تا کاربران را به سمت بهترین عملکرد برای سختافزار خاص خود هدایت کنند.
معماری بهرهوری
انویدیا برای رسیدن به این سطح از عملکرد، از معماریهای صرفاً مبتنی بر توجه (Attention) فاصله گرفته است. Nemotron 3 لایههای Mamba-2 را با ترکیب خبرهها (MoE) بهصورت پراکنده ترکیب میکند و تنها تعداد کمی از لایههای توجه را در کل پشته (Stack) نگه میدارد.
این رویکرد ترکیبی، توازن بین «بازیابی با بافتار طولانی» (Long-context recall) و «سرعت استنتاج» را هدف قرار داده است. الکسیوک معتقد است اگرچه «توجه تنها چیزی نیست که نیاز داریم»، اما همچنان برای بازیابی اطلاعات در بافتارهای طولانی حیاتی است. بدون تغییرات ساختاری بزرگ، دنیایی با بافتار بسیار طولانی و بدون لایههای توجه بعید به نظر میرسد.

برای نسخههای Super و Ultra، انویدیا مکانیزم LatentMoE را معرفی کرده است. این سیستم توکنها را پیش از رسیدن به خبرهها، در یک فضای نهان (Latent Space) فشرده میکند. بر اساس گزارشهای فنی، این کار مزایای کلیدی زیر را دارد:
- افزایش ظرفیت: این مکانیزم به مدل اجازه میدهد با همان هزینه محاسباتی، به تقریباً ۴ برابر خبرهٔ بیشتر مسیردهی کند.
- بهبود عملکرد: این سیستم بهطور خاص برای استنتاجهایی که محدود به تأخیر (Latency) و توان عملیاتی (Throughput) هستند، بهینه شده است.
- دقت بالاتر: صرفهجویی در محاسبات، دوباره در قالب اجازه دادن به top-K بالاتر در هنگام مسیردهی، صرف افزایش دقت میشود.
در مورد الگوهای مسیردهی، الکسیوک تأیید میکند که تخصص خبرهها واقعی است، هرچند نسخهٔ «قابل خواندن برای انسان» از این تخصص، اغلب روایتی است که ما برای درک بهتر برای خودمان میسازیم.
موتور محرک لایهٔ عاملمحور
انویدیا اخیراً Nemotron 3.5 Lightning را معرفی کرد؛ یک مدل MoE با ۳۰ میلیارد پارامتر که ۳ میلیارد آن فعال است. این مدل بهطور خاص بهعنوان «عضلهٔ» عاملهای هوش مصنوعی طراحی شده است. این مدل وظایف با حجم بالا و پیچیدگی کم، مانند فراخوانی ابزارها (Tool Calls) و تفویض اختیار به زیر-عاملها را بر عهده میگیرد تا از هدر رفتن مدلهای پیشرو و گرانقیمت برای «کارهای یدی» (Grunt work) جلوگیری شود.
برای تضمین آمادگی در محیط تولید، Lightning ویژگیهای زیر را دارد:
- آموزش اختصاصی برای عاملها: این مدل بهطور خاص برای چارچوبهای عاملی (Agent Harnesses) که توسعهدهندگان در تولید واقعی استفاده میکنند، آموزش دیده تا دقت در وظایف لایهٔ اجرا تضمین شود.
- رمزگشایی گمانهزنانه (Speculative Decoding): ادغام پیشبینی چند-توکنی (MTP) برای افزایش سرعت.
- کوانتیزاسیون (Quantization): بهینهسازی شده برای فرمت NVFP4.
- استقرار منعطف: سازگاری از واحدهای محلی DGX Spark تا خوشههای عظیم مرکز داده.
قمار دادههای باز
در حالی که رقبایی مثل DeepSeek و Qwen با خط لولههای دادهٔ بسته، پیشرو در بحث وزنهای باز هستند، انویدیا دهها تریلیون توکن از دادههای پیشآموزش را منتشر کرده است. الکسیوک استدلال میکند که وزنهای باز بدون دادههای باز ناکافی هستند، زیرا دادهها تنها راهی هستند که میتوان بهطور واقعی بازرسی کرد چرا یک مدل بهگونهای خاص رفتار میکند.
فراتر از یک سیگنال اعتماد ساده، انویدیا یک بستهٔ جامع علوم باز ارائه میدهد که شامل موارد زیر است:
- مجموعهدادههای پیشآموزش (دهها تریلیون توکن).
- دستورالعملهای دقیق (Recipes) و گزارشهای فنی.
- کتابهای راهنما (Cookbooks) و روشهای پاکسازی و سازماندهی دادهها.
از آنجایی که تولید داده سخت و هزینهبر است، ارائه این داراییها راه اصلی انویدیا برای توانمندسازی پژوهشگران است تا بتوانند واقعاً روی بستر نموترون بسازند.
گسترش چندوجهی
ستون فقرات نموترون اکنون از متن فراتر رفته است. Nemotron 3 Nano Omni نخستین گام در قابلیتهای چندوجهی (Multimodal) است که رمزگذارهای بینایی و گفتار را در ستون فقرات فعلی Nemotron 3 ادغام میکند.
این امر به خانوادهٔ مدلها اجازه میدهد تا موارد زیر را مدیریت کنند:
- هوشمندسازی اسناد: با استفاده از مدلهای بینایی-زبانی.
- گفتار و بازیابی: ادغام قابلیتهای صوتی.
- هوش مصنوعی فیزیکی: همکاری در کنار خانوادههای مجاور مانند Cosmos. این همافزایی در راستای اهداف بلندمدت انویدیا برای پیشبینی اقدامات فیزیکی در محیطهای واقعی است که در مدلهای سری Cosmos دنبال میشود.
بخش بزرگی از تلاشهای فنی مربوط به تطبیق رمزگذارها با ستون فقرات مدل بود، فرآیندی که جزئیات آن در گزارشهای فنی پروژه آمده است.
تحلیل تحریریه
انویدیا در حال اجرای یک بازی کلاسیک به نام «کالایی کردن مکمل» (Commoditize-your-complement) است. آنها با رایگان کردن مدلها، دادهها و دستورالعملها، سد ورود به توسعه هوش مصنوعی را پایین میآورند. الکسیوک تصریح میکند که انویدیا سعی ندارد در خودِ «بازی مدلها» رقابت کند، بلکه میخواهد هزاران شرکت و پژوهشگر را قادر سازد تا روی هوش مصنوعی بسازند.
علاوه بر این، انویدیا متنباز بودن را مسیری حیاتی برای ایمنی و امنیت میبیند. آنها معتقدند با قرار دادن مدلها در معرض بررسی جامعه جهانی توسعهدهندگان، صنعت میتواند به سمت آیندهای ایمنتر حرکت کند. این امر آیندهای ترکیبی میسازد که در آن مدلهای بسته و باز در کنار هم همزیستی میکنند.
برای یک مدیر کسبوکار، این بدان معناست که «جنگ مدلها» در حال تبدیل شدن به «جنگ ارکستراسیون» (Orchestration War) است. ارزش دیگر در وزنهای یک مدل واحد نیست، بلکه در بهرهوری لایهٔ مسیردهی است که تصمیم میگیرد کدام مدل — Nano، Super یا Ultra — یک وظیفه خاص را انجام دهد.
مسیر تا سال ۲۰۲۷
با نگاه به آینده، الکسیوک پیشبینی میکند که «مسیردهی مدل» (Model Routing) فعلی صرفاً یک پله است. اگرچه مسیردهی برای خط لولهها و فرآیندهای داخلی حساسِ عاملها ضروری است، اما تعامل مستقیم کاربر با آن اغلب ناخوشایند است.
او پیشبینی میکند تا سال ۲۰۲۷، مسیردهی مدل به یک «لایه ارکستراسیون» کلیتر و ارگونومیکتر تبدیل شود. این لایه برای کاربر نامرئی خواهد بود اما جریانهای کاری پیچیدهٔ عاملی را در لایههای داخلی مدیریت میکند.
واکنش جامعه به مجموعهدادههای باز را زیر نظر داشته باشید؛ اگر پژوهشگران راهی برای بهبود چشمگیر استدلال مدلها با استفاده از تریلیونها توکن انویدیا پیدا کنند، این امر میتواند انتقال به سلطهٔ مدلهای وزنباز در سازمانهای تجاری را تسریع کند.
گام بعدی شما
- اگر در حال طراحی سیستمهای عاملمحور هستید، از مدل Lightning برای مدیریت وظایف سطح پایین (Tool Calling) استفاده کنید تا هزینه استنتاج را کاهش دهید.
- مجموعهدادههای باز انویدیا را برای تحلیل سوگیری یا بازآموزی مدلهای کوچکتر بررسی کنید.
- پیکربندی سختافزاری مدلهای Nano و Super را با منابع موجود در مرکز داده خود تطبیق دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو