پرش به محتوای اصلی
پرش به محتوای مقاله

انویدیا مدل‌های Nemotron 3 را بر اساس ظرفیت سخت‌افزاری GPU طراحی کرد

·۲۱ مرداد ۱۴۰۵۷ دقیقه مطالعه۴ بازدید
کریس الکسیوک از انویدیا درباره نموترون، پردازنده‌های گرافیکی و هوش مصنوعی عاملی صحبت می‌کند
کریس الکسیوک از انویدیا درباره نموترون، پردازنده‌های گرافیکی و هوش مصنوعی عاملی صحبت می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم طراحی مدل از «قوانین ریاضی مقیاس‌پذیری» به «مهندسی بر اساس ظرفیت سخت‌افزاری GPU»؛ یعنی مدل‌هایی که دقیقاً برای جای گرفتن در حافظهٔ سخت‌افزارهای خاص ساخته شده‌اند.

اگر امروز برای اجرای مدل‌های زبانی هزینه می‌کنید، احتمالاً متوجه شده‌اید که گلوگاه اصلی دیگر قدرت مدل نیست، بلکه هزینه هر توکن است. انویدیا با معرفی خانواده Nemotron 3، بازی را تغییر داد تا مدل‌ها دقیقاً در اندازهٔ حافظهٔ سخت‌افزاری شما جای بگیرند.

به نقل از کریس الکسیوک (Chris Alexiuk)، یکی از چهره‌های کلیدی این پروژه، انویدیا در ۱۲ اوت ۲۰۲۶ اعلام کرد که دیگر مدل‌های خود را بر اساس قوانین ریاضی انتزاعی مقیاس‌پذیری نمی‌سازد، بلکه آن‌ها را بر اساس «ردپای سخت‌افزاری» (Hardware Footprint) طراحی می‌کند. این استراتژی تضمین می‌کند که مدل‌ها در هر سطح از GPUها، بیشترین بهره‌وری ممکن را داشته باشند.

این رویکرد در حالی رخ می‌دهد که صنعت از چت‌بات‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندانی دیجیتال که می‌توانند به‌طور مستقل وظایفی را از ابتدا تا انتها انجام دهند — حرکت می‌کند. همان‌طور که پیش‌تر بررسی کردیم، هوش مصنوعی عامل‌محور در حال حاضر چرخه‌های فروش در کشف دارو را از چندین ماه به چند هفته کاهش داده است. اما اکنون گلوگاه از «توانایی» مدل به «هزینهٔ اجرا» تغییر یافته است. انویدیا با ارائه مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که پارامترهایشان علناً منتشر شده تا هر کسی بتواند آن‌ها را اجرا کند — قصد دارد این شکاف زیرساختی را پر کند.

تکامل خانواده نموترون

مسیر توسعهٔ Nemotron خطی نبوده است. این مسیر با Nemotron-4 340B شروع شد که عمدتاً به‌عنوان یک کارخانه تولید داده‌های مصنوعی (Synthetic Data Factory) عرضه شد. پس از آن، Llama Nemotron که از یک مدل پایه شخص ثالث استفاده می‌کرد و مدل‌های ترکیبی Nemotron-H از راه رسیدند.

اکنون این خانواده به Nemotron 3 ختم شده است که یک خانوادهٔ مدل باز در سطح پیشرو (Frontier-class) است. الکسیوک این تکامل را تلاشی آگاهانه برای ایجاد یک چرخهٔ بازخورد در علوم باز می‌داند. انویدیا با بازگرداندن آموخته‌های خود به اکوسیستم، می‌خواهد دقیقاً بفهمد چه ابزارهایی لازم است تا GPUها در مقیاس پیش‌آموزش و یادگیری تقویتی (RL) با حداکثر سرعت یا همان حالت «go BRRRRR» کار کنند.

اگرچه برخی از مسیرهای آزمایشی در چند سال گذشته به مرحلهٔ عرضه نهایی نرسیدند، اما انویدیا این موارد را گام‌هایی ضروری در فرآیند علمی می‌بیند تا درک کند اکوسیستم چگونه از هوش مصنوعی بهره می‌برد.

لایه‌های متناسب با سخت‌افزار

برخلاف اکثر مدل‌های پیشرو که بر اساس قوانین ریاضی مقیاس می‌شوند، Nemotron 3 در سه سطح عرضه می‌شود که هر کدام به‌طور خاص از روی سخت‌افزارهای انویدیا مهندسی معکوس شده‌اند:

  • Nano: حدود ۳۰ میلیارد پارامتر (۳ میلیارد فعال)، طراحی شده برای اینکه روی یک GPU واحد جای بگیرد.
  • Super: حدود ۱۰۰ میلیارد پارامتر (۱۲ میلیارد فعال)، بهینه شده برای یک گره (Node) محاسباتی.
  • Ultra: حدود ۵۰۰ میلیارد پارامتر (۵۰ میلیارد فعال)، متناسب با یک رک NVL72.

الکسیوک اشاره می‌کند که این رویکرد پیکربندی‌های استقرار بهینه را تضمین می‌کند و به توسعه‌دهندگان اجازه می‌دهد دقیقاً بدانند برای هر اندازهٔ مدل، چه بودجه‌ای برای سخت‌افزار نیاز است. کارت‌های مدل (Model Cards) به‌طور صریح این پیکربندی‌های بهینه را شرح می‌دهند تا کاربران را به سمت بهترین عملکرد برای سخت‌افزار خاص خود هدایت کنند.

معماری بهره‌وری

انویدیا برای رسیدن به این سطح از عملکرد، از معماری‌های صرفاً مبتنی بر توجه (Attention) فاصله گرفته است. Nemotron 3 لایه‌های Mamba-2 را با ترکیب خبره‌ها (MoE) به‌صورت پراکنده ترکیب می‌کند و تنها تعداد کمی از لایه‌های توجه را در کل پشته (Stack) نگه می‌دارد.

این رویکرد ترکیبی، توازن بین «بازیابی با بافتار طولانی» (Long-context recall) و «سرعت استنتاج» را هدف قرار داده است. الکسیوک معتقد است اگرچه «توجه تنها چیزی نیست که نیاز داریم»، اما همچنان برای بازیابی اطلاعات در بافتارهای طولانی حیاتی است. بدون تغییرات ساختاری بزرگ، دنیایی با بافتار بسیار طولانی و بدون لایه‌های توجه بعید به نظر می‌رسد.

کریس الکسیوک از انویدیا درباره نموترون، پردازنده‌های گرافیکی و هوش مصنوعی عامل‌محور گفتگو می‌کند

برای نسخه‌های Super و Ultra، انویدیا مکانیزم LatentMoE را معرفی کرده است. این سیستم توکن‌ها را پیش از رسیدن به خبره‌ها، در یک فضای نهان (Latent Space) فشرده می‌کند. بر اساس گزارش‌های فنی، این کار مزایای کلیدی زیر را دارد:

  • افزایش ظرفیت: این مکانیزم به مدل اجازه می‌دهد با همان هزینه محاسباتی، به تقریباً ۴ برابر خبرهٔ بیشتر مسیردهی کند.
  • بهبود عملکرد: این سیستم به‌طور خاص برای استنتاج‌هایی که محدود به تأخیر (Latency) و توان عملیاتی (Throughput) هستند، بهینه شده است.
  • دقت بالاتر: صرفه‌جویی در محاسبات، دوباره در قالب اجازه دادن به top-K بالاتر در هنگام مسیردهی، صرف افزایش دقت می‌شود.

در مورد الگوهای مسیردهی، الکسیوک تأیید می‌کند که تخصص خبره‌ها واقعی است، هرچند نسخهٔ «قابل خواندن برای انسان» از این تخصص، اغلب روایتی است که ما برای درک بهتر برای خودمان می‌سازیم.

موتور محرک لایهٔ عامل‌محور

انویدیا اخیراً Nemotron 3.5 Lightning را معرفی کرد؛ یک مدل MoE با ۳۰ میلیارد پارامتر که ۳ میلیارد آن فعال است. این مدل به‌طور خاص به‌عنوان «عضلهٔ» عامل‌های هوش مصنوعی طراحی شده است. این مدل وظایف با حجم بالا و پیچیدگی کم، مانند فراخوانی ابزارها (Tool Calls) و تفویض اختیار به زیر-عامل‌ها را بر عهده می‌گیرد تا از هدر رفتن مدل‌های پیشرو و گران‌قیمت برای «کارهای یدی» (Grunt work) جلوگیری شود.

برای تضمین آمادگی در محیط تولید، Lightning ویژگی‌های زیر را دارد:

  • آموزش اختصاصی برای عامل‌ها: این مدل به‌طور خاص برای چارچوب‌های عاملی (Agent Harnesses) که توسعه‌دهندگان در تولید واقعی استفاده می‌کنند، آموزش دیده تا دقت در وظایف لایهٔ اجرا تضمین شود.
  • رمزگشایی گمانه‌زنانه (Speculative Decoding): ادغام پیش‌بینی چند-توکنی (MTP) برای افزایش سرعت.
  • کوانتیزاسیون (Quantization): بهینه‌سازی شده برای فرمت NVFP4.
  • استقرار منعطف: سازگاری از واحدهای محلی DGX Spark تا خوشه‌های عظیم مرکز داده.

قمار داده‌های باز

در حالی که رقبایی مثل DeepSeek و Qwen با خط لوله‌های دادهٔ بسته، پیشرو در بحث وزن‌های باز هستند، انویدیا ده‌ها تریلیون توکن از داده‌های پیش‌آموزش را منتشر کرده است. الکسیوک استدلال می‌کند که وزن‌های باز بدون داده‌های باز ناکافی هستند، زیرا داده‌ها تنها راهی هستند که می‌توان به‌طور واقعی بازرسی کرد چرا یک مدل به‌گونه‌ای خاص رفتار می‌کند.

فراتر از یک سیگنال اعتماد ساده، انویدیا یک بستهٔ جامع علوم باز ارائه می‌دهد که شامل موارد زیر است:

  • مجموعه‌داده‌های پیش‌آموزش (ده‌ها تریلیون توکن).
  • دستورالعمل‌های دقیق (Recipes) و گزارش‌های فنی.
  • کتاب‌های راهنما (Cookbooks) و روش‌های پاک‌سازی و سازماندهی داده‌ها.

از آنجایی که تولید داده سخت و هزینه‌بر است، ارائه این دارایی‌ها راه اصلی انویدیا برای توانمندسازی پژوهشگران است تا بتوانند واقعاً روی بستر نموترون بسازند.

گسترش چندوجهی

ستون فقرات نموترون اکنون از متن فراتر رفته است. Nemotron 3 Nano Omni نخستین گام در قابلیت‌های چندوجهی (Multimodal) است که رمزگذارهای بینایی و گفتار را در ستون فقرات فعلی Nemotron 3 ادغام می‌کند.

این امر به خانوادهٔ مدل‌ها اجازه می‌دهد تا موارد زیر را مدیریت کنند:

  • هوشمندسازی اسناد: با استفاده از مدل‌های بینایی-زبانی.
  • گفتار و بازیابی: ادغام قابلیت‌های صوتی.
  • هوش مصنوعی فیزیکی: همکاری در کنار خانواده‌های مجاور مانند Cosmos. این هم‌افزایی در راستای اهداف بلندمدت انویدیا برای پیش‌بینی اقدامات فیزیکی در محیط‌های واقعی است که در مدل‌های سری Cosmos دنبال می‌شود.

بخش بزرگی از تلاش‌های فنی مربوط به تطبیق رمزگذارها با ستون فقرات مدل بود، فرآیندی که جزئیات آن در گزارش‌های فنی پروژه آمده است.

تحلیل تحریریه

انویدیا در حال اجرای یک بازی کلاسیک به نام «کالایی کردن مکمل» (Commoditize-your-complement) است. آن‌ها با رایگان کردن مدل‌ها، داده‌ها و دستورالعمل‌ها، سد ورود به توسعه هوش مصنوعی را پایین می‌آورند. الکسیوک تصریح می‌کند که انویدیا سعی ندارد در خودِ «بازی مدل‌ها» رقابت کند، بلکه می‌خواهد هزاران شرکت و پژوهشگر را قادر سازد تا روی هوش مصنوعی بسازند.

علاوه بر این، انویدیا متن‌باز بودن را مسیری حیاتی برای ایمنی و امنیت می‌بیند. آن‌ها معتقدند با قرار دادن مدل‌ها در معرض بررسی جامعه جهانی توسعه‌دهندگان، صنعت می‌تواند به سمت آینده‌ای ایمن‌تر حرکت کند. این امر آینده‌ای ترکیبی می‌سازد که در آن مدل‌های بسته و باز در کنار هم همزیستی می‌کنند.

برای یک مدیر کسب‌وکار، این بدان معناست که «جنگ مدل‌ها» در حال تبدیل شدن به «جنگ ارکستراسیون» (Orchestration War) است. ارزش دیگر در وزن‌های یک مدل واحد نیست، بلکه در بهره‌وری لایهٔ مسیردهی است که تصمیم می‌گیرد کدام مدل — Nano، Super یا Ultra — یک وظیفه خاص را انجام دهد.

مسیر تا سال ۲۰۲۷

با نگاه به آینده، الکسیوک پیش‌بینی می‌کند که «مسیردهی مدل» (Model Routing) فعلی صرفاً یک پله است. اگرچه مسیردهی برای خط لوله‌ها و فرآیندهای داخلی حساسِ عامل‌ها ضروری است، اما تعامل مستقیم کاربر با آن اغلب ناخوشایند است.

او پیش‌بینی می‌کند تا سال ۲۰۲۷، مسیردهی مدل به یک «لایه ارکستراسیون» کلی‌تر و ارگونومیک‌تر تبدیل شود. این لایه برای کاربر نامرئی خواهد بود اما جریان‌های کاری پیچیدهٔ عاملی را در لایه‌های داخلی مدیریت می‌کند.

واکنش جامعه به مجموعه‌داده‌های باز را زیر نظر داشته باشید؛ اگر پژوهشگران راهی برای بهبود چشمگیر استدلال مدل‌ها با استفاده از تریلیون‌ها توکن انویدیا پیدا کنند، این امر می‌تواند انتقال به سلطهٔ مدل‌های وزن‌باز در سازمان‌های تجاری را تسریع کند.

گام بعدی شما

  • اگر در حال طراحی سیستم‌های عامل‌محور هستید، از مدل Lightning برای مدیریت وظایف سطح پایین (Tool Calling) استفاده کنید تا هزینه استنتاج را کاهش دهید.
  • مجموعه‌داده‌های باز انویدیا را برای تحلیل سوگیری یا بازآموزی مدل‌های کوچک‌تر بررسی کنید.
  • پیکربندی سخت‌افزاری مدل‌های Nano و Super را با منابع موجود در مرکز داده خود تطبیق دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار سخت‌افزاری انویدیا، استقرار عامل‌های هوش مصنوعی را از یک تجربه گران‌قیمت به یک استاندارد صنعتی تبدیل می‌کند. در نتیجه، هزینه استنتاج در مقیاس سازمانی به‌شدت کاهش می‌یابد.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت دسترسی به سخت‌افزارهای NVL72، بهره‌برداری کامل از نسخه‌های Ultra برای مراکز داده ایرانی دشوار است، اما مدل‌های Nano و وزن‌های باز Nemotron فرصتی عالی برای پژوهشگران داخلی در بهینه‌سازی مدل‌های محلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انویدیا با رایگان کردن مدل‌ها و داده‌ها، در واقع در حال کالایی کردن لایهٔ مدل است تا تقاضا برای سخت‌افزار خود را تضمین کند. در این استراتژی، ارزش از «داشتن مدل» به «مهندسی ارکستراسیون» منتقل می‌شود؛ یعنی برنده کسی است که بداند هر تسک را به کدام لایه (Nano یا Ultra) بسپارد. این حرکت، مدل‌های بسته را به گوشه‌ای می‌راند که تنها برای کارهای فوق‌تخصصی باقی بمانند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.