پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Puzzle انویدیا توان عملیاتی سرورهای MoE را تا ۲.۱۴ برابر افزایش داد

·۱۸ تیر ۱۴۰۵۸ دقیقه مطالعه
انویدیا مدل فشرده ترکیبی MoE با توان عملیاتی سرور دو برابری عرضه کرد
انویدیا مدل فشرده ترکیبی MoE با توان عملیاتی سرور دو برابری عرضه کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نوآوری اصلی در «فشرده‌سازی غیریکنواخت» است؛ به‌جای حذف لایه‌ها، ظرفیت داخلی بلوک‌های Mamba و MoE کاهش یافته تا ساختار مدل حفظ شود و توان عملیاتی تا ۲ برابر افزایش یابد.

فشار مهندسی برای استقرار مدل‌های ترکیبی عظیم در مقیاس صنعتی، دیگر تنها یک چالش فنی نیست، بلکه یک سد اقتصادی است. اگر امروز هزینه‌های سرویس‌دهی مدل‌های زبانی بزرگ را برای سازمان خود محاسبه کنید، متوجه خواهید شد که تعادل بین دقت بالا و هزینه‌های سرور، سخت‌ترین نقطهٔ تصمیم‌گیری است. در این معماری‌ها، تداخل پیچیده میان پارامترهای فعال، نیازهای حافظهٔ KV cache (ذخیره کلید-مقدار) و اندازهٔ حالت‌های Mamba، یک سقف سخت و محدودکننده برای تعداد کاربرانی که یک گره محاسباتی واحد می‌تواند در یک نرخ تولید توکن مشخص پشتیبانی کند، ایجاد می‌کند.

طبق اعلام تیم هوش مصنوعی انویدیا (NVIDIA)، آن‌ها برای شکستن این سد و عبور از این گلوگاه‌ها، مدل Nemotron-Labs-3-Puzzle-75B-A9B را توسعه داده‌اند؛ نسخه‌ای به‌شدت فشرده از مدل Nemotron-3-Super که هدف اصلی آن بیشینه‌سازی توان عملیاتی (Throughput) سرور و همزمانی کاربران است، بدون آنکه یکپارچگی ساختاری معماری ترکیبی اصلی را تخریب کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش حجم مدل بدون از دست دادن حافظهٔ بلندمدت، «جام مقدس» استقرار مدل است. این چالش‌ها منجر به ظهور راهکارهای متنوعی شده است، به‌طوری که برخی ابزارهای متن‌باز برای بهینه‌سازی استنتاج مدل‌های محلی اکنون امکان مدیریت بهتری بر منابع سخت‌افزاری را فراهم می‌کنند. مدل مادر، یعنی Nemotron-3-Super، یک مدل ترکیبی پیشرفته از Mamba-Transformer و ترکیب خبره‌ها (Mixture-of-Experts یا MoE) است که دارای ۱۲۰.۷ میلیارد پارامتر کل و ۱۲.۸ میلیارد پارامتر فعال می‌باشد. هدف پروژهٔ Puzzle، کاهش این ارقام برای رسیدن به یک اثر footprint قابل‌مدیریت‌تر بود، در حالی که دو هدف استقرار مشخص را دنبال می‌کرد: نخست، دستیابی به افزایش ۲ برابری در توان عملیاتی سرور در نرخ ۱۰۰ توکن در ثانیه برای هر کاربر؛ و دوم، فراهم کردن امکان پردازش ۸ درخواست همزمانِ ۱ میلیون توکنی روی تنها یک پردازنده NVIDIA H100.

در نتیجهٔ این تلاش، مدل Puzzle-75B-A9B تعداد کل پارامترها را به ۷۵.۳ میلیارد و پارامترهای فعال را به ۹.۳ میلیارد کاهش داد. انویدیا برای تسهیل استقرار در سناریوهای مختلف و محیط‌های عملیاتی گوناگون، سه نقطهٔ بازرسی (Checkpoint) مجزا را روی Hugging Face با دقت‌های BF16، FP8 و NVFP4 منتشر کرده است تا توسعه‌دهندگان بتوانند بر اساس سخت‌افزار خود تصمیم بگیرند.

بر اساس مستندات فنی انویدیا، یکی از حیاتی‌ترین و کلیدی‌ترین جنبه‌های رویکرد Puzzle، حفظ دقیق چیدمان بلوک‌های مدل مادر است. مدل Nemotron-3-Super در مجموع ۸۸ بلوک دارد: ۴۰ بلوک Mamba، ۴۰ بلوک MoE و ۸ بلوک توجه (Attention). مدل Puzzle-75B-A9B دقیقاً همین توالی و ترتیب را حفظ کرده است تا اطمینان حاصل شود که منطق بنیادین و جریان داده در معماری ترکیبی دست‌نخورده باقی می‌ماند. پژوهشگران در این مدل، به‌جای حذف کامل لایه‌ها که می‌توانست منجر به تخریب شدید دانش مدل شود، بر کاهش ظرفیت داخلی در همان بلوک‌ها تمرکز کردند.

جزئیات فنی این کاهش ظرفیت و مکانیسم‌های آن به شرح زیر است:

  • اندازه حالت SSM در Mamba از ۱۲۸ به ۹۶ کاهش یافت (که یک کاهش ۷۵ درصدی در پارامترهای مربوطه محسوب می‌شود).
  • اندازه میانی خبره‌های مسیری‌شده (Routed Expert Intermediate Size) در MoE از مقدار ۲۶۸۸ به بازه‌ای بین ۱۲۸۰ تا ۲۶۸۸ کاهش یافت که به‌طور میانگین تقریباً ۵۹.۹٪ اندازه اصلی است.
  • تعداد خبره‌های مسیری‌شده فعال برای هر توکن از ۲ عدد به بازه‌ای بین ۴ تا ۱۸ تغییر یافت، که در نهایت منجر به این شد که ظرفیت فعال میانگین خبره‌های مسیری‌شده تنها ۳۰.۹٪ حالت اولیه باشد.
  • نکته قابل توجه این است که تعداد کل خبره‌های مسیری‌شده، اندازه خبره‌های مشترک (Shared Expert Size) و اندازه نهفته MoE (MoE Latent Size) بدون تغییر باقی ماندند. همچنین لایه‌های توجه (Attention) کاملاً دست‌نخورده باقی ماندند، زیرا مدل Nemotron-3-Super از پیش در مدیریت KV-cache بسیار بهینه و کارآمد بود.

انویدیا مدل فشرده ترکیبی MoE را عرضه کرد؛ توان عملیاتی سرور ۲.۰۳ برابری با همان توان کاربر

نتایج حاصل از این فشرده‌سازی استراتژیک خیرکننده و قابل توجه است. در آزمایش‌های انجام‌شده روی خوشه‌ای از ۸ پردازنده B200 با استفاده از دقت NVFP4، توان عملیاتی کل سرور بین ۱.۶۰ تا ۲.۱۴ برابر افزایش یافت، در حالی که توان عملیاتی در سطح هر کاربر کاملاً مطابقت داشت و ثابت ماند. اما جهش واقعی و چشم‌گیر در مدیریت درخواست‌های با زمینه (Context) طولانی رخ داد: در یک GPU مدل H100، ظرفیت پذیرش درخواست‌های ۱ میلیون توکنی از ۱ کاربر به ۸ کاربر جهش یافت. این پیشرفت خیره‌کننده عمدتاً به دلیل کاهش حجم وزن‌ها از ۷۰ گیگابایت به ۴۴.۵ گیگابایت بود، که این تغییر منجر به آزاد شدن فضای حیاتی حافظه (VRAM) برای KV-cache و حالت‌های Mamba شد. این رویکرد بهینه‌سازی حافظه در مدل‌های MoE مکمل نوآوری‌های سخت‌افزاری است، چرا که طراحی‌های ترکیبی CPU-GPU می‌توانند نیاز به کوانتیزه کردن شدید مدل‌های MoE را کاهش دهند.

برای دستیابی به این نتایج، انویدیا از یک استراتژی فشرده‌سازی تکرارشونده به کار گرفت. روش «Puzzle تکرارشونده» (Iterative Puzzle) به‌طور میانگین ۰.۵۷ امتیاز بهتر از روش «Puzzle تک‌مرحله‌ای» (Single-step Puzzle) در همان هدف فشرده‌سازی عمل کرد. این امر نشان می‌دهد که کاهش تدریجی ظرفیت به مدل این امکان را می‌دهد که به‌طور موثرتری با از دست دادن پارامترها سازگار شود و دانش خود را بازسازی کند.

البته این بهینه‌سازی‌ها با یک سبک توازن (Trade-off) در هوش خام و توانایی‌های کدنویسی همراه است. ارزیابی‌ها در محک Arena-Hard-V2 کاهش ۴.۲ امتیازی و در SWE-Bench افت ۲.۶ امتیازی را نشان می‌دهد که حاکی از کاهش جزئی در توانایی‌های پیچیده استدلالی و مهندسی نرم‌افزار است. در مقابل، اثر این تغییر بر سایر معیارهای کلیدی ناچیز بود؛ برای مثال، بنچمارک‌های RULER و AA-LCR تقریباً پایدار باقی ماندند. این موضوع ثابت می‌کند که توانایی مدل در بازیابی اطلاعات از زمینه‌های طولانی (Long-context Retrieval) و حفظ انسجام زبانی پایه، علی‌رغم کاهش شدید پارامترهای فعال، تا حد زیادی حفظ شده است.

در مجموع، مدل Nemotron-Labs-3-Puzzle-75B-A9B به اثبات رساند که فشرده‌سازی استراتژیک، غیریکنواخت و هدفمند در مدل‌های ترکیبی MoE می‌تواند منجر به دستاوردهای عظیم در بهره‌وری استقرار شود. با تمرکز بر ظرفیت داخلی بلوک‌های Mamba و MoE به‌جای حذف لایه‌های کامل، انویدیا مدلی ساخته است که سرویس‌دهی آن به‌طور قابل توجهی ارزان‌تر است و قادر است کاربران همزمان بسیار بیشتری را پشتیبانی کند. این مدل اکنون یک گزینه بسیار کاربردی برای محیط‌های تولیدی با ترافیک بالا است، جایی که یک افت اندک در استدلال‌های بسیار پیچیده (مانند آنچه در SWE-Bench دیده شد)، در برابر افزایش ۲ برابری توان عملیاتی و افزایش ۸ برابری در همزمانی زمینه‌های طولانی، یک معامله کاملاً پذیرفتنی و منطقی است.

گام بعدی شما

  • اگر از مدل‌های MoE برای کاربردهای صنعتی استفاده می‌کنید، استراتژی کاهش ظرفیت داخلی بلوک‌ها را به‌جای هرس کردن (Pruning) ساده لایه‌ها بررسی کنید تا ساختار منطقی مدل حفظ شود.
  • برای کاهش هزینه‌های استنتاج و بهینه‌سازی سرعت پاسخ‌دهی، نسخه‌های FP8 و NVFP4 منتشرشده در Hugging Face را در محیط‌های تست خود با دقت‌های بالاتر مقایسه کنید.
  • در صورت نیاز به پردازش متون بسیار طولانی (۱ میلیون توکن و بیشتر)، اثر کاهش حجم وزن‌ها بر فضای خالی VRAM را در مدل‌های خود تحلیل کنید تا نقاط گلوگاه حافظه را شناسایی نمایید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص انویدیا در معماری سخت‌افزار، هزینه استنتاج مدل‌های عظیم را به‌شد我们将 کاهش می‌دهد. این تغییر باعث می‌شود سازمان‌ها بتوانند تعداد کاربران همزمان را بدون سرمایه‌گذاری کلان در سخت‌افزار جدید، به‌طور چشم‌گیری افزایش دهند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به پردازنده‌های H100 و B200، این مدل بیشتر برای پژوهشگران مدل‌های بنیادی در ایران که بر روی بهینه‌سازی استنتاج (Inference Optimization) کار می‌کنند، اهمیت دارد.

·نگاه ما
تحریریه دات‌هوش

انویدیا با این مدل، فرضیه «بزرگ‌تر همیشه بهتر است» را در سطح استقرار عملیاتی به چالش می‌کشد. تمرکز بر کاهش ظرفیت داخلی بلوک‌ها به‌جای حذف لایه‌ها نشان می‌دهد که ساختار توپولوژیکی مدل برای حفظ منطق استدلال حیاتی‌تر از تعداد مطلق پارامترهاست. این رویکرد، مسیر را برای مدل‌هایی باز می‌کند که در زمان آموزش عظیم هستند اما در زمان استنتاج، به‌صورت پویا و بهینه تغییر اندازه می‌دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.