پرش به محتوای اصلی
پرش به محتوای مقاله

AMD MI355X در برابر Blackwell: پیروزی در شاخص قیمت به عملکرد

·۱۱ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
عملکرد به ازای هر دلار در حال افزایش و ارزان‌تر شدن است | ویفر
عملکرد به ازای هر دلار در حال افزایش و ارزان‌تر شدن است | ویفر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات عملی اینکه ظرفیت VRAM در مدل‌های بالای ۲ تریلیون پارامتر، برتری نرم‌افزاری CUDA را خنثی می‌کند و MI355X را به گزینه‌ای به‌صرفه‌تر از Blackwell تبدیل می‌کند.

۴۸ توکن در ثانیه به ازای هر دلار؛ این عدد، بازدهی خیره‌کننده MI355X محصول AMD در سرویس‌دهی به مدل عظیم Kimi K3 است که در مقایسه با ۷ توکن در ثانیه برای B200 و ۳۳ توکن برای B300، یک پیروزی مطلق به‌شمار می‌رود. طبق گزارش فنی منتشرشده توسط Wafer در ۲ اوت ۲۰۲۶، این سخت‌افزار اکنون به بهینه‌ترین گزینه برای اجرای مدل‌های فوق‌مقیاس تبدیل شده و سری Blackwell انویدیا را در معیار «عملکرد به شرط قیمت» به‌کل کنار زده است.

این تحول در حالی رخ می‌دهد که هوش مصنوعی متن‌باز در حال رسیدن به مقیاس‌های جدید است. مدل‌هایی مانند DeepSeek V4-Pro و GLM5.2 اکنون به سطح هوش مدل Opus رسیده‌اند و ثابت کردند که مدل‌های باز، جایگزینی به‌صرفه برای مدل‌های بسته هستند. با این حال، Kimi K3 آغاز عصری جدید است و ادعای رسیدن به سطح هوش مدل‌های Fable و Sol را دارد؛ مدلی که پیش‌تر در تحلیل‌های ما توانسته است در طراحی Front-end، مدل‌های بسته‌ی OpenAI و Anthropic را به چالش بکشد.

اما مدل‌های 똑똑‌تر، لزوماً مدل‌های بزرگ‌تری هستند. در حالی که GLM5.2 دارای ۷۵۳ میلیارد پارامتر و DeepSeek V4-Pro دارای ۱.۶ تریلیون پارامتر است، Kimi K3 با ۲.۸ تریلیون پارامتر (Parameters) عرضه شده است. این حجم عظیم، یک مانع حافظه‌ای بزرگ ایجاد می‌کند: مدل پیش از تخصیص KV Cache (حافظه موقت کلید-مقدار) برای یک میلیون توکن زمینه، به بیش از ۱.۵ ترابایت VRAM (حافظه ویدیویی) نیاز دارد.

همان‌طور که در بحث‌های گذشته ما درباره‌ی بهینه‌سازی حافظه در مدل‌های عظیم اشاره کردیم، مدیریت VRAM تعیین‌کننده نهایی سرعت استنتاج است. برای اکثر کاربران، این یعنی یک انتخاب دشوار: یا استفاده از گره‌های بسیار گران‌قیمت B300 یا تخصیص دو گره B200 (پیکربندی TP16) برای اجرای مدل؛ چراکه حتی یک گره واحد B200 با ۸ پردازشگر گرافیکی نمی‌تواند Kimi K3 را در خود جای دهد. در مقابل، MI355X با ۲۸۸ گیگابایت VRAM در هر پردازشگر، اجازه می‌دهد یک گره ۸ پردازشی (TP8) تمام بار مدل را تحمل کند. این موضوع باعث حذف جریمه «all-reduce بین-گره‌ای» در مسیر بحرانی رمزگشایی می‌شود؛ همان گلوگاهی که استقرار B200 را با استفاده از پروتکل RoCE v2 در سرعت ۱۹۵ گیگابیت بر ثانیه کند می‌کند.

عملکرد در محک‌های سنجش

بر اساس مستندات Wafer، در آزمونی با ورودی ۱،۰۲۴ توکن و خروجی ۴۰۰ توکن، MI355X نتایج زیر را ثبت کرد:

  • توان عملیاتی (Throughput) کل: ۹۵۲ توکن در ثانیه به‌ازای هر گره.
  • رمزگشایی تک-جریانی: ۱۱۸ توکن در ثانیه.
  • بهره‌وری هزینه: MI355X به‌طور میانگ l حدود ۲.۴ برابر ارزان‌تر از B300 و ۱.۷ برابر ارزان‌تر از B200 است.
  • عملکرد دلاری-ساعت: هزینه ۲.۵۰ دلار برای MI355X، در مقابل ۶.۰۰ دلار برای B300 و ۴.۲۵ دلار برای B200 محاسبه شده است.

آیا حافظه خندق دفاعی است؟ | ویفر

اگرچه گره‌های B300 همچنان در توان عملیاتی خام (۱،۵۶۸ توکن در ثانیه) پیشرو هستند، اما قیمت بسیار بالاتر آن‌ها جذابیت این برتری را می‌گیرد. عملکرد B200 نیز به دلیل نیاز به دو گره برای جای دادن مدل، افت شدید پیدا کرده و توان عملیاتی کل آن به ۴۹۸ توکن در ثانیه (حدود ۲۴۹ توکن برای هر گره) کاهش یافته است.

عبور از شکاف نرم‌افزاری ROCm

مشخصات سخت‌افزاری تنها نیمی از نبرد است. تاریخی طولانی از ضعف‌های نرم‌افزاری، کرنل‌های کند و نبود پشتیبانی روز-صفر در فریم‌ورک‌های استنتاج (Inference) همواره گریبان‌کش AMD بوده است. تیم Wafer دو گلوگاه بحرانی در پشته ROCm شناسایی کردند که برای دستیابی به این سرعت‌ها، نیاز به مداخله دستی داشتند.

اصلاحات رمزگشایی گمانه‌زنانه

مدل Kimi K3 بدون تانسورهای پیش‌نویس (draft tensors) عرضه شده است. تنها مسیر موجود برای رمزگشایی گمانه‌زنانه (Speculative Decoding)، استفاده از یک بلوک-دیفیوژن خارجی از طریق Kimi-K3-DSpark شرکت RadixArk است. این سیستم روی CUDA بلافاصله اجرا می‌شود، اما اولین درخواست در ROCm با یک خطای NameError در زمان‌بند (scheduler) مواجه شد.

مشکل در بخش تأییدکننده نمونه‌گیری sglang بود. نسخه CUDA مقدار top_k_renorm_prob را از sgl_kernel وارد می‌کند، اما نسخه ROCm تنها یک کرنل Triton top-p را جایگزین کرده است. به دلیل نبود کرنل top-k renorm برای معماری gfx950، هر درخواستی که به مسیر متراکم (dense path) می‌رسید، باعث کرش کردن زمان‌بند می‌شد.

برای حل این مشکل، تیم یک تابع PyTorch برای مدیریت top-k renorm پیاده کرد: دریافت بردار احتمال، نگه داشتن k ورودی برتر، صفر کردن بقیه و مقیاس‌بندی مجدد برای رسیدن به مجموع ۱. این توالی ساده از مرتب‌سازی و تقسیم، در شاخه نمونه‌گیری ROCm در sglang قرار گرفت.

آیا حافظه، خندق دفاعی است؟ | ویفر

این اصلاح منجر به افزایش ۲.۲ برابری عملکرد برای درخواست‌های تک-جریانی، افزایش ۱.۷ برابری در بارهای متوسط و رشد ۱۸ درصدی در حداکثر توان عملیاتی کل شد. همچنین ظرفیت پذیرش همزمان (concurrency) را از c24 به c64 ارتقا داد.

حل تأخیر پیش-پُرکردن

به‌رغم پیروزی در رمزگشایی، MI355X در ابتدا با زمان تا نخستین توکن (TTFT) مشکل داشت. یک پیش-پُرکردن (Prefill) سرد با ۱۷۲ هزار توکن، در MI355X حدود ۵۱ ثانیه زمان برد، در حالی که در B300 فقط ۲۳ ثانیه طول کشید. در مدل‌های با پنجره متنی یک میلیون توکنی، پیش-پُرکنی‌های طولانی می‌توانند کل ناوگان گره‌ها را برای چندین دقیقه بی‌استفاده کنند.

عدم تطابق کرنل AITER MLA

این تأخیر ناشی از عدم تطابق ابعاد (shape mismatch) بود. مدل K3 در ROCm به دلیل عدم بارگذاری کرنل سریع AITER MLA، به حالت کندِ Triton attention بازگشت می‌کرد. مدل Kimi K3 در حالت TP8 تعداد ۱۲ سر توجه (attention heads) به‌ازای هر رتبه فراهم می‌کند، اما مسیر MLA در AITER به‌طور خاص برای ۴، ۸ یا مضرب‌های ۱۶ ساخته شده است.

راهکار، یک مانور سادهٔ پدینگ (padding) بود: افزایش تعداد سرها از ۱۲ به ۱۶ با مقادیر صفر، اجرای کرنل سریع و سپس استخراج ۱۲ سر واقعی از خروجی.

نتایج پیش-پُرکردن

این بهینه‌سازی متریک‌ها را متحول کرد: در همان پیش-پُرکردن سرد ۱۷۲ هزار توکنی، سرعت اجرای AITER MLA به ۱۳ هزار توکن در ثانیه رسید، در حالی که نسخه fallback تریتون تنها ۴ تا ۷ هزار توکن می‌زد. این افزایش سرعت ۲ تا ۳ برابری، مستقیماً اهرم TTFT را بهبود بخشید بدون اینکه بر اعداد رمزگشایی اثر منفی بگذارد.

تحلیل خندق حافظه

این داده‌ها نشان می‌دهند که «خندق CUDA» نه از طریق کرنل‌های بهتر، بلکه از طریق ظرفیت خام حافظه در حال باریک شدن است. برای مدل‌هایی با بیش از ۲ تریلیون پارامتر، VRAM به اهرم اصلی عملکرد تبدیل می‌شود. وقتی یک مدل در یک گره AMD جای می‌گیرد اما برای انویدیا به دو گره نیاز است، سربار شبکه، برتری محاسباتی انویدیا را می‌بلعد.

برای جامعه فنی، این موضوع این فرض را می‌شکند که انویدیا تنها گزینه پذیرفتنی برای استنتاج در مقیاس مرزی است. با بهبود توانایی عامل‌ها در خودکارسازی بهینه‌سازی کرنل‌ها، تلاش مهندسی لازم برای اجرا روی ROCm در حال سقوط است. این روند یادآور تلاش‌هایی است که در ابزارهای متن‌باز برای کاهش وابستگی به سخت‌افزار خاص صورت می‌گیرد، همان‌طور که در بررسی ابزار ZML دیدیم که چگونه تلاش می‌کند وابستگی شرکت‌ها به تراشه‌های انویدیا را با بهینه‌سازی استنتاج در سخت‌افزارهای متنوع بشکند. Wafer اشاره کرد که این استقرار نسبت به کارهای قبلی‌شان روی GLM5.2، باگ‌های فریم‌ورکی کمتری داشت و نیازی به کرنل‌های سفارشی نبود.

آیا حافظه، خندق دفاعی است؟ | ویفر

توسعه‌دهندگان باید اکنون رصد کنند که آیا نسخه‌های وزن‌های باز بعدی نیز به سمت ۳ تریلیون پارامتر و بیشتر حرکت می‌کنند یا خیر؛ زیرا این روند، جایگاه کاربردی MI355X را در مراکز داده تثبیت خواهد کرد. نتیجه روشن است: دستیابی به SOTA روی سخت‌افزار AMD در دسترس است.

گام بعدی شما

  • اگر در حال استقرار مدل‌های بالای ۲ تریلیون پارامتر هستید، تحلیل هزینه-به-عملکرد MI355X را در مقابل B200 بازنگری کنید.
  • برای کاهش TTFT در محیط‌های ROCm، تکنیک پدینگ سر-توجه (head padding) را در کرنل‌های MLA بررسی کنید.
  • رصد کنید که آیا مدل‌های آتی با وزن‌های باز، سقف پارامترهای خود را افزایش می‌دهند تا مزیت VRAM شرکت AMD بیشتر شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر تجربه عملی استقرار مدل‌های مرزی، ثابت می‌کند که انویدیا دیگر در زمینه بهره‌وری دلاری (Price-to-Performance) بی‌رقیب نیست. این تغییر می‌تواند استراتژی خرید سخت‌افزار مراکز داده را از تک‌محصولی به سمت ترکیب AMD و NVIDIA سوق دهد.

تأثیر برای ایران

به دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، این تحول بیشتر برای پژوهشگران مدل‌های بنیادی در ایران که با محدودیت حافظه GPU مواجه‌اند، اهمیت دارد تا بازار مصرف.

·نگاه ما
تحریریه دات‌هوش

برتری AMD در اینجا نه از قدرت پردازش خالص، بلکه از «سادگی توپولوژی» ناشی می‌شود. وقتی حافظه اجازه می‌دهد مدل در یک گره جای بگیرد، پیچیدگی‌های ارتباطی بین-گره‌ای که نقطه ضعف همیشگی خوشه‌های انویدیا در مقیاس‌های عظیم است، حذف می‌شود. این نشان می‌دهد که در عصر مدل‌های تریلیونی، VRAM از Compute به عنوان گلوگاه اصلی تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.