پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه TLX Block Attention با حذف سربارهای الگوریتمی، سرعت B200 را ۲.۵ برابر کرد؟

·۵ خرداد ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
اشتراک‌گذاری

اگر هنوز برای بهینه‌سازی مدل‌های خود روی تراشه‌های Blackwell به کرنل‌های عمومی تکیه می‌کنید، احتمالاً نیمی از قدرت سخت‌افزار خود را از دست می‌دهید.

به گزارش پژوهشگران پایتورچ (PyTorch) در ۲۶ مه ۲۰۲۶، عصر کرنل‌های همه‌منظوره در حال پایان است و جای خود را به طراحی‌های «آگاه از الگو» (Pattern-aware) می‌دهد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی تکامل زبان تریتون (Triton) اشاره کردیم، شناسایی ساختار داده‌ها در زمان کامپایل، کلید دستیابی به حداکثر سرعت در سخت‌افزارهای نسل جدید است.

این تیم با معرفی TLX Block Attention، توانست سرعت گذر بازگشتی (Backward Pass) در توجه بلوکی-قطری (Block-diagonal Attention) را در پردازنده‌های NVIDIA B200 تا ۲.۵ برابر افزایش دهد. این دستاورد از طریق حذف ذخیره‌سازی تنسور logsumexp در حافظه HBM و استفاده از یک خط لوله تولیدکننده-مصرف‌کننده (Producer-Consumer Pipeline) حاصل شده است که در آن ۱۵ وارپ (Warp) برای گذر رفت و ۲۰ وارپ برای گذر بازگشت به‌طور دائمی به واحدهای سخت‌افزاری اختصاص یافته‌اند.

کرنل تخصصی وارپ بلک‌ول برای خودتوجه پراکنده بلوک‌ثابت در پای‌تورچ

بر اساس مستندات فنی، دستاوردهای کلیدی این بهینه‌سازی عبارت‌اند از:

  • حذف کرنل پیش‌پردازش Di از طریق محاسبه درون‌خطی (Inline).
  • استفاده از دستور use_acc=False برای بازاستفاده از حافظه TMEM.
  • ادغام گذر بازگشتی چرخشی (Rotary Backward Pass) در بخش پایانی، که منجر به افزایش ۳.۵ برابری سرعت و کاهش ۵۳ درصدی خطای گرادیان (dQ) شد.

تحلیل ما نشان می‌دهد که این پیشرفت، مرز بین زبان‌های سطح بالای بهینه‌سازی و کدنویسی خام CUDA را می‌شکند. وقتی بتوان ساختار توجه را در زمان کامپایل شناسایی کرد، دیگر نیازی به «بهینه‌سازی ریز» (Micro-optimization) نیست، بلکه می‌توان مراحل کامل الگوریتمی را حذف کرد. این موضوع ثابت می‌کند که Triton اکنون می‌تواند در بهینه‌سازی‌های خاص برای Blackwell با CUDA رقابت کند و بهره‌وری عملیات شناور مدل (Model FLOPs Utilization - MFU) را در لایه‌های عملیاتی ۳۰.۶٪ افزایش دهد.

کرنل تخصصی وارپ بلک‌ول برای خودتوجه پراکنده با بلوک ثابت – پایتورچ

گام بعدی شما

  • بررسی کتابخانه ads_model_kernel_library در گیت‌هاب برای پیاده‌سازی این بهینه‌سازی‌ها.
  • ارزیابی ورک‌لودهای Block-sparse برای شناسایی پتانسیل‌های افزایش سرعت.
  • دنبال کردن به‌روزرسانی‌های TLX برای پشتیبانی از الگوهای جدید توجه.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با افزایش ۳۰.۶ درصدی MFU، هزینه‌های آموزش مدل‌های توصیه‌گر در مقیاس بزرگ را به‌طور چشم‌گیری کاهش می‌دهد. تخصص تیم پایتورچ در بهره‌گیری از قابلیت‌های B200، استانداردی جدید برای بهینه‌سازی‌های سطح پایین تعریف می‌کند که اعتبار Triton را به عنوان جایگزین CUDA تقویت می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.