پرش به محتوای اصلی
پرش به محتوای مقاله

شتاب‌دهنده VC-Attention سرعت استنتاج ویدیو در RTX 5090 را ۳.۵۸ برابر کرد

·۲۶ شهریور ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
معرفی VC-Attention توسط Nunchux AI: هسته توجه کم‌بیت بدون آموزش برای تسریع ترنسفورمرهای پخش ویدیویی
معرفی VC-Attention توسط Nunchux AI: هسته توجه کم‌بیت بدون آموزش برای تسریع ترنسفورمرهای پخش ویدیویی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی هسته VC-Attention که برای نخستین بار گلوگاه سافت‌مکس FP32 را در ویدیو-ترنسفورمرها حذف کرد و سرعت استنتاج را در RTX 5090 تا ۳.۵۸ برابر افزایش داد بدون آنکه نیاز به آموزش مجدد مدل باشد.

بیش از ۶۴٪ از زمان تولید کلیپ‌های ویدیویی ۷۲۰p روی کارت گرافیک RTX 5090 صرف مکانیزم‌های توجه می‌شود؛ این یعنی بخش اعظم توان سخت‌افزاری شما در یک گلوگاه محاسباتی هدر می‌رود. برای حل این بحران، Nunchux AI هسته VC-Attention را معرفی کرد؛ یک هسته توجه کم‌بیت و بدون نیاز به آموزش (Training-free) که هر دو مرحله سافت‌مکس و کوانتش مقادیر (Value Quantization) را بهینه می‌کند تا استنتاج را بدون نیاز به بازآموزی مدل شتاب دهد.

این پیشرفت در حالی رخ می‌دهد که صنعت با انفجار توکن‌های مکانی-زمانی در ویدیوهای باکیفیت دست‌وپنجه نرم می‌کند. برای درک ابعاد موضوع، تصور کنید یک کلیپ ۵ ثانیه‌ای با مدل Wan2.2-14B حدود ۷۰,۰۰۰ توکن تولید می‌کند. در حالی که پیش‌تر بررسی کردیم که چگونه ترنسفورمرهای حلقوی بازگشتی (Recurrent Looped Transformers) عمق استدلال را از طریق مسیرهای زمانی افزایش می‌دهند، چالش فوری برای تولید ویدیو همچنان هزینه خام محاسباتی لایه توجه در مراحل حذف نویز (Denoising) است. این نیاز به پردازش حجم عظیم داده‌های ویدیویی، ابزارهای جدیدی را برای مدیریت محتوا ایجاد کرده است؛ برای مثال، استارتاپ Clipto با هدف تبدیل ترابایت‌ها از ویدیو به پایگاه‌های دانش قابل جستجو در حال تغییر نحوه تعامل ما با داده‌های بصری است.

کالبدشکافی گلوگاه‌های ویدیویی

در مدل‌های ترنسفورمر انتشار ویدیو (Video DiTs)، کلیپ‌ها به توالی‌ای از توکن‌های مکانی-زمانی تبدیل شده و در هر لایه، عملیات خودتوجهی (Self-attention) کامل اجرا می‌شود. طبق گزارش فنی Marktechpost، این فرآیند به‌شدت هزینه‌بر است؛ به‌طوری که در مدل MiniMax-H3 روی پردازنده B200، حدود دو-سوم از هر مرحله حذف نویز صرفاً مربوط به لایه توجه است.

اگرچه هسته‌های Tensor Core کم‌بیت می‌توانند دو ضرب ماتریسی اصلی (QK و PV) را تسریع کنند، اما دو مانع اساسی باقی می‌ماند. نخست، متدهای پیشین مانند SageAttention2 کوئری‌ها و کلیدها را هموار (Smooth) می‌کنند، اما حتی پس از هموارسازی QK و چرخش، ترم مقدار (Value) همچنان ۸۲٪ از خطای خروجی در مدل Wan2.2 را تشکیل می‌دهد. دوم، عملیات سافت‌مکس بین ضرب‌ها معمولاً در دقت FP32 اجرا می‌شود. در سخت‌افزارهای B200 و H200، عملیات نمایی و تبدیل (Cast) بعدی به FP8 طولانی‌ترین بخش خط لوله است.

VC-Attention برای رفع این دو مشکل، دو مکانیزم کلیدی را پیاده‌سازی کرده است:

V-Smooth: مدیریت مقادیر پرت

مقادیر پرت (Outliers) در توکن‌های محدودی متمرکز شده‌اند و کانال‌های آن‌ها در سرها (Heads)، لایه‌ها و مراحل مختلف جابه‌جا می‌شوند. از آنجا که چرخش هادامارد (Hadamard rotation) نرم توکن‌ها را حفظ می‌کند، نمی‌تواند این مقادیر پرت را حذف کند؛ در واقع چرخش V تنها خطای مقدار را ۰.۲٪ تغییر می‌دهد. V-Smooth به‌جای چرخش ساده، از یک فرآیند سه‌مرحله‌ای استفاده می‌کند:

  • گروه‌بندی (Grouping): با استفاده از الگوریتم کی-میانگین (k-means) آنلاین، توکن‌های مقدار را به ازای هر بچ و سر خوشه‌بندی می‌کند. کلیدها و مقادیر با هم جایگشت (Permute) می‌شوند تا خروجی توجه غیر-علی (Non-causal) بدون تغییر باقی بماند. این گروه‌بندی تنها در ۲۵٪ نخست مراحل حذف نویز اجرا شده و جایگشت در چهار مرحله متوالی مجدداً استفاده می‌شود که هزینه آن تنها ۳ تا ۴٪ از کل زمان توجه است.
  • حذف میانگین (Demean): در هر بلوک سخت‌افزاری ۱۲۸ توکنی، میانگین کسر می‌شود و تنها باقی‌مانده (Residual) کوانتیده می‌شود. این کار با استفاده از E4M3 ۸ بیتی یا NVFP4 ۴ بیتی به صورت per-channel انجام می‌گیرد. این روش ۸٪ از انرژی بلوک را در ترتیب توالی، ۱۲٪ تحت مکعب استاتیک DeltaQuant و ۳۶٪ پس از مرتب‌سازی حذف می‌کند. هر میانگین تنها ۰.۱۲۵ بیت برای هر المان مقدار هزینه دارد.
  • بازگردانی (Restore): میانگین را با استفاده از مجموع سطری که سافت‌مکس آنلاین در اختیار دارد، بازمی‌گرداند. این کار نیاز به گذر دوم یا بافر اضافی را کاملاً از بین می‌برد.

ExpCast-FP8: بهینه‌سازی سافت‌مکس

برای حذف گلوگاه FP32، مکانیزم ExpCast-FP8 مسیر نمایی و تبدیل را با یک عملیات تک‌مرحله‌ای ضرب-جمع (Fused Multiply-Add) جایگزین می‌کند. این امکان به دلیل این واقعیت فراهم شده که یک بایت E4M3 به لگاریتم مقداری که ذخیره می‌کند نزدیک است؛ اگر به عنوان یک عدد صحیح خوانده شود، تقریباً برابر با $8 \log_2(v) + 56$ است.

ExpCast-FP8 بایت را مستقیماً از امتیاز دامنه لگاریتمی می‌نویسد. این سیستم از یک ثابت $\beta = -0.35$ برای مرکز کردن خطای باقی‌مانده استفاده می‌کند تا نیازی به برازش یک ثابت برای هر مدل نباشد. این مسیر مستقیم در ۷۹.۶٪ از هر دوبرابر شدن، دقیقاً همان بایت مسیر FP32 را می‌نویسد و در سایر موارد تنها یک کد فاصله دارد. مقاله ثابت می‌کند که کران تغییرات کل (Total Variation Bound) در هر سطر زیر ۳.۶۴٪ است و میانگین اندازه‌گیری شده در ۲۰۴.۸ هزار سطر توجه مدل Wan2.2 تنها ۱.۶٪ است. لازم به ذکر است که ExpCast-FP8 فقط برای هسته ۸ بیتی اعمال می‌شود، زیرا NVFP4 فاقد یک نگاشت خطی تک‌گانه از لگاریتم به کد است.

برای بهینه‌سازی بیشتر، ادغام دستی کدهای CUDA/CuTe در زنجیره پیش‌پردازش باعث شد زمان فراخوانی V-Smooth روی B200 از ۴۲.۲ میلی‌ثانیه به ۴.۸ میلی‌ثانیه کاهش یابد.

بنچمارک‌های عملکرد

آزمایش روی چهار مدل با وزن‌های باز (Open Weights) شامل Wan2.2-T2V-A14B، LongCat-Video، HunyuanVideo-1.5 و MiniMax-H3 نتایج خیره‌کننده‌ای را نشان داد. کیفیت (Fidelity) در برابر خروجی‌های BF16 FlashAttention-4 روی ۱۰۰ پرامپت سنجیده شد:

  • B200 (۸ بیت): ۱.۵۹ برابر شتاب در توجه / ۱.۱۹ برابر شتاب کلی (End-to-End).
  • H200 (۸ بیت): ۱.۴۶ برابر شتاب در توجه / ۱.۱۳ برابر شتاب کلی.
  • RTX PRO 6000 (۴ بیت): ۲.۲۷ برابر شتاب در توجه / ۱.۳۶ برابر شتاب کلی.
  • RTX 5090 (۴ بیت): ۳.۵۸ برابر شتاب در توجه / ۱.۷۰ برابر شتاب کلی.

در پردازنده B200، سیستم VC-Attention حدود ۶.۰۲ برابر سریع‌تر از SageAttention2 عمل می‌کند. از نظر کیفیت، V-Smooth در مدل Wan2.2 حدود ۲.۳ دسی‌بل (dB) و در HunyuanVideo-1.5 حدود ۲.۸ دسی‌بل به معیار PSNR اضافه می‌کند. افزودن ExpCast-FP8 این مقدار را ۰.۷ تا ۲.۱ دسی‌بل کاهش می‌دهد اما همچنان در هر چهار مدل از SageAttention2 بهتر عمل می‌کند. در دقت ۴ بیتی، V-Smooth در مدل Wan2.2 حدود ۲.۹ دسی‌بل و در LongCat-Video حدود ۳.۶ دسی‌بل از SageAttention3 پیشی می‌گیرد.

این دستاورد فرضیه قدیمی را که «کوانتش کم‌بیت لزوماً منجر به افت شدید کیفیت در ویدیوها می‌شود» به چالش می‌کشد. Nunchux AI ثابت کرد که با هدف قرار دادن باقی‌مانده‌ها به‌جای مقادیر خام، می‌توان حتی از توجه برق‌آسا (FlashAttention-4) با دقت BF16 پیشی گرفت. برای مثال، در مدل MiniMax-H3 با رزولوشن ۱۳۴۴×۷۶۸، توجه روی B200 با سرعت ۱.۶۰ برابر بیشتر و PSNR معادل ۲۰.۲ دسی‌بل اجرا می‌شود (در مقابل ۱۹.۹ دسی‌بل برای SageAttention2). در مورد B300، مقاله شتاب ۱.۴۷ برابر را در مقابل ۱.۳۱ برابر برای یک هسته FP8 ساده گزارش می‌کند، در حالی که وبلاگ عدد ۱.۵۱ برابر را ذکر کرده است. افزونه اختصاصی Nunchux به شتاب ۱.۹۱ برابر روی B200 و ۱.۸۳ برابر روی B300 برای MiniMax-H3 دست می‌یابد.

به دلیل ساختار ماژولار و اینکه VC-Attention تنها هزینه‌های هر تعامل (Per-interaction) را تغییر می‌دهد، با متدهای توجه پراکنده (Sparse Attention) مانند Sparse VideoGen و Radial Attention سازگار است. این قابلیت اجازه می‌دهد تا بدون تغییر در معماری مدل، در استک‌های اجرای چند-GPU، جریان‌های کاری distillation و معماری‌های گسترده‌تر ادغام شود. این رویکرد بهینه‌سازی لایه‌های پایین، مشابه تلاشاتی است که در سایر حوزه‌های استنتاج سریع دیده می‌شود؛ برای نمونه، زیرساخت Preterview با بهینه‌سازی استریم توانست تأخیر عامل‌های صوتی را به شدت کاهش دهد تا تجربه کاربر در لحظه بهبود یابد.

در حالی که تحقیقات اصلی VC-Attention عمومی شده است، Nunchux AI در حال حاضر یک افزونه اختصاصی را در استک خود اجرا می‌کند. کاربران می‌توانند برای تجربه این بهینه‌سازی‌ها در مدل MiniMax-H3، از طریق لیست انتظار Modelverse این شرکت درخواست دسترسی دهند.

گام بعدی شما

  • اگر از مدل‌های Wan2.2 یا HunyuanVideo استفاده می‌کنید، بررسی کنید که آیا هسته‌های بهینه‌شده برای RTX 5090 در کتابخانه‌های استنتاج شما فعال است یا خیر.
  • برای تجربه این بهینه‌سازی‌ها در مدل MiniMax-H3، می‌توانید در لیست انتظار Modelverse شرکت Nunchux ثبت‌نام کنید.
  • در پروژه‌های تولید ویدیو، اولویت را بر استفاده از کوانتش ۴ بیتی با متد V-Smooth بگذارید تا تعادل بهینه بین سرعت و کیفیت (PSNR) برقرار شود.

اما بهینه‌سازی نرم‌افزاری تنها نیمی از داستان است؛ اثر سخت‌افزارهای نسل جدید بر استنتاج مدل‌های چندوجهی را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این فناوری هزینه و زمان استنتاج ویدیوهای باکیفیت را به‌شدت کاهش می‌دهد و امکان اجرای مدل‌های غول‌پیکر را روی سخت‌افزارهای مصرف‌کننده فراهم می‌کند. اعتبار این ادعا با بنچمارک‌های دقیق روی سخت‌افزارهای B200 و RTX 5090 تأیید شده است.

تأثیر برای ایران

این بهینه‌سازی برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند، امکان اجرای مدل‌های سنگین ویدیو را روی کارت‌های گرافیکی موجود فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Nunchux AI بر «باقی‌مانده» (Residual) به‌جای مقدار خام، یک چرخش هوشمندانه در استراتژی کوانتش است. این رویکرد ثابت می‌کند که برای رسیدن به سرعت‌های خیره‌کننده در ویدیو، نیازی به پذیرش خطاهای بصری نیست و می‌توان با مهندسی دقیق لایه‌های سخت‌افزاری، دقت BF16 را در قالب ۴ بیت شبیه‌سازی کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.