پرش به محتوای اصلی
پرش به محتوای مقاله

SANA-WM انویدیا: تولید ویدیوی ۶۰ ثانیه‌ای 720p با یک GPU

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
SANA-WM انویدیا: تولید ویدیوی ۶۰ ثانیه‌ای 720p با یک GPU
اشتراک‌گذاری

تصور کنید یک دقیقه ویدیوی باکیفیت 720p را تنها با یک پردازنده گرافیکی تولید کنید؛ SANA-WM انویدیا این تصور را به واقعیت تبدیل کرده است. طبق گزارش Marktechpost بر اساس مقاله arXiv در مه ۲۰۲۶، نسخه‌ی تقطیری (Distilled) این مدل می‌تواند یک دقیقه ویدیو را تنها در ۳۴ ثانیه روی یک کارت گرافیک RTX 5090 بازسازی کند.

مدل‌های جهانی (World Models) برای توسعه‌ی هوش مصنوعی تجسم‌یافته (Embodied AI) و رباتیک حیاتی هستند، اما مقیاس‌بندی آن‌ها برای توالی‌های طولانی معمولاً به دلیل پیچیدگی درجه‌دوم (Quadratic Complexity) در مکانیزم توجه softmax منجر به فروپاشی حافظه می‌شود. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بنیادی (Foundation Models) اشاره کردیم، بهینه‌سازی مصرف حافظه همواره گلوگاه اصلی در تولید محتوای بلند بوده است. SANA-WM با تغییر رویکرد، کارایی محاسباتی را نه به عنوان یک بهینه‌سازی پس‌پردازشی، بلکه به عنوان هدف اصلی معماری قرار داده است.

این مدل از یک ستون فقرات دیفیوژن ترنسفورمر (Diffusion Transformer - DiT) با ۲.۶ میلیارد پارامتر استفاده می‌کند. طبق مستندات فنی، انویدیا اکثر بلوک‌های توجه را با Gated DeltaNet (GDN) جایگزین کرده است. این ساختار یک وضعیت بازگشتی (Recurrent State) با اندازه ثابت را فارغ از طول ویدیو حفظ می‌کند و از «لغزش بصری» (Visual Drift) که در سیستم‌های توجه خطی رایج است، جلوگیری می‌کند.

مشخصات فنی کلیدی این مدل عبارتند از:

  • کنترل دو شاخه‌ای: ترکیب کدگذاری موقعیتی دوربین یکپارچه (UCPE) برای مسیر جهانی و ترکیب Plücker برای حرکات درون‌گامی.
  • خط لوله‌ی دو مرحله‌ای: یک تولیدکننده‌ی اولیه و سپس یک پالایشگر (Refiner) بر اساس مدل ۱۷ میلیارد پارامتری LTX-2 که از آداپتورهای LoRA با رتبه ۳۸۴ برای حذف مصنوعات ساختاری استفاده می‌کند.
  • آموزش: استفاده از ۶۴ پردازنده H100 در بازه‌ی زمانی ۱۸.۵ روز روی ۲۱۲,۹۷۵ کلیپ توصیف‌شده.

این معماری، معیار ارزیابی مدل‌های جهانی را از «تعداد خام پارامترها» به «کارایی بازگشتی» تغییر می‌دهد. با اثبات اینکه یک مدل ۲.۶ میلیارد پارامتری می‌تواند در دقت دوربین و سرعت از سیستم‌های ۱۴ میلیارد پارامتری مانند LingBot-World پیشی بگیرد، انویدیا نشان داد که توجه با پیچیدگی خطی تنها مسیر عملی برای شبیه‌سازی‌های بلندمدت بدون نیاز به کلاسترهای فوق‌سنگین است.

توسعه‌دهندگان اکنون می‌توانند از طریق مخزن گیت‌هاب NVlabs/Sana به وزن‌های باز (Open Weights) و کد این مدل دسترسی داشته باشند تا نسخه‌ی تقطیری را آزمایش کرده یا کنترل دوربین دو شاخه‌ای را در شبیه‌سازهای رباتیک خود پیاده کنند.

گام بعدی شما

  • بررسی مخزن گیت‌هاب SANA برای اجرای نسخه‌ی Distilled روی سخت‌افزارهای محلی.
  • تحلیل مقایسه‌ای دقت دوربین SANA-WM در برابر مدل‌های بزرگ‌تر در محیط‌های شبیه‌سازی شده.
  • پیاده‌سازی مکانیزم Gated DeltaNet در پروژه‌های تولید ویدیو برای کاهش هزینه استنتاج.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص انویدیا در معماری سخت‌افزار و نرم‌افزار، هزینه استنتاج (Inference) ویدیوهای بلند را به شدت کاهش می‌دهد. این تغییر به معنای دموکراتیزه شدن ابزارهای شبیه‌سازی رباتیک است، چرا که دیگر نیاز به کلاسترهای عظیم GPU برای تولید ویدیوهای دقیق نیست.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.