پرش به محتوای اصلی
پرش به محتوای مقاله

درون سازوکار LiveAnimate برای تبدیل مدل‌های آفلاین به استریمینگ زنده

·۲۲ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۲ بازدید
تولید ویدیوی دیپ‌فیک تمام‌بدن با دوام پایدار
تولید ویدیوی دیپ‌فیک تمام‌بدن با دوام پایدار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک مدل انتشار ۱۴ میلیارد پارامتری از حالت آفلاین به استریمینگ بلادرنگ (۲۰ FPS) از طریق تقطیر سه-مرحله‌ای و سیستم حافظه چندلایه برای جلوگیری از رانش هویت.

۲۰ فریم بر ثانیه؛ این سرعتی است که LiveAnimate در ۱۳ اوت ۲۰۲۶ برای تغییر لحظه‌ای حرکات بدن در رقص‌ها و مصاحبه‌ها به دست آورده است. با این چارچوب، شبیه‌سازی تمام‌بدن انسان از یک فرآیند «تولید و انتظار» به یک واقعیت استریم‌شده تبدیل شد.

تکامل شبیه‌سازی انسان

به نقل از مستندات این پژوهش، وضعیت شبیه‌سازی انسان از زمان ظهور نخستین مدل‌های جعل عمیق (Deepfake) در سال ۲۰۲۲ به‌سرعت تغییر کرده است. کاربران اکنون به توانایی‌های سیستم‌های بازمتنی مانند Wan-Animate یا مدل‌های بسته مثل Grok عادت کرده‌اند. این ابزارها می‌توانند تصاویر تک یا چندگانه را به اجراهای ویدیویی سازگار و تحول‌آفرین تبدیل کنند.

در پوشش‌های پیشین ما درباره‌ی مدل‌های تولید ویدیو، دیدیم که چالش اصلی همواره حفظ ثبات هویت در طول زمان بوده است. چارچوب‌های قدیمی‌تر مانند DeepFaceLive که بر پایه خودرمزگذار (Autoencoder) بودند، جای خود را به سیستم‌های پیچیده‌تری مثل Deep-Live-Cam داده‌اند. این سیستم جدید با بهره‌گیری از ترکیبی از تکرارهای LivePortrait، مدل‌های قدیمی GAN و ماژول‌های InsightFace، یک جایگزین بلادرنگ و مؤثر برای پروژه رهاشده‌ی DFLive ایجاد کرده است.

با این حال، این ابزارها همچنان محدود هستند. Deep-Live-Cam اگرچه می‌تواند به‌طور نامحدود اجرا شود و زوایای سخت چهره را مدیریت کند، اما در واقع یک «ابزار تک‌منظوره» است. این سیستم حالت‌های چهره و همگام‌سازی لب‌های متقاعدکننده‌ای ارائه می‌دهد، اما فاقد قابلیت شبیه‌سازی تمام‌بدن است. در حالی که این ابزارها واقع‌گرایانه‌تر می‌شوند، تشخیص آن‌ها دشوارتر شده است؛ به همین دلیل بررسی سیگنال‌های فنی برای شناسایی جعل‌های عمیق با کیفیت بالا برای تحلیلگران امنیتی اهمیت دوچندانی یافته است.

جامعه‌ی هوش مصنوعی سال‌ها میان کیفیت، تطبیق‌پذیری و سرعت در یک بن‌بست (Mexican stand-off) گیر کرده بود. شما یا می‌توانستید یک جعل عمیق با رزولوشن بالا داشته باشید که رندر آن ساعت‌ها زمان می‌برد، یا یک جایگزینی چهره بلادرنگ که تنها به صورت محدود می‌شد. سیستم‌های تمام‌بدن، مانند مدل با وزن‌های باز Wan2.2-Animate، ثبات خیره‌کننده‌ای ارائه می‌دادند اما کاملاً آفلاین بودند. این سناریوی «تولید و انتظار»، آن‌ها را برای کاربردهای تعاملی زنده، مانند تغییر حرکات رقص در یک استریم زنده، بی‌فایده می‌کرد.

LiveAnimate که توسط پژوهشگران دانشگاه هنگ‌کنگ، گروه کسب‌وکار Qwen در علی‌بابا و Liblib AI توسعه یافته، این بن‌بست را شکست. این سیستم مدل ۱۴ میلیارد پارامتری Wan2.2-Animate را به یک موتور استریمینگ تبدیل می‌کند که بدون افت کیفیت معمول در ویدیوهای مولد، ثبات هویت را در بازه‌های زمانی طولانی حفظ می‌کند.

خط لوله آموزش دو مرحله‌ای

برای انتقال از حالت آفلاین به آنلاین، تیم توسعه یک فرآیند آموزش سخت‌گیرانه در دو مرحله اجرا کرد تا مدل بتواند به‌طور پیوسته و سریع تولید کند.

در مرحله اول، نویسندگان ویدیوهای آموزشی را به بلوک‌های متوالی تقسیم کردند. هر بلوک با استفاده از بلوک‌های قبلی به‌عنوان زمینه (Context) یا داده‌ی مرجع (Ground Truth) تولید شد. این کار به مدل آموخت که ابتدا از داده‌های قابل‌اعتماد قبلی استفاده کند، پیش از آنکه مجبور شود با خطاهای انباشته‌شده در خروجی‌های خودش مقابله کند.

تولید ویدیوی دیپ‌فیک تمام‌بدن با دوام پایدار

از آنجا که این مرحله اولیه به ۵۰ گام حذف نویز (Denoising) برای هر بلوک نیاز داشت، برای استفاده زنده بسیار کند بود. در مرحله دوم، از تقطیر (Distillation) برای فشرده‌سازی این فرآیند به تنها سه گام استفاده شد. در این فاز، مدل در معرض تاریخچه تولیدات خودش قرار گرفت. این موضوع حیاتی است زیرا در استقرار واقعی، هر بخش جدید باید به خروجی‌های ناقص قبلی وابسته باشد.

تولید ویدیوی دیپ‌فیک تمام‌بدن با دوام پایدار

آموزش روی توالی‌های خود-تولیدشده یک چالش محاسباتی است. نگه داشتن تاریخچه کامل یک ویدیو در حافظه بسیار گران و غیرممکن است. تیم پژوهشی برای حل این مشکل، یک اجرای کامل آزمایشی انجام داد و سپس بلوک‌به‌بلوک برای آموزش به آن بازگشت. این روش اجازه داد هر بلوک بدون نیاز به فعال نگه داشتن کل توالی در حافظه، به‌روزرسانی شود. این فرآیند در کنار انطباق لورا (LoRA)، اجازه داد مدل ۱۴ میلیارد پارامتری روی یک گره شامل هشت GPU مدل H100 با حافظه ۸۰ گیگابایتی تقطیر شود.

حل معضل حافظه و رانش هویت

یکی از بزرگ‌ترین موانع در ویدیوهای بلند هوش مصنوعی، «رانش هویت» (Identity Drift) است؛ جایی که ظاهر سوژه به‌مرور زمان تغییر می‌کند. LiveAnimate این مشکل را با یک سیستم حافظه چندلایه و یک روش تولید خاص حل می‌کند: به‌جای پردازش هم‌زمان فریم‌های گذشته و آینده، هر بخش جدید را هم‌زمان با پیشروی اکشن تولید می‌کند.

برای حفظ سازگاری، سیستم از مکانیزم‌های زیر استفاده می‌کند:

  • Ref Sink: یک تصویر مرجع دائمی که به‌عنوان یادآور ثابت از هویت و ظاهر سوژه عمل می‌کند.
  • Static Sink: نخستین بلوک تولیدشده که به‌عنوان لنگر دائمی حفظ می‌شود.
  • Dynamic Sink: یک جایگاه قابل جایگزین که پوزهای مرتبط قبلی را ذخیره می‌کند تا مدل بداند فرد در موقعیت‌های مشابه چگونه به نظر می‌رسید.
  • Rolling Window: کشی شامل بلوک فعلی و دو بلوک قبلی برای حفظ جریان زمانی فوری.
  • Clean KV Update: فرآیندی که اطلاعات یک بلوک تکمیل‌شده را به زمینه تاریخی برای بلوک‌های بعدی تبدیل می‌کند (هرچند خطاهای موجود را ترمیم نمی‌کند).

برای مدیریت این حافظه بدون افزایش هزینه‌های محاسباتی، سیستم از ViTPose استفاده می‌کند تا موقعیت‌های بدن و دست در سه فریم را به نمایش‌های فشرده تبدیل کند. بانک حافظه، پنج پوز نماینده را نگه می‌دارد که در ۲۰ بلوک اول پر می‌شوند. سیستم پوزهای متنوع را بر پوزهای تقریباً تکراری ترجیح می‌دهد.

در هنگام تولید، پوز ورودی با این نماینده‌ها مقایسه شده و نزدیک‌ترین مورد بازیابی می‌شود. بلوک بلافاصله قبلی از این جست‌وجو حذف می‌شود چون در Rolling Window موجود است و این کار فضای Dynamic Sink را برای بازیابی اطلاعات از نقاط دورتر استریم آزاد می‌کند.

بنچمارک‌های سخت‌افزاری و عملکرد

تولید بلادرنگ با کیفیت بالا به محاسبات عظیمی نیاز دارد. طبق گزارش مقاله پژوهشی، استنتاج (Inference) برای دو GPU مدل NVIDIA H100 بهینه شده که در مجموع ۱۶۰ گیگابایت VRAM فراهم می‌کنند. زمان اجرا با توزیع پردازش توجه (Attention) بین GPUها، هم‌پوشانی ارتباطات با محاسبات و بازاستفاده از اطلاعات کش‌شده بهینه شده است.

تولید ویدیوی دیپ‌فیک تمام‌بدن با کیفیت پایدار و مداوم

مقیاس عملکرد به این صورت است:

  • یک H100: ۱۲.۴۱ فریم بر ثانیه
  • دو H100: ۱۹.۶۳ فریم بر ثانیه
  • چهار H100: ۲۲.۱۳ فریم بر ثانیه

نویسندگان اشاره کردند که افزایش GPUهای بیش از دو عدد، به‌دلیل سربار ارتباطات (Communication Overhead)، بازدهی کمتری دارد. در سرعت ۱۹.۶۳ فریم بر ثانیه، یک بلوک ۱۲ فریم تنها در ۰.۶۱۱ ثانیه تولید می‌شود. در مقابل، سیستم‌های آفلاین رقیب برای تولید همین توالی سه دقیقه‌ای به ۲ تا ۵ ساعت زمان نیاز داشتند.

پایداری و آزمون‌های مقایسه‌ای

در مقایسه با چارچوب‌هایی مانند EverAnimate، One-to-All، SCAIL و UniAnimate-DiT، مدل LiveAnimate پایداری بلندمدت برتری نشان داد. آزمون‌های فرمت بلند تا سه دقیقه ادامه یافت تا بررسی شود آیا کیفیت و هویت ثابت می‌مانند یا خیر.

نمونه‌ای از تولید ویدیوی دیپ‌فیک تمام‌بدن با کیفیت بالا و پایداری زمانی

معیارهای ارزیابی شامل موارد زیر بود:

  • امتیاز زیبایی‌شناختی (ASE) و ارزیابی کیفیت تصویر (IQA): برای سنجش کیفیت بصری در سطح فریم.
  • DINO و DINO-S: برای سنجش سازگاری ظاهر با هویت مرجع.
  • فاصله Inception فرت (FID): برای سنجش کیفیت توزیع داده‌ها.
  • فاصله ویژگی VideoMAE (V-MAE): برای سنجش میزان حفظ حرکت در طول زمان.

مدل LiveAnimate در ۳۰ ثانیه اول به بالاترین ASE (۲.۸۲۳) و IQA (۴.۰۴۷) رسید و در طول سه دقیقه تولید پیوسته، افت کیفیت ناچیزی داشت. در مقابل، مدل One-to-All به‌شدت تخریب شد و مدل پایه Wan2.2-Animate سازگاری هویت را از دست داد.

در آزمون‌های تمام‌بدن، سیستم با موفقیت حرکات پیچیده در رقص‌های استیج، محیط‌های باز و پرتره‌های نزدیک را بازتولید کرد. در مصاحبه‌های نیم‌تنه نیز، حرکات ظریف سر و دست را در پس‌زمینه‌های استاتیک اداری بدون لرزش‌های رایج در UniAnimate-DiT یا SCAIL، و بدون تغییرات رنگی و رانش پس‌زمینه در Wan-Animate و EverAnimate حفظ کرد.

تولید ویدیوی دیپ‌فیک تمام‌بدن با دوام و پایدار

نمونه‌ای از تولید ویدیوی دیپ‌فیک تمام‌بدن با کیفیت بالا و پایداری زمانی

مشخصات فنی

  • داده‌های آموزشی: ۴۰,۰۰۰ ویدیوی صحبت‌کننده از AVSpeech و ۲۰,۰۰۰ ویدیوی حرکات انسانی از تیک‌تاک و HumanVid.
  • رزولوشن‌ها: پشتیبانی از ۴۸۰×۴۸۰، ۳۸۴×۶۷۲ و ۶۷۲×۳۸۴ پیکسل.
  • معماری: بر پایه Wan2.2-Animate-14B با استفاده از لورا (LoRA) با رتبه ۱۲۸.
  • تلاش آموزشی: ۱۰,۰۰۰ گام (مرحله ۱) و ۲۰,۰۰۰ گام (مرحله ۲) روی هشت GPU مدل H100.
  • بلوک تولید: ویدیو در بلوک‌های سه فریم نهان (Latent) تولید می‌شود که معادل ۱۲ فریم RGB است.

تحلیل مقایسه‌ای چارچوب‌ها

برای ارزیابی عادلانه، پژوهشگران شرایط خاصی را برای رقبا اعمال کردند. برای تست ویدیوهای بلند، مدل‌های SCAIL و UniAnimate-DiT با یک روش پنجره لغزان (Sliding-window) بدون آموزش گسترش یافتند، زیرا به‌طور بومی از تولید فرمت بلند پشتیبانی نمی‌کردند. مدل‌های EverAnimate و One-to-All با استفاده از روش‌های بومی خود برای تولید ویدیوهای بلند ارزیابی شدند.

نتایج تکان‌دهنده بود. در حالی که LiveAnimate کیفیت ادراکی و هویت را از ثانیه ۳۰ تا دقیقه نهایی تقریباً ثابت نگه داشت، سیستم‌های پیشین به‌شدت افت کردند. نویسندگان بیان می‌کنند: «این نتایج یک نقطه عملیاتی جدید در کیفیت، تأخیر و مدت‌زمان برای انیمیشن‌های تعاملی تمام‌بدن ایجاد می‌کند.»

تحلیل‌های کیفی نشان داد که در تست‌های تمام‌بدن، One-to-All دچار تخریب شدید شد و UniAnimate-DiT و SCAIL لرزش‌های محسوسی داشتند. Wan-Animate و EverAnimate نیز در مراحل بعدی دچار رانش رنگ یا پس‌زمینه شدند. در تست‌های نیم‌تنه، EverAnimate پایداری مشابهی داشت اما توانایی تولید بلادرنگ را نداشت.

نتیجه‌گیری

این تغییر در معماری، این فرض بنیادی را که شبیه‌سازی باکیفیت انسان باید یک فرآیند آفلاین باشد، تغییر می‌دهد. با تبدیل تولید ویدیو به یک مسئله استریمینگ با کش حافظه مدیریت‌شده، پژوهشگران مدل‌های انتشار در مقیاس میلیارد-پارامتری را به قلمرو برنامه‌های تعاملی مانند حضور از راه دور (Telepresence) و آواتارهای مجازی آوردند.

برای حوزه هوش مصنوعی، این موضوع نشان می‌دهد که مسیر رسیدن به AGI یا آواتارهای واقع‌گرایانه، تنها به اندازه مدل بستگی ندارد، بلکه به حافظه پایدار و مؤثر وابسته است. توانایی به خاطر سپردن ظاهر سوژه در یک جلسه طولانی — بدون نیاز به پردازش مجدد کل تاریخچه — پل حیاتی به آینده شبیه‌سازی است. اگرچه برخی چارچوب‌های رقیب ممکن است در شرایط خاص هویت را کمی بهتر حفظ کنند، اما هیچ‌کدام قابلیت آنلاین LiveAnimate را ندارند.

منتظر انتشار کد و وزن‌های پروژه باشید تا مشخص شود آیا این یک کنجکاوی آزمایشگاهی باقی می‌ماند یا به ابزاری برای جامعه گسترده‌تر علاقه‌مندان و متخصصان تبدیل می‌شود.

گام بعدی شما

  • دنبال کردن انتشار کد و وزن‌های پروژه برای تست روی سخت‌افزارهای مصرف‌کننده.
  • بررسی کاربرد مدل‌های تقطیر (Distillation) برای تبدیل مدل‌های سنگین آفلاین به ابزارهای بلادرنگ.
  • تحلیل اثر این تکنولوژی بر صنعت استریمینگ و تولید محتوای زنده.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معماری حافظه، مرز بین رندرینگ آفلاین و استریمینگ زنده را در جعل عمیق از بین برد. اکنون آواتارهای مجازی می‌توانند بدون تأخیر و با ثبات کامل در محیط‌های تعاملی حضور یابند.

تأثیر برای ایران

به‌دلیل نیاز به سخت‌افزار بسیار گران‌قیمت (H100)، اجرای این مدل در حال حاضر برای توسعه‌دهندگان ایرانی دشوار است و بیشتر جنبه پژوهشی دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز LiveAnimate بر مدیریت حافظه به‌جای افزایش اندازه مدل، یک چرخش راهبردی در تولید ویدیو است. این نشان می‌دهد که برای رسیدن به تعاملات بلادرنگ، بهینه‌سازی نحوه بازیابی اطلاعات (Retrieval) از تاریخچه ویدیو، بسیار مؤثرتر از افزایش پارامترهاست. در واقع، مدل‌های آینده احتمالاً کمتر به «دانش» بیشتر و بیشتر به «حافظه» کوتاه‌مدت و بلندمدت بهینه نیاز خواهند داشت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.