پرش به محتوای اصلی
پرش به محتوای مقاله

MachGen تأخیر تولید ویدیو را بدون کاهش کیفیت ۶ برابر کم کرد

·۷ مهر ۱۴۰۵۱۲ دقیقه مطالعه۲ بازدید
کیسمت سینگ، هم‌بنیان‌گذار و مدیرعامل مچ‌جن هوش مصنوعی
کیسمت سینگ، هم‌بنیان‌گذار و مدیرعامل مچ‌جن هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

بهینه‌سازی ۶ برابری سرعت تولید ویدیو بدون استفاده از Distillation؛ یعنی رسیدن به سرعت بالا بدون قربانی کردن کیفیت مدل اصلی از طریق بازطراحی کامل پشته‌ی استنتاج برای مدل‌های انتشار.

تصور کنید به جای دقایق انتظار برای رندر یک ویدیوی باکیفیت، آن را در عرض چند ثانیه تحویل بگیرید. این رویایی است که MachGen AI با بازطراحی لایه‌های زیرساختی استنتاج، آن را به واقعیت تبدیل کرده است. در حالی که تولید یک ویدیوی باکیفیت توسط هوش مصنوعی معمولاً دقایق زمان می‌برد، MachGen AI این انتظار را به ثانیه کاهش داده است. این شرکت با پیاده‌سازی یک پشته زیرساختی جدید، توانست بهبود ۶ برابری در تأخیر (Latency) چندین مدل ویدیویی ایجاد کند، بدون اینکه به روش «تقطیر مدل» (Model Distillation) متکی شود؛ این یعنی کیفیت خروجی دقیقاً مشابه نسخه‌های اصلی باقی می‌ماند.

بسیاری از زیرساخت‌های فعلی برای مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — بهینه شده‌اند. اما مدل انتشار (Diffusion Model) که موتور محرک تولید تصویر و ویدیو است، رفتار متفاوتی دارد. از آنجایی که مدل‌های انتشار متفاوت عمل می‌کنند، در پشته‌های موجود اغلب به عنوان یک اولویت ثانویه یا «فکر afterthought»对待 می‌شوند. طبق گزارش این شرکت، این عدم تطابق باعث شده تولید ویدیو کند، گران و برای کاربردهای تجاری در دنیای واقعی مقیاس‌ناپذیر باشد.

کیسمات سینگ (Kismat Singh)، مدیرعامل MachGen و مدیر سابق مهندسی در اینتل (Intel)، یک مدیر اجرایی در حوزه زیرساخت و مهندسی هوش مصنوعی است که بیش از دو دهه تجربه در ساخت سیستم‌های محاسباتی با عملکرد بالا (HPC) و یادگیری ماشین دارد. او پیش از این به عنوان معاون مهندسی چارچوب‌های هوش مصنوعی در اینتل فعالیت می‌کرد و به طور مستقیم در ابتکارات PyTorch این شرکت نقش داشت و برای دسترس‌پذیر کردن چارچوب‌های AI در پلتفرم‌های سخت‌افزاری مختلف تلاش می‌کرد. سوابق شغلی او همچنین شامل نقش‌های مهندسی ارشد در انویدیا (NVIDIA)، ای‌ام‌دی (AMD) و اچ‌پی (HP) است، جایی که مشارکت‌های ویژه‌ای در کتابخانه‌های یادگیری عمیق، کامپایلرها و تاب‌آوری آموزش در مقیاس هایپر-اسکیل داشت. او همچنین پیشینه‌ای در کدگذاری ویدیویی بلادرنگ (Real-time) دارد و در انویدیا روی TensorRT کار کرده است.

مانوج کریشنان (Manoj Krishnan)، هم‌بنیان‌گذار شرکت و متخصص سابق زیرساخت‌های آموزش مدل‌های بزرگ در پایتورچ (PyTorch) در متا (Meta)، در کنار سینگ تصمیم گرفتند درس‌های بهینه‌سازی LLMها را برای دنیای ویدیو پیاده کنند. جالب است بدانید که این دو نفر نزدیک به ۱۰ سال در یک باشگاه بدمینتون بازی می‌کردند و در این مدت زمان زیادی را صرف تلاش برای جذب یکدیگر به تیم‌هایشان کردند تا اینکه در نهایت تصمیم گرفتند با هم شریک شوند. آن‌ها اکنون همان درس‌های بهینه‌سازی را که LLMهای اولیه را به ابزارهای سطح تولید (Production-grade) تبدیل کرد و تریلیون‌ها توکن را به جهان عرضه نمود، در دنیای مدل‌های انتشار به کار می‌گیرند.

به نقل از مصاحبه‌ی سینگ با unite.ai، مدل‌های زبانی و مدل‌های انتشار الگوهای محاسباتی اساساً متفاوتی دارند. LLMها «خودبازگشتی» (Autoregressive) هستند؛ یعنی با یک مرحله پیش‌پر (Prefill) سنگین از نظر محاسباتی شروع شده و سپس وارد مرحله رمزگشایی (Decode) توکن‌به-توکن می‌شوند که محدود به حافظه (Memory-bound) است. این ساختار به صنعت اجازه داد تا بهینه‌سازی‌های خاصی مانند KV Caching و جداسازی پیش‌پر/رمزگشایی را توسعه دهد.

در مقابل، مدل‌های انتشار «غیر خودبازگشتی» هستند و در تمام طول فرآیند حذف نویز (Denoising)، به شدت به توان محاسباتی وابسته‌اند (Compute-bound). تولید ویدیو پیچیدگی بیشتری می‌افزاید زیرا حجم عظیمی از داده‌های مکانی (Spatial) و زمانی (Temporal) را در بر می‌گیرد که تقاضاهای منحصربه‌فردی را در زمینه‌های توجه (Attention)، حافظه، ارتباطات و موازی‌سازی ایجاد می‌کند.

سینگ اشاره می‌کند که به دلیل این تفاوت‌ها، زیرساخت‌های متداول AI اغلب بزرگترین گلوگاه‌های عملکردی را نادیده می‌گیرند:

  • KV Caching: کشینگ استاندارد KV در مدل‌های انتشار همان مشکلاتی را حل نمی‌کند که در LLMها حل می‌کرد.
  • موازات‌سازی (Parallelism): موازات‌سازی استاندارد می‌تواند سربار ارتباطی (Communication Overhead) قابل توجهی ایجاد کند که مزایای افزودن GPUهای بیشتر را خنثی می‌کند.
  • کرنل‌های نرم‌افزاری: کرنل‌های متن‌باز موجود برای مدل‌های انتشار به مراتب کمتر از کرنل‌های توسعه‌یافته برای متن بالغ هستند. این چالش‌ها یادآور بحث‌های فنی پیرامون بهینه‌سازی کرنل‌های GPU برای کاهش تأخیر است که در آن موتورهای استنتاجی جدید سعی در جایگزینی کامپایلرهای سنتی دارند.

MachGen برای حل این مشکل، مدل انتشار را به عنوان یک «شهروند درجه‌یک» پذیرفت و زمان‌بند (Scheduler)، مدل حافظه، استراتژی‌های کشینگ و کرنل‌های GPU را دقیقاً بر اساس پروفایل محاسباتی تولید تصویر و ویدیو بازطراحی کرد. این شرکت اکنون APIهایی برای تبدیل متن به تصویر، تصویر به تصویر، متن به ویدیو، تصویر به ویدیو و تولید ویدیو بر اساس مرجع (Reference-to-video) ارائه می‌دهد.

بررسی عمیق: پشته بهینه‌سازی

برای دستیابی به این دستاوردها، MachGen چندین لایه خاص از پشته استنتاج را بهینه می‌کند. استدلال آن‌ها این است که زمان‌بند، مدل حافظه و موازات‌سازی باید حول محور خودِ مدل انتشار طراحی شوند، نه اینکه از چارچوب‌های LLM اقتباس شوند.

  • محاسبات توجه (Attention Computation): از آنجایی که «توجه» بخش بزرگی از بودجه محاسباتی بسیاری از مدل‌های ویدیویی را می‌بلعد، MachGen بر روی دستورالعمل‌های با دقت پایین‌تر (Lower-precision) و «توجه پراکنده» (Sparse Attention) تمرکز کرده است.
  • استراتژی‌های کشینگ: برخلاف KV Caching در LLMها، MachGen روش‌هایی را توسعه داده است که از افزونگی‌های مکانی و زمانی موجود در داده‌های تصویر و ویدیو بهره‌برداری می‌کند.
  • کرنل‌های GPU: شرکت کرنل‌های بسیار بهینه‌ای برای معماری‌های انتشار می‌سازد تا تأخیر را به حداقل برساند.
  • موازات‌سازی و ارتباطات: آن‌ها کرنل‌های سفارشی توسعه داده‌اند که ارتباطات را با محاسبات مستقل از داده (Data-independent) هم‌پوشانی (Overlap) کرده و آن‌ها را با کارهای وابسته به داده خط‌لوله‌سازی (Pipeline) می‌کند تا سربار ارتباطی، دستاوردهای GPU را از بین نبرد.
  • مدیریت حافظه: پشته به گونه‌ای تنظیم شده است که جابه‌جایی عظیم داده‌های مورد نیاز برای ویدیوهای با رزولوشن بالا را بدون ایجاد گلوگاه مدیریت کند.

نتایج این تغییرات در مدل‌های استاندارد صنعت خیره‌کننده و قابل اندازه‌گیری است. برای اطمینان از عدم افت کیفیت، از نسخه‌های اصلی و غیرتقطیری استفاده شده است:

  • HiDream: کاهش زمان تولید از ۶ ثانیه به ۱ ثانیه.
  • Flux: کاهش از ۶.۲ ثانیه به ۱.۵ ثانیه.
  • Wan 2.2: کاهش زمان تولید ویدیو از ۹۸ ثانیه به ۱۶.۵ ثانیه.
  • LTX 2.3: کاهش زمان تولید ویدیو از ۶۷ ثانیه به ۱۰.۷ ثانیه.

علاوه بر سرعت، هزینه استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — در مدل‌های تصویری ۲ تا ۴ برابر و در ویدیوها ۲ تا ۳ برابر کمتر شده است. این دستاوردها از طریق بهره‌برداری از افزونگی‌های مکانی و زمانی با روش‌های جدید کشینگ و بهینه‌سازی کل مسیر تولید حاصل شده است. سینگ تأکید می‌کند که برای پذیرش در سطح تولید صنعتی، سرعت، هزینه و کیفیت باید هم‌زمان و در کنار هم عمل کنند.

کاربرد در دنیای واقعی: Trusted TV

این تحولات فنی در حال تغییر مدل‌های کسب‌وکار هستند. پلتفرم Trusted TV که به کسب‌وکارهای کوچک کمک می‌کند تیزرهای تبلیغاتی آماده برای پخش در پلتفرم‌های تلویزیون متصل (Connected TV) مانند Prime Video، Roku و DirecTV بسازند، اخیراً کل گردش کار خود را در کمتر از ۴۸ ساعت به MachGen منتقل کرد.

پیش از این، ساخت یک تیزر تلویزیونی نیازمند تیم‌های گران‌قیمت فیلم‌برداری و تدوین بود و هزینه‌های آن از چند هزار دلار شروع شده و اغلب به ده‌ها هزار دلار می‌رسید. اکنون، یک صاحب کسب‌وکار کوچک می‌تواند با یک گوشی هوشمند در حدود ۵ دقیقه یک تیزر کامل بسازد و پیش از پرداخت هزینه، آن را پیش‌نمایش کند. تا به امروز، بیش از ۱۰,۰۰۰ کمپین در این پلتفرم ایجاد شده است.

مدیرعامل Trusted TV، ایان (Ian)، در ابتدا بنچمارک‌های تأخیر MachGen را در Artificial Analysis باور نمی‌کرد. پس از تست شخصی، اولین رندر او در حدود ۲۵ ثانیه و بدون افت کیفیت بازگشت. در آخرین استقرار، این زمان به ۱۰ یا ۱۱ ثانیه کاهش یافته و این بهبودها حتی در تست‌های هم‌زمانی (Concurrency) در مقیاس بالا نیز پابرجا بود.

به دلیل اینکه تولید اکنون سریع و ارزان است، استراتژی تبلیغ‌کنندگان تغییر کرده است. به جای ساخت یک یا دو تیزر کلی، کاربران اکنون هر هفته دو یا سه آگهی جدید را جایگزین می‌کنند، تغییرات خلاقانه را روی بخش‌های مختلف مخاطبان تست می‌کنند و در لحظه نتایج را اصلاح می‌نمایند.

سینگ آینده را در «شخصی‌سازی فوق‌سریع» (Hyper-personalization) می‌بیند. برای مثال، یک تبلیغ کفش که در منهتن فیلم‌برداری شده ممکن است برای کاربری در منطقه Bay Area هیچ معنایی نداشته باشد. با MachGen، همان تبلیغ می‌تواند فوراً تغییر کند تا در پس‌زمینه، کوه Mission Peak را نشان دهد. این فقط یک تبلیغ ارزان‌تر نیست؛ بلکه نوع متفاوتی از تبلیغات است که تنها زمانی از نظر اقتصادی توجیه‌پذیر می‌شود که تولید هزاران نسخه مختلف، سریع و مقرون‌به‌صرفه باشد.

مسیر رسیدن به ویدیوهای تعاملی و مدل‌های جهان

MachGen در حال حاضر برای برخی موارد به سرعت‌های تعاملی رسیده است. آن‌ها می‌توانند یک ویدیوی ۵ ثانیه‌ای با رزولوشن 720p از مدل Vidu Q3 Turbo را در حدود ۶ ثانیه، یا نسخه 540p آن را در کمتر از ۳ ثانیه تولید کنند. این دستاورد، آواتارهای AI پاسخگو، گیمینگ و خلق محتوای تعاملی را در دسترس قرار می‌دهد.

سینگ «تعاملی» را محتوایی تعریف می‌کند که شما آن را هدایت می‌کنید، نه محتوایی که صرفاً دریافت می‌کنید. برای مثال، بیننده‌ای که در حال تماشای یک داستان است، اگر از جهت پیشروی پایان‌بندی خوشش نیامد، می‌تواند در لحظه پیرنگ داستان را تغییر دهد و به شخصیت‌ها دستور دهد تا به جای تماشای غیرفعال صحنه، با یک راز روبرو شوند.

این زیرساخت همچنین پیش‌نیاز اصلی برای عامل‌های هوشمند (AI Agents) است. یک عامل خودکار، یک درخواست واحد کاربر را به ده‌ها یا صدها شغل تولید تبدیل می‌کند؛ گزینه‌ها را می‌سازد، آن‌ها را ارزیابی می‌کند و در یک حلقه بدون دخالت انسان، پرامپت‌ها را اصلاح می‌کند. در این مسیر، بحث بر سر این است که آیا لایه ارکستراسیون در مقیاس سازمانی می‌تواند جایگزین تکیه مطلق بر مدل‌های بنیادی شود یا خیر. این امر تقاضاهای بنیادین متفاوتی ایجاد می‌کند:

  • تأخیر: اگر هر تولید دقایق زمان ببرد، گردش کار عامل برای کاربردی بودن بیش از حد کند است.
  • هزینه: هزینه‌های بالا، تکرار خودکار را از نظر اقتصادی غیرعملی می‌کند.
  • قابلیت اطمینان: یک شکست در زنجیره کاری می‌تواند کل حلقه عامل را متوقف کند.
  • نوسانات شدید (Burstiness): تقاضای عامل‌ها بسیار نوسانی‌تر از برنامه‌های خلاقانه انسانی است و نیازمند تخصیص پیشرفته GPU، مقیاس‌پذیری خودکار (Autoscaling) و مسیریابی هوشمند است.

در اینجا، واحد کار برای عامل‌ها دیگر یک تصویر یا ویدیوی واحد نیست، بلکه کل حلقه «تولید، ارزیابی و اصلاح» محتوا است.

در نگاهی به آینده، سینگ «مدل‌های جهان» (World Models) را ستاره قطبی (هدف نهایی) شرکت می‌بیند. این مدل‌ها کل محیط‌های بصری را شبیه‌سازی می‌کنند و به دلیل اینکه باید به طور مداوم یک محیط را به‌روزرسانی کنند (به جای تولید یک خروجی واحد)، به توان عملیاتی بسیار بالا و تأخیر بسیار پایین نیاز دارند. آن‌ها همچنین باید سازگاری مکانی و زمانی را حفظ کرده و در لحظه به اقدامات پاسخ دهند.

اگر شبیه‌سازی به اندازه تولید متنِ امروز پاسخگو و ارزان شود، پیامدهای آن گسترده خواهد بود: ربات‌ها می‌توانند موقعیت‌های نادر را پیش از مواجهه واقعی تمرین کنند، بازی‌ها می‌توانند محیط‌هایی تولید کنند که به هر بازیکن به طور خاص پاسخ می‌دهد و طراحان می‌توانند ده‌ها احتمال فیزیکی را به صورت مجازی تست کنند. سینگ اشاره می‌کند که مدل‌های جهانِ امروز از نظر محاسباتی شبیه به مدل‌های انتشار هستند و همین موضوع، پشته فعلی MachGen را به بنیادی طبیعی برای این آینده تبدیل می‌کند.

پیامدهای استراتژیک برای زیرساخت‌های AI

در حالی که سخت‌افزارهای انویدیا یا AMD سقف عملکرد را بالا می‌برند، سینگ استدلال می‌کند که این نرم‌افزار است که تعیین می‌کند چه مقدار از آن سقف واقعاً لمس شود. او به عصر LLMها اشاره می‌کند، جایی که بهبودهای سخت‌افزاری خام با روش‌هایی مانند Batching مداوم، مدیریت KV-cache، رمزگشایی گمانه‌زن (Speculative Decoding) و کرنل‌های تخصصی تکمیل شدند تا به توان عملیاتی سطح تولید برسند.

برای شرکت‌هایی که تولید تصویر یا ویدیو را در محصولات خود ادغام می‌کنند، نقطه عطف بهینه‌سازی زمانی رخ می‌دهد که استنتاج شروع به تأثیر گذاشتن بر تجربه مشتری یا حاشیه سود شرکت کند. در حالی که APIهای عمومی برای اعتبارسنجی یک محصول مفید هستند، مقیاس‌پذیری مستلزم نگاهی فراتر از «قیمت به ازای هر خروجی» و در نظر گرفتن تأخیر، هم‌زمانی و بهره‌وری GPU است.

سینگ هشدار می‌دهد معماری‌ای که در آن ظرفیت GPU باید هم‌گام با میزان استفاده رشد کند، فشار فزاینده‌ای بر حاشیه سود وارد می‌کند. بهینه‌سازی زمانی استراتژیک می‌شود که تقاضای اوج (Peak Demand) باعث ایجاد صف شود یا زمانی که انتظار کاربر منجر به رها کردن گردش کار شود. او خاطرنشان می‌کند که محاسبات مورد نیاز برای یک کلیپ کوتاه 540p با یک ویدیوی بلند 1080p بسیار متفاوت است، به این معنی که هیچ آستانه واحدی برای حجم درخواست‌ها جهت این تغییر وجود ندارد.

MachGen از «مدل بازارگاه» (Marketplace Model) — که در آن مدل‌ها تجمیع شده و درخواست‌ها مسیریابی می‌شوند — دوری می‌کند. سینگ معتقد است این مدل در بلندمدت دفاع‌پذیر نیست زیرا کنترل روی لایه عملکرد را ندارد. در عوض، MachGen پشته را به صورت بومی می‌سازد و میزبانی می‌کند. این به آن‌ها اجازه می‌دهد تا توجه، کشینگ، کرنل‌ها، دقت، حافظه و موازات‌سازی را برای هر مدل و هر شتاب‌دهنده به طور مجزا تنظیم کنند و از APIهای مدیریت‌شده، ابرهای اختصاصی و استقرارهای خود-میزبان (Self-hosted) پشتیبانی کنند.

با جذب پیچیدگی‌های تنظیم زیرساخت برای پروفایل محاسباتی خاص مدل‌های انتشار، MachGen به توسعه‌دهندگان اجازه می‌دهد تا به جای درگیر شدن با لوله‌کشی‌های زیرساختی، بر روی تمایز محصول خود تمرکز کنند.

گام بعدی شما

  • اگر از APIهای عمومی برای تولید ویدیو استفاده می‌کنید، هزینه‌های استنتاج خود را با مدل‌های بهینه‌شده مقایسه کنید.
  • برای توسعه‌دهندگان: بررسی کنید که آیا مدل‌های شما در بخش ارتباطات بین GPUها (Communication Overhead) گلوگاه دارند یا خیر.
  • دنبال کنید که چگونه کاهش تأخیر در مدل‌های انتشار، راه را برای رابط‌های کاربری تعاملی و لحظه‌ای باز می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص مهندسی در سطح کرنل‌های GPU، سد هزینه‌ای و زمانی تولید ویدیو را می‌شکند. این تغییر باعث می‌شود تولید محتوای بصری از حالت «ساخت یک اثر» به حالت «تولید انبوه و شخصی‌سازی شده» در لحظه تبدیل شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به GPUهای پیشرفته و APIهای خاص، این تحول فعلاً برای توسعه‌دهندگان ایرانی که از سرویس‌های ابری خارجی استفاده می‌کنند کاربردی است و اثر مستقیمی بر زیرساخت‌های داخلی ندارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز MachGen بر لایه‌ی زیرساخت به جای دستکاری وزن‌های مدل، نشان می‌دهد که ما از عصر «بزرگ‌تر کردن مدل» به عصر «بهینه‌سازی مسیر اجرا» رسیده‌ایم. این رویکرد ثابت می‌کند که بسیاری از محدودیت‌های فعلی ویدیوهای هوش مصنوعی، نه به دلیل ضعف مدل‌ها، بلکه به دلیل استفاده از زیرساخت‌های ناسازگار (طراحی شده برای متن) است. در واقع، بازگشت به بهینه‌سازی‌های سطح پایین (Low-level) تنها راه رسیدن به کاربردهای تعاملی و لحظه‌ای است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.