تصور کنید به جای دقایق انتظار برای رندر یک ویدیوی باکیفیت، آن را در عرض چند ثانیه تحویل بگیرید. این رویایی است که MachGen AI با بازطراحی لایههای زیرساختی استنتاج، آن را به واقعیت تبدیل کرده است. در حالی که تولید یک ویدیوی باکیفیت توسط هوش مصنوعی معمولاً دقایق زمان میبرد، MachGen AI این انتظار را به ثانیه کاهش داده است. این شرکت با پیادهسازی یک پشته زیرساختی جدید، توانست بهبود ۶ برابری در تأخیر (Latency) چندین مدل ویدیویی ایجاد کند، بدون اینکه به روش «تقطیر مدل» (Model Distillation) متکی شود؛ این یعنی کیفیت خروجی دقیقاً مشابه نسخههای اصلی باقی میماند.
بسیاری از زیرساختهای فعلی برای مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — بهینه شدهاند. اما مدل انتشار (Diffusion Model) که موتور محرک تولید تصویر و ویدیو است، رفتار متفاوتی دارد. از آنجایی که مدلهای انتشار متفاوت عمل میکنند، در پشتههای موجود اغلب به عنوان یک اولویت ثانویه یا «فکر afterthought»对待 میشوند. طبق گزارش این شرکت، این عدم تطابق باعث شده تولید ویدیو کند، گران و برای کاربردهای تجاری در دنیای واقعی مقیاسناپذیر باشد.
کیسمات سینگ (Kismat Singh)، مدیرعامل MachGen و مدیر سابق مهندسی در اینتل (Intel)، یک مدیر اجرایی در حوزه زیرساخت و مهندسی هوش مصنوعی است که بیش از دو دهه تجربه در ساخت سیستمهای محاسباتی با عملکرد بالا (HPC) و یادگیری ماشین دارد. او پیش از این به عنوان معاون مهندسی چارچوبهای هوش مصنوعی در اینتل فعالیت میکرد و به طور مستقیم در ابتکارات PyTorch این شرکت نقش داشت و برای دسترسپذیر کردن چارچوبهای AI در پلتفرمهای سختافزاری مختلف تلاش میکرد. سوابق شغلی او همچنین شامل نقشهای مهندسی ارشد در انویدیا (NVIDIA)، ایامدی (AMD) و اچپی (HP) است، جایی که مشارکتهای ویژهای در کتابخانههای یادگیری عمیق، کامپایلرها و تابآوری آموزش در مقیاس هایپر-اسکیل داشت. او همچنین پیشینهای در کدگذاری ویدیویی بلادرنگ (Real-time) دارد و در انویدیا روی TensorRT کار کرده است.
مانوج کریشنان (Manoj Krishnan)، همبنیانگذار شرکت و متخصص سابق زیرساختهای آموزش مدلهای بزرگ در پایتورچ (PyTorch) در متا (Meta)، در کنار سینگ تصمیم گرفتند درسهای بهینهسازی LLMها را برای دنیای ویدیو پیاده کنند. جالب است بدانید که این دو نفر نزدیک به ۱۰ سال در یک باشگاه بدمینتون بازی میکردند و در این مدت زمان زیادی را صرف تلاش برای جذب یکدیگر به تیمهایشان کردند تا اینکه در نهایت تصمیم گرفتند با هم شریک شوند. آنها اکنون همان درسهای بهینهسازی را که LLMهای اولیه را به ابزارهای سطح تولید (Production-grade) تبدیل کرد و تریلیونها توکن را به جهان عرضه نمود، در دنیای مدلهای انتشار به کار میگیرند.
به نقل از مصاحبهی سینگ با unite.ai، مدلهای زبانی و مدلهای انتشار الگوهای محاسباتی اساساً متفاوتی دارند. LLMها «خودبازگشتی» (Autoregressive) هستند؛ یعنی با یک مرحله پیشپر (Prefill) سنگین از نظر محاسباتی شروع شده و سپس وارد مرحله رمزگشایی (Decode) توکنبه-توکن میشوند که محدود به حافظه (Memory-bound) است. این ساختار به صنعت اجازه داد تا بهینهسازیهای خاصی مانند KV Caching و جداسازی پیشپر/رمزگشایی را توسعه دهد.
در مقابل، مدلهای انتشار «غیر خودبازگشتی» هستند و در تمام طول فرآیند حذف نویز (Denoising)، به شدت به توان محاسباتی وابستهاند (Compute-bound). تولید ویدیو پیچیدگی بیشتری میافزاید زیرا حجم عظیمی از دادههای مکانی (Spatial) و زمانی (Temporal) را در بر میگیرد که تقاضاهای منحصربهفردی را در زمینههای توجه (Attention)، حافظه، ارتباطات و موازیسازی ایجاد میکند.
سینگ اشاره میکند که به دلیل این تفاوتها، زیرساختهای متداول AI اغلب بزرگترین گلوگاههای عملکردی را نادیده میگیرند:
- KV Caching: کشینگ استاندارد KV در مدلهای انتشار همان مشکلاتی را حل نمیکند که در LLMها حل میکرد.
- موازاتسازی (Parallelism): موازاتسازی استاندارد میتواند سربار ارتباطی (Communication Overhead) قابل توجهی ایجاد کند که مزایای افزودن GPUهای بیشتر را خنثی میکند.
- کرنلهای نرمافزاری: کرنلهای متنباز موجود برای مدلهای انتشار به مراتب کمتر از کرنلهای توسعهیافته برای متن بالغ هستند. این چالشها یادآور بحثهای فنی پیرامون بهینهسازی کرنلهای GPU برای کاهش تأخیر است که در آن موتورهای استنتاجی جدید سعی در جایگزینی کامپایلرهای سنتی دارند.
MachGen برای حل این مشکل، مدل انتشار را به عنوان یک «شهروند درجهیک» پذیرفت و زمانبند (Scheduler)، مدل حافظه، استراتژیهای کشینگ و کرنلهای GPU را دقیقاً بر اساس پروفایل محاسباتی تولید تصویر و ویدیو بازطراحی کرد. این شرکت اکنون APIهایی برای تبدیل متن به تصویر، تصویر به تصویر، متن به ویدیو، تصویر به ویدیو و تولید ویدیو بر اساس مرجع (Reference-to-video) ارائه میدهد.
بررسی عمیق: پشته بهینهسازی
برای دستیابی به این دستاوردها، MachGen چندین لایه خاص از پشته استنتاج را بهینه میکند. استدلال آنها این است که زمانبند، مدل حافظه و موازاتسازی باید حول محور خودِ مدل انتشار طراحی شوند، نه اینکه از چارچوبهای LLM اقتباس شوند.
- محاسبات توجه (Attention Computation): از آنجایی که «توجه» بخش بزرگی از بودجه محاسباتی بسیاری از مدلهای ویدیویی را میبلعد، MachGen بر روی دستورالعملهای با دقت پایینتر (Lower-precision) و «توجه پراکنده» (Sparse Attention) تمرکز کرده است.
- استراتژیهای کشینگ: برخلاف KV Caching در LLMها، MachGen روشهایی را توسعه داده است که از افزونگیهای مکانی و زمانی موجود در دادههای تصویر و ویدیو بهرهبرداری میکند.
- کرنلهای GPU: شرکت کرنلهای بسیار بهینهای برای معماریهای انتشار میسازد تا تأخیر را به حداقل برساند.
- موازاتسازی و ارتباطات: آنها کرنلهای سفارشی توسعه دادهاند که ارتباطات را با محاسبات مستقل از داده (Data-independent) همپوشانی (Overlap) کرده و آنها را با کارهای وابسته به داده خطلولهسازی (Pipeline) میکند تا سربار ارتباطی، دستاوردهای GPU را از بین نبرد.
- مدیریت حافظه: پشته به گونهای تنظیم شده است که جابهجایی عظیم دادههای مورد نیاز برای ویدیوهای با رزولوشن بالا را بدون ایجاد گلوگاه مدیریت کند.
نتایج این تغییرات در مدلهای استاندارد صنعت خیرهکننده و قابل اندازهگیری است. برای اطمینان از عدم افت کیفیت، از نسخههای اصلی و غیرتقطیری استفاده شده است:
- HiDream: کاهش زمان تولید از ۶ ثانیه به ۱ ثانیه.
- Flux: کاهش از ۶.۲ ثانیه به ۱.۵ ثانیه.
- Wan 2.2: کاهش زمان تولید ویدیو از ۹۸ ثانیه به ۱۶.۵ ثانیه.
- LTX 2.3: کاهش زمان تولید ویدیو از ۶۷ ثانیه به ۱۰.۷ ثانیه.
علاوه بر سرعت، هزینه استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دورهی آموزش آشپز — در مدلهای تصویری ۲ تا ۴ برابر و در ویدیوها ۲ تا ۳ برابر کمتر شده است. این دستاوردها از طریق بهرهبرداری از افزونگیهای مکانی و زمانی با روشهای جدید کشینگ و بهینهسازی کل مسیر تولید حاصل شده است. سینگ تأکید میکند که برای پذیرش در سطح تولید صنعتی، سرعت، هزینه و کیفیت باید همزمان و در کنار هم عمل کنند.
کاربرد در دنیای واقعی: Trusted TV
این تحولات فنی در حال تغییر مدلهای کسبوکار هستند. پلتفرم Trusted TV که به کسبوکارهای کوچک کمک میکند تیزرهای تبلیغاتی آماده برای پخش در پلتفرمهای تلویزیون متصل (Connected TV) مانند Prime Video، Roku و DirecTV بسازند، اخیراً کل گردش کار خود را در کمتر از ۴۸ ساعت به MachGen منتقل کرد.
پیش از این، ساخت یک تیزر تلویزیونی نیازمند تیمهای گرانقیمت فیلمبرداری و تدوین بود و هزینههای آن از چند هزار دلار شروع شده و اغلب به دهها هزار دلار میرسید. اکنون، یک صاحب کسبوکار کوچک میتواند با یک گوشی هوشمند در حدود ۵ دقیقه یک تیزر کامل بسازد و پیش از پرداخت هزینه، آن را پیشنمایش کند. تا به امروز، بیش از ۱۰,۰۰۰ کمپین در این پلتفرم ایجاد شده است.
مدیرعامل Trusted TV، ایان (Ian)، در ابتدا بنچمارکهای تأخیر MachGen را در Artificial Analysis باور نمیکرد. پس از تست شخصی، اولین رندر او در حدود ۲۵ ثانیه و بدون افت کیفیت بازگشت. در آخرین استقرار، این زمان به ۱۰ یا ۱۱ ثانیه کاهش یافته و این بهبودها حتی در تستهای همزمانی (Concurrency) در مقیاس بالا نیز پابرجا بود.
به دلیل اینکه تولید اکنون سریع و ارزان است، استراتژی تبلیغکنندگان تغییر کرده است. به جای ساخت یک یا دو تیزر کلی، کاربران اکنون هر هفته دو یا سه آگهی جدید را جایگزین میکنند، تغییرات خلاقانه را روی بخشهای مختلف مخاطبان تست میکنند و در لحظه نتایج را اصلاح مینمایند.
سینگ آینده را در «شخصیسازی فوقسریع» (Hyper-personalization) میبیند. برای مثال، یک تبلیغ کفش که در منهتن فیلمبرداری شده ممکن است برای کاربری در منطقه Bay Area هیچ معنایی نداشته باشد. با MachGen، همان تبلیغ میتواند فوراً تغییر کند تا در پسزمینه، کوه Mission Peak را نشان دهد. این فقط یک تبلیغ ارزانتر نیست؛ بلکه نوع متفاوتی از تبلیغات است که تنها زمانی از نظر اقتصادی توجیهپذیر میشود که تولید هزاران نسخه مختلف، سریع و مقرونبهصرفه باشد.
مسیر رسیدن به ویدیوهای تعاملی و مدلهای جهان
MachGen در حال حاضر برای برخی موارد به سرعتهای تعاملی رسیده است. آنها میتوانند یک ویدیوی ۵ ثانیهای با رزولوشن 720p از مدل Vidu Q3 Turbo را در حدود ۶ ثانیه، یا نسخه 540p آن را در کمتر از ۳ ثانیه تولید کنند. این دستاورد، آواتارهای AI پاسخگو، گیمینگ و خلق محتوای تعاملی را در دسترس قرار میدهد.
سینگ «تعاملی» را محتوایی تعریف میکند که شما آن را هدایت میکنید، نه محتوایی که صرفاً دریافت میکنید. برای مثال، بینندهای که در حال تماشای یک داستان است، اگر از جهت پیشروی پایانبندی خوشش نیامد، میتواند در لحظه پیرنگ داستان را تغییر دهد و به شخصیتها دستور دهد تا به جای تماشای غیرفعال صحنه، با یک راز روبرو شوند.
این زیرساخت همچنین پیشنیاز اصلی برای عاملهای هوشمند (AI Agents) است. یک عامل خودکار، یک درخواست واحد کاربر را به دهها یا صدها شغل تولید تبدیل میکند؛ گزینهها را میسازد، آنها را ارزیابی میکند و در یک حلقه بدون دخالت انسان، پرامپتها را اصلاح میکند. در این مسیر، بحث بر سر این است که آیا لایه ارکستراسیون در مقیاس سازمانی میتواند جایگزین تکیه مطلق بر مدلهای بنیادی شود یا خیر. این امر تقاضاهای بنیادین متفاوتی ایجاد میکند:
- تأخیر: اگر هر تولید دقایق زمان ببرد، گردش کار عامل برای کاربردی بودن بیش از حد کند است.
- هزینه: هزینههای بالا، تکرار خودکار را از نظر اقتصادی غیرعملی میکند.
- قابلیت اطمینان: یک شکست در زنجیره کاری میتواند کل حلقه عامل را متوقف کند.
- نوسانات شدید (Burstiness): تقاضای عاملها بسیار نوسانیتر از برنامههای خلاقانه انسانی است و نیازمند تخصیص پیشرفته GPU، مقیاسپذیری خودکار (Autoscaling) و مسیریابی هوشمند است.
در اینجا، واحد کار برای عاملها دیگر یک تصویر یا ویدیوی واحد نیست، بلکه کل حلقه «تولید، ارزیابی و اصلاح» محتوا است.
در نگاهی به آینده، سینگ «مدلهای جهان» (World Models) را ستاره قطبی (هدف نهایی) شرکت میبیند. این مدلها کل محیطهای بصری را شبیهسازی میکنند و به دلیل اینکه باید به طور مداوم یک محیط را بهروزرسانی کنند (به جای تولید یک خروجی واحد)، به توان عملیاتی بسیار بالا و تأخیر بسیار پایین نیاز دارند. آنها همچنین باید سازگاری مکانی و زمانی را حفظ کرده و در لحظه به اقدامات پاسخ دهند.
اگر شبیهسازی به اندازه تولید متنِ امروز پاسخگو و ارزان شود، پیامدهای آن گسترده خواهد بود: رباتها میتوانند موقعیتهای نادر را پیش از مواجهه واقعی تمرین کنند، بازیها میتوانند محیطهایی تولید کنند که به هر بازیکن به طور خاص پاسخ میدهد و طراحان میتوانند دهها احتمال فیزیکی را به صورت مجازی تست کنند. سینگ اشاره میکند که مدلهای جهانِ امروز از نظر محاسباتی شبیه به مدلهای انتشار هستند و همین موضوع، پشته فعلی MachGen را به بنیادی طبیعی برای این آینده تبدیل میکند.
پیامدهای استراتژیک برای زیرساختهای AI
در حالی که سختافزارهای انویدیا یا AMD سقف عملکرد را بالا میبرند، سینگ استدلال میکند که این نرمافزار است که تعیین میکند چه مقدار از آن سقف واقعاً لمس شود. او به عصر LLMها اشاره میکند، جایی که بهبودهای سختافزاری خام با روشهایی مانند Batching مداوم، مدیریت KV-cache، رمزگشایی گمانهزن (Speculative Decoding) و کرنلهای تخصصی تکمیل شدند تا به توان عملیاتی سطح تولید برسند.
برای شرکتهایی که تولید تصویر یا ویدیو را در محصولات خود ادغام میکنند، نقطه عطف بهینهسازی زمانی رخ میدهد که استنتاج شروع به تأثیر گذاشتن بر تجربه مشتری یا حاشیه سود شرکت کند. در حالی که APIهای عمومی برای اعتبارسنجی یک محصول مفید هستند، مقیاسپذیری مستلزم نگاهی فراتر از «قیمت به ازای هر خروجی» و در نظر گرفتن تأخیر، همزمانی و بهرهوری GPU است.
سینگ هشدار میدهد معماریای که در آن ظرفیت GPU باید همگام با میزان استفاده رشد کند، فشار فزایندهای بر حاشیه سود وارد میکند. بهینهسازی زمانی استراتژیک میشود که تقاضای اوج (Peak Demand) باعث ایجاد صف شود یا زمانی که انتظار کاربر منجر به رها کردن گردش کار شود. او خاطرنشان میکند که محاسبات مورد نیاز برای یک کلیپ کوتاه 540p با یک ویدیوی بلند 1080p بسیار متفاوت است، به این معنی که هیچ آستانه واحدی برای حجم درخواستها جهت این تغییر وجود ندارد.
MachGen از «مدل بازارگاه» (Marketplace Model) — که در آن مدلها تجمیع شده و درخواستها مسیریابی میشوند — دوری میکند. سینگ معتقد است این مدل در بلندمدت دفاعپذیر نیست زیرا کنترل روی لایه عملکرد را ندارد. در عوض، MachGen پشته را به صورت بومی میسازد و میزبانی میکند. این به آنها اجازه میدهد تا توجه، کشینگ، کرنلها، دقت، حافظه و موازاتسازی را برای هر مدل و هر شتابدهنده به طور مجزا تنظیم کنند و از APIهای مدیریتشده، ابرهای اختصاصی و استقرارهای خود-میزبان (Self-hosted) پشتیبانی کنند.
با جذب پیچیدگیهای تنظیم زیرساخت برای پروفایل محاسباتی خاص مدلهای انتشار، MachGen به توسعهدهندگان اجازه میدهد تا به جای درگیر شدن با لولهکشیهای زیرساختی، بر روی تمایز محصول خود تمرکز کنند.
گام بعدی شما
- اگر از APIهای عمومی برای تولید ویدیو استفاده میکنید، هزینههای استنتاج خود را با مدلهای بهینهشده مقایسه کنید.
- برای توسعهدهندگان: بررسی کنید که آیا مدلهای شما در بخش ارتباطات بین GPUها (Communication Overhead) گلوگاه دارند یا خیر.
- دنبال کنید که چگونه کاهش تأخیر در مدلهای انتشار، راه را برای رابطهای کاربری تعاملی و لحظهای باز میکند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو