پرش به محتوای اصلی
پرش به محتوای مقاله

Timeline Studio: پردازش متمرکز ویدیو در مرورگر با WebGPU

·۲۷ تیر ۱۴۰۵۶ دقیقه مطالعه
ویرایشگر ویدیوی هوشمند محلی که در مرورگر اجرا می‌شود
ویرایشگر ویدیوی هوشمند محلی که در مرورگر اجرا می‌شود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال کامل خط لوله استنتاج مدل‌های سنگین (از Whisper تا LivePortrait) به محیط مرورگر با استفاده از WebGPU، بدون نیاز به هرگونه ارتباط با سرور در حین تدوین.

تصور کنید تمام ابزارهای پیچیده تدوین ویدیو و مدل‌های سنگین هوش مصنوعی، بدون نیاز به نصب نرم‌افزاری، مستقیماً در یک تب مرورگر اجرا شوند. اگر از تدوینگران ویدیو هستید که هر بار برای حذف پس‌زمینه یا تبدیل متن به گفتار، منتظر آپلود گیگابایت‌ها داده در سرورهای ابری می‌مانید، این تجربه به‌طور کلی تغییر می‌کند. در حالی که اکثر ابزارهای ویدئویی مبتنی بر هوش مصنوعی از کاربران می‌خواهند رسانه‌های خصوصی خود را در سرورهای راه دور آپلود کنند، Timeline Studio کل جریان کاری تدوین با کمک هوش مصنوعی را به داخل مرورگر منتقل کرده است. این پروژه متن‌باز از شتاب‌دهنده‌های سخت‌افزاری محلی بهره می‌برد تا کاربران بتوانند بدون خروج داده‌ها از دستگاه، صدای گوینده تولید کنند، صوت را به متن تبدیل کنند و پرتره‌های عصبی را رندر بگیرند.

بسیاری از ابزارهای مدرن ویدئویی AI برای پردازش فایل‌های رسانه‌ای سنگین به یک بک‌اند ابری متکی هستند. این مسئله یک نقطه اصطکاک ایجاد می‌کند؛ جایی که کاربران باید منتظر آپلود فایل‌ها بمانند و اعتماد کنند که سرورهای شخص ثالث از فوتیج‌های خام آن‌ها به درستی محافظت می‌کنند. Timeline Studio با تغییر این مدل، مرورگر را به موتور اصلی محاسبات تبدیل کرده است. این ویرایشگر شبیه به نرم‌افزارهای دسکتاپ است که با React و APIهای رسانه‌ای مرورگر ساخته شده و از ابزارهایی مانند CapCut الهام گرفته است.

برای دستیابی به این هدف، این ویرایشگر از یک پشته فنی (Tech Stack) متمرکز بر React 19، Vite و ONNX Runtime Web استفاده می‌کند. با بهره‌گیری از WebGPU برای شتاب‌دهی و بازگشت به WASM در مواقع ضروری، سیستم استنتاج (Inference) را روی GPU محلی کاربر اجرا می‌کند. این رویکرد «اول-محلی» (Local-first) تضمین می‌کند که رسانه‌های پروژه هرگز از سمت کلاینت خارج نشوند، زیرا هیچ بک‌ند ویرایشی برای پردازش یا ذخیره فایل‌های کاربر وجود ندارد.

تبدیل متن به گفتار و بازشناسی صوت

Timeline Studio برای تولید صدای گوینده (Voiceovers)، چندین موتور تبدیل متن به گفتار (TTS) سمت مرورگر را ادغام کرده است. کاتالوگ صداها شامل موتورهای خاصی برای زبان‌های مختلف است:

  • انگلیسی: توسط مدل Kokoro 82M ONNX پشتیبانی می‌شود.
  • چینی: توسط مدل Piper/VITS ONNX پشتیبانی می‌شود.
  • آلمانی، اسپانیایی، فرانسوی، ایتالیایی و پرتغالی برزیلی: توسط صداهای Piper پشتیبانی می‌شوند.

موتورهای سنگین‌تر تنها در صورت نیاز بارگذاری شده و توسط Service Workerها برای جلسات آینده کش می‌شوند. به جای تولید یک فایل صوتی بلند و واحد، ویرایشگر صداها را کپشن-به-کپشن (تکه تکه) تولید می‌کند. هر کلیپ صوتی دقیقاً از زمان کپشن مربوطه شروع می‌شود و به کاربر اجازه می‌دهد خطوط منفرد یک فیلمنامه را بدون پردازش مجدد کل پروژه، بازتولید یا جابه‌جا کند.

برای تبدیل صوت به متن (Transcription)، این ابزار مدل Whisper small q8 ONNX را درون یک Browser Worker اجرا می‌کند. توسعه‌دهنده ابتدا مدل‌های کوچک‌تر Whisper را آزمایش کرد، اما آن‌ها نتایج ناپایداری در صوت‌های چینی تولید می‌کردند؛ بنابراین در مسیر فعلی، خروجی قابل پیش‌بینی بر دانلود کم‌ترین حجم ممکن اولویت دارد. خط لوله کپشن‌گذاری موارد زیر را مدیریت می‌کند:

  • بازشناسی گفتار در سمت مرورگر.
  • تنظیم زمان‌بندی (Timestamp) با آگاهی از شکل موج (Waveform).
  • اصلاح محافظه‌کارانه هم‌صداهای (Homophones) زبان چینی.
  • کلیپ‌های کپشن زمانی قابل ویرایش با تایپوگرافی مشترک برای پیش‌نمایش و خروجی.

هوش بصری و رندرینگ عصبی

ویرایشگر ویدیوی هوشمند محلی که در مرورگر اجرا می‌شود

این ویرایشگر قابلیت «قاب‌بندی هوشمند» (Smart Framing) و حذف پس‌زمینه را با استفاده از YOLOS tiny برای تشخیص سوژه و MODNet برای متینگ پرتره (Portrait Matting) پیاده‌سازی می‌کند. برخلاف ابزارهایی که فقط فریم اول را تحلیل کرده و همان نتیجه را تکرار می‌کنند، Timeline Studio یک مسیر تحلیل زمانی (Temporal Analysis Track) دارای مهر زمانی می‌سازد. پیش‌نمایش، برش هوشمند، اجتناب از پوشاندن کپشن و حذف پس‌زمینه همگی از نتایج این تحلیل برای زمان فعلی منبع استخراج می‌شوند. استنتاج به‌صورت پیش‌محاسباتی با نمونه‌برداری تطبیقی انجام می‌شود تا مدل‌های ONNX در حلقه پخش‌بکِ بلادرنگ (Real-time) اجرا نشوند و باعث کندی نشوند.

یکی از بلندپروازانه‌ترین ویژگی‌ها، خط لوله آزمایشی «انسان دیجیتال» است. این سیستم مدل JoyVASA را برای حرکات مبتنی بر صوت و LivePortrait را برای رندرینگ عصبی پرتره ترکیب می‌کند. برای مدیریت محدودیت‌های سخت‌افزاری محلی، دو مسیر مجزا تعریف شده است:

  • مسیر پیش‌نمایش ۲۵۶ پیکسلی برای تکرار سریع و تست.
  • مسیر کیفی ۵۱۲ پیکسلی برای نتایج نهایی.

این خط لوله از فریم‌های کلیدی عصبی پراکنده با درونیابی زمانی (Temporal Interpolation) استفاده می‌کند. از آنجایی که رندرینگ عصبی با رزولوشن بالا در GPUهای فعلی مرورگر می‌تواند کند باشد، رابط کاربری پیشرفت کار را به‌طور صادقانه گزارش می‌دهد. در این پیاده‌سازی از سینک-لب‌های شبیه‌سازی شده یا ویسم‌های (Visemes) دستی استفاده نشده و کاملاً بر نتایج واقعی عصبی تکیه شده است.

مهندسی زمان و خروجی

ویرایشگر ویدیوی هوشمند محلی که در مرورگر اجرا می‌شود

ساخت این ویرایشگر مستلزم حل مشکل «لرزش» (Stuttering) بود که در پخش‌کننده‌های رسانه‌ای مبتنی بر React رایج است. جستجوی مداوم (Seeking) یک المان ویدئویی برای دنبال کردن وضعیت‌های تأخیری React باعث ایجاد لگ بصری می‌شود. بنابراین، توسعه‌دهنده مسیر پیش‌نمایش بلادرنگ را از مسیر خروجی نهایی جدا کرد:

  • مسیر پیش‌نمایش: از پخش‌بک بومی (Native) ویدئو استفاده می‌کند تا روانی تدوین تضمین شود.
  • مسیر خروجی: یک رندرکننده قطعی (Deterministic) مجزا است که مهر زمانی دقیق خط زمانی را برای هر فریم خروجی محاسبه می‌کند.

در هنگام خروجی (Export)، رندرکننده موارد زیر را ترکیب می‌کند: رسانه بصری اصلی، لایه‌های تصویر-در-تصویر (PiP)، کپشن‌ها، استیکرها، ماسک‌ها، فریم‌های کلیدی، فیلترها و انتقال‌ها (Transitions). صداها به‌طور مجزا میکس می‌شوند و شامل صدای گوینده، موسیقی و صدای جداشده از منبع هستند. مسیر اصلی خروجی از WebCodecs برای کدگذاری فایل‌های نهایی MP4 یا WebM استفاده می‌کند و MediaRecorder به عنوان یک جایگزین برای سازگاری بیشتر در دسترس است. این امر تضمین می‌کند که خروجی نهایی دقیقاً مشابه هندسه‌ی ترکیب‌بندی در پیش‌نمایش باشد.

قابلیت‌های تدوین مفصل

فراتر از هوش مصنوعی، Timeline Studio مجموعه‌ای جامع از ابزارهای تدوین دستی را ارائه می‌دهد:

  • مدیریت خط زمانی: پشتیبانی از یک ترک بصری اصلی متصل، قابلیت جذب (Snapping) در خط زمانی و راهنماهای تراز عمودی کامل.
  • دستکاری کلیپ‌ها: شامل ابزارهایی برای برش (Split)، تکثیر، حذف و تغییر ترتیب.
  • کنترل‌های بوم (Canvas): امکان جابه‌جایی مستقیم، تغییر اندازه و چرخش المان‌ها.
  • جلوه‌های بصری: ماسک‌های اشکال، فیلترها، انیمیشن‌ها و انتقال‌های مبتنی بر نقطه‌ی اتصال (Junction-based).
  • تنظیمات دقیق: فریم‌های کلیدی تبدیل (Transform) گروه‌بندی شده و کنترل‌های سرعت پخش ویدئو.
  • قابلیت انتقال پروژه: تمام کارها به‌صورت فایل‌های پروژه قابل ویرایش با پسوند .timeline ذخیره می‌شوند.

به‌روزرسانی‌های نسخه ۰.۴.۰

نسخه v0.4.0 یک خط زمانی لایه (Overlay Timeline) پیشرفته را معرفی می‌کند. دارایی‌های بصری اکنون دارای «قصد رهاسازی» (Drop Intentions) صریح هستند: رها کردن روی توالی اصلی باعث افزودن یا تغییر ترتیب محتوا می‌شود، در حالی که رها کردن روی محتوای موجود، یک لایه تصویر-در-تصویر ایجاد می‌کند. کلیپ‌های اصلی را می‌توان به پایین کشید تا به Overlay تبدیل شوند یا آن‌ها را دوباره به ترک اصلی ارتقاء داد، در حالی که هویت رسانه و مدت‌زمان آن حفظ می‌شود.

سایر بهبودهای کلیدی نسخه ۰.۴.۰ عبارتند از:

  • خروجی صوتی بهبود یافته: ویرایشگر اکنون المان‌های داخلی را پس از جداسازی صدا بی‌صدا (Mute) می‌کند تا از پخش دوبله جلوگیری شود، اما اگر تک ترک جداشده‌ای وجود نداشته باشد، می‌تواند صدای داخلی را استخراج کرده و مپ کند.
  • کشیدن و رها کردن پیش‌بینی‌پذیر: رابط کاربری اکنون اعلام می‌کند که آیا یک动作 رها کردن (Drop) باعث پیوستن به توالی، درج در درز (Seam)، ایجاد یک لایه یا افزودن به یک ترک زمان‌بندی شده می‌شود.
  • تدوین با کمک عامل (Agent): معرفی مهارت edit-timeline-studio برای عامل‌های سازگار با Codex. این قابلیت به عامل‌های AI اجازه می‌دهد رسانه‌ها را بازرسی کنند، ویرایش‌ها را با استفاده از IDهای پایدار کلیپ‌ها توصیف کنند و برنامه‌های ویرایشی اعلامی (Declarative) را تایید کنند. این رویکرد مشابه سیستم FableCut است که برای تبدیل فرمان‌های JSON به عملیات تدوین بهینه شده تا کنترل دقیق‌تری به عامل‌های هوش مصنوعی بدهد.

این تغییر به سمت هوش مصنوعی «اول-محلی» نشان‌دهنده آینده‌ای است که در آن «ابر» تنها برای توزیع مدل‌ها استفاده می‌شود و نه برای اجرا. با تبدیل خروجی‌های AI به حالت‌های قابل ویرایش در خط زمانی — مانند تبدیل بازشناسی گفتار به کلیپ‌های قابل جابه‌جایی یا انیمیشن پرتره به رسانه‌های بصری قابل جایگزینی — این ابزار agency (عاملیت) انسان را بر اتوماسیون تک-کلیکی ترجیح می‌دهد.

برای کاربرانی که می‌خواهند این پیاده‌سازی را تست کنند، پروژه به صورت PWA در دسترس است. مدل‌های حجیم به صورت Lazy-load بارگذاری شده و محلی کش می‌شوند، به این معنی که جلسات تکراری نیازی به دانلود مجدد وزن‌های AI ندارند. برای شروع کار با پروژه، می‌توانید مخزن گیت‌هاب را کلون کرده و با استفاده از Node.js 20 یا جدیدتر از طریق دستورات npm install و npm run dev آن را اجرا کنید.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مخزن گیت‌هاب پروژه را کلون کرده و با استفاده از Node.js ۲۰ و دستور npm run dev آن را تست کنید.
  • برای تجربه سریع‌تر، نسخه PWA (اپلیکیشن وب پیشرفت) را در مرورگر لود کنید تا مدل‌ها روی حافظه محلی شما کش شوند.
  • قابلیت‌های ترکیب WebGPU و ONNX را در پروژه‌های خود بررسی کنید تا وابستگی به سرور را کاهش دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و آینده استنتاج محلی مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در WebGPU، هزینه‌های عملیاتی سرور را برای توسعه‌دهندگان حذف و امنیت داده‌های کاربر را تضمین می‌کند. انتقال استنتاج به لبه، استانداردهای جدیدی برای سرعت پاسخ‌دهی در ابزارهای تولید محتوا ایجاد می‌کند.

تأثیر برای ایران

به‌دلیل حذف نیاز به سرورهای ابری و APIهای خارجی، این ابزار برای تدوینگرانی که با تحریم‌ها یا کندی اینترنت در دسترسی به سرویس‌های AI مواجه‌اند، راهکاری ایده‌آل و کاملاً آفلاین است.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از Cloud-AI به Local-First در تدوین ویدیو، پایان عصر «صبر برای آپلود» است. این رویکرد نشان می‌دهد که مرورگرها دیگر صرفاً نمایشگر داده نیستند، بلکه به محیط‌های اجرای سنگین تبدیل شده‌اند. به نظر ما، این مدل موفقیت‌آمیز در مدیریت VRAM مرورگر، راه را برای ابزارهای حرفه‌ای‌تری می‌گشاید که حریم خصوصی را به قیمت حذف سرورهای گران‌قیمت می‌خرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.