پرش به محتوای اصلی
پرش به محتوای مقاله

«کاهش اعوجاج چهره»؛ هدف فنی مدل ویدیوساز Wan3.0 علی‌بابا

·۲ شهریور ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
ویدیوهای ۳۰ ثانیه‌ای با هوش مصنوعی از متن، تصویر و سند توسط وان ۳.۰ علی‌بابا
ویدیوهای ۳۰ ثانیه‌ای با هوش مصنوعی از متن، تصویر و سند توسط وان ۳.۰ علی‌بابا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

قابلیت تبدیل مستقیم اسناد ساختاریافته (PDF و PowerPoint) به ویدیو؛ برخلاف مدل‌های قبلی که فقط بر متن یا تصویر تکیه می‌کردند، اینجا سند به عنوان لنگر بصری عمل می‌کند.

تصور کنید یک فایل PDF خشک یا یک مجموعه‌ی اسلایدهای پاورپوینت را به ویدیویی پویا و ۳۰ ثانیه‌ای تبدیل کنید. با انتشار Wan3.0، شرکت علی‌بابا (Alibaba) این امکان را فراهم کرده است تا صفحات وب و اسناد ساختاریافته مستقیماً به ویدیو تبدیل شوند.

این قابلیت، یک چرخش در انعطاف‌پذیری ورودی‌های مدل است؛ یعنی عبور از پرامپت‌های متنی ساده به سمت پردازش اسناد ساختاریافته. این تحول در حالی رخ می‌دهد که فضای ویدیوهای هوش مصنوعی زاینده (Generative AI) — شبیه به نقاشی که در حین کشیدن، ناگهان خطوطش تغییر می‌کنند — با مشکل «لغزش بصری» (Visual Drift) دست‌وپنجه نرم می‌کند؛ وضعیتی که در آن شخصیت‌ها و محیط‌ها در طول پخش ویدیو تغییر شکل می‌دهند. این رقابت برای دستیابی به ثبات بصری، در حالی شدت گرفته که مدل‌های دیگری نظیر MiniMax H3 توانسته‌اند جایگاه نخست رتبه‌بندی ویدیوهای AI را از آن خود کنند.

همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های چندوجهی اشاره کردیم، ثبات بصری کلید ورود AI به صنعت است. علی‌بابا با اجازه دادن به استفاده از اسناد و تصاویر به عنوان مرجع، قصد دارد چیدمان‌های مکانی و جزئیات شخصیت‌ها را در کلیپ‌های طولانی‌تر حفظ کند. این گام برای کسب‌وکاری که به جای هنر انتزاعی، به بازاریابی با هویت بصری ثابت نیاز دارد، حیاتی است.

به گزارش وب‌سایت the-decoder.com در ۲۴ اوت ۲۰۲۶، مدل Wan3.0 حداکثر طول ویدیو را نسبت به نسل قبلی خود (Wan2.5) دو برابر کرده است. قابلیت‌های فنی این مدل عبارتند از:

  • ورودی چندوجهی (Multimodal): امکان ترکیب ۱۰ تصویر، ۵ ویدیو و ۵ کلیپ صوتی در یک پرامپت واحد.
  • طول هوشمند: سیستم بر اساس محتوای پرامپت، بهینه‌ترین مدت‌زمان ویدیو را پیشنهاد می‌دهد.
  • ابزارهای گسترش: کاربران می‌توانند با ابزاری اختصاصی، طول کلیپ‌های تولیدشده را افزایش دهند.

هزینه استفاده از این سرویس به دو سطح Standard و Prime تقسیم شده است. برای یک کلیپ ۳۰ ثانیه‌ای با کیفیت 1080p، هزینه نسخه استاندارد ۶ دلار و نسخه پرایم ۸.۴۰ دلار است.

طبق اعلام منابع مالی، این فشار برای پیشتازی در بازار، هزینه‌های سنگینی داشته است. علی‌بابا اخیراً گزارش داده که سود سه ماهه خود را ۷۵٪ نسبت به سال گذشته کاهش داده است. این کاهش بر اثر سرمایه‌گذاری‌های کلان در حوزه AI رخ داده و شرکت حتی بزرگ‌ترین فروش سهام یک شرکت پذیرفته‌شده در بورس هنگ‌کنگ را برای تأمین بودجه این توسعه انجام داد. این استراتژی تهاجمی در توسعه مدل‌های عظیم، هم‌راستا با عرضه مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر است که نشان‌دهنده تلاش علی‌بابا برای تسلط بر تمامی لایه‌های هوش مصنوعی است.

برای کاربر نهایی، این یعنی مرز بین یک فایل ارائه شرکتی و یک ویدیو حرفه‌ای عملاً از بین رفته است. اما آزمون واقعی این خواهد بود که آیا این ابزارها می‌توانند ویدیوهای شبیه‌سازی‌شده‌ای تولید کنند که برای آموزش خودروهای خودران — همان‌طور که علی‌بابا ادعا می‌کند — به اندازه کافی قابل‌اعتماد باشند.

گام بعدی شما

  • اگر مدیر محصول یا تولیدکننده محتوا هستید، اسناد فنی خود را به جای متن ساده، به صورت PDF به مدل بدهید تا دقت بصری افزایش یابد.
  • تفاوت هزینه بین نسخه‌های Standard و Prime را با حجم خروجی مورد نیازتان بسنجید تا بودجه استنتاج بهینه شود.
  • خروجی‌های مدل را در محیط‌های شبیه‌سازی‌شده بررسی کنید تا میزان «لغزش بصری» در کلیپ‌های طولانی‌تر را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار داده‌های ساختاریافته، نرخ خطای بصری را کاهش می‌دهد و تولید محتوای سازمانی را دموکراتیزه می‌کند. این تغییر، استانداردهای تولید آموزش‌های شرکتی و شبیه‌سازی‌های صنعتی را جابه‌جا می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به سرویس‌های علی‌بابا و پرداخت‌های ارزی، استفاده از این ابزار برای تولیدکنندگان محتوای ایرانی دشوار است، اما مدل‌های مشابه متن‌باز می‌توانند از این رویکرد ورودی ساختاریافته الگو بگیرند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر ورودی‌های ساختاریافته (PDF/PPT) نشان می‌دهد که رقابت در تولید ویدیو از «تخیل محض» به سمت «دقت مستنداتی» حرکت می‌کند. این رویکرد احتمالاً برای جلب اعتماد بازارهای سازمانی (Enterprise) است که نمی‌توانند ریسک توهمات بصری را بپذیرند. در واقع، مدل‌های آینده به جای اینکه فقط «تصور کنند»، باید بتوانند «ترجمه کنند».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.