تصور کنید یک فایل PDF خشک یا یک مجموعهی اسلایدهای پاورپوینت را به ویدیویی پویا و ۳۰ ثانیهای تبدیل کنید. با انتشار Wan3.0، شرکت علیبابا (Alibaba) این امکان را فراهم کرده است تا صفحات وب و اسناد ساختاریافته مستقیماً به ویدیو تبدیل شوند.
این قابلیت، یک چرخش در انعطافپذیری ورودیهای مدل است؛ یعنی عبور از پرامپتهای متنی ساده به سمت پردازش اسناد ساختاریافته. این تحول در حالی رخ میدهد که فضای ویدیوهای هوش مصنوعی زاینده (Generative AI) — شبیه به نقاشی که در حین کشیدن، ناگهان خطوطش تغییر میکنند — با مشکل «لغزش بصری» (Visual Drift) دستوپنجه نرم میکند؛ وضعیتی که در آن شخصیتها و محیطها در طول پخش ویدیو تغییر شکل میدهند. این رقابت برای دستیابی به ثبات بصری، در حالی شدت گرفته که مدلهای دیگری نظیر MiniMax H3 توانستهاند جایگاه نخست رتبهبندی ویدیوهای AI را از آن خود کنند.
همانطور که در تحلیل قبلی ما دربارهی مدلهای چندوجهی اشاره کردیم، ثبات بصری کلید ورود AI به صنعت است. علیبابا با اجازه دادن به استفاده از اسناد و تصاویر به عنوان مرجع، قصد دارد چیدمانهای مکانی و جزئیات شخصیتها را در کلیپهای طولانیتر حفظ کند. این گام برای کسبوکاری که به جای هنر انتزاعی، به بازاریابی با هویت بصری ثابت نیاز دارد، حیاتی است.
به گزارش وبسایت the-decoder.com در ۲۴ اوت ۲۰۲۶، مدل Wan3.0 حداکثر طول ویدیو را نسبت به نسل قبلی خود (Wan2.5) دو برابر کرده است. قابلیتهای فنی این مدل عبارتند از:
- ورودی چندوجهی (Multimodal): امکان ترکیب ۱۰ تصویر، ۵ ویدیو و ۵ کلیپ صوتی در یک پرامپت واحد.
- طول هوشمند: سیستم بر اساس محتوای پرامپت، بهینهترین مدتزمان ویدیو را پیشنهاد میدهد.
- ابزارهای گسترش: کاربران میتوانند با ابزاری اختصاصی، طول کلیپهای تولیدشده را افزایش دهند.
هزینه استفاده از این سرویس به دو سطح Standard و Prime تقسیم شده است. برای یک کلیپ ۳۰ ثانیهای با کیفیت 1080p، هزینه نسخه استاندارد ۶ دلار و نسخه پرایم ۸.۴۰ دلار است.
طبق اعلام منابع مالی، این فشار برای پیشتازی در بازار، هزینههای سنگینی داشته است. علیبابا اخیراً گزارش داده که سود سه ماهه خود را ۷۵٪ نسبت به سال گذشته کاهش داده است. این کاهش بر اثر سرمایهگذاریهای کلان در حوزه AI رخ داده و شرکت حتی بزرگترین فروش سهام یک شرکت پذیرفتهشده در بورس هنگکنگ را برای تأمین بودجه این توسعه انجام داد. این استراتژی تهاجمی در توسعه مدلهای عظیم، همراستا با عرضه مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر است که نشاندهنده تلاش علیبابا برای تسلط بر تمامی لایههای هوش مصنوعی است.
برای کاربر نهایی، این یعنی مرز بین یک فایل ارائه شرکتی و یک ویدیو حرفهای عملاً از بین رفته است. اما آزمون واقعی این خواهد بود که آیا این ابزارها میتوانند ویدیوهای شبیهسازیشدهای تولید کنند که برای آموزش خودروهای خودران — همانطور که علیبابا ادعا میکند — به اندازه کافی قابلاعتماد باشند.
گام بعدی شما
- اگر مدیر محصول یا تولیدکننده محتوا هستید، اسناد فنی خود را به جای متن ساده، به صورت PDF به مدل بدهید تا دقت بصری افزایش یابد.
- تفاوت هزینه بین نسخههای Standard و Prime را با حجم خروجی مورد نیازتان بسنجید تا بودجه استنتاج بهینه شود.
- خروجیهای مدل را در محیطهای شبیهسازیشده بررسی کنید تا میزان «لغزش بصری» در کلیپهای طولانیتر را بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو