اگر به دنبال حذف نویزها و خطاهای بصری در ویدیوهای تولیدشده توسط هوش مصنوعی هستید، باید بدانید که بازی تغییر کرده است. چارچوب جدید AVA-Encoder موفق شده است دقت بازسازی ویدیو را ۲۰.۷ امتیاز نسبت به قویترین مدلهای فعلی ارتقا دهد.
طبق اعلام تیم Qwen در ۲۱ اوت ۲۰۲۶ و به نقل از HuggingPapers، این سیستم برخلاف مدلهای سنتی، ویدیوها را به جای بردارها در قالب گراف دانش (Knowledge Graph) نمایش میدهد. همانطور که در تحلیل قبلی ما دربارهی نقش گرافهای دانش در حل مشکل «کوریِ کد» در سامانههای تولید بازیابیافزا (RAG) اشاره کردیم، علیبابا اکنون همین منطق ساختاریافته را برای مدیریت پیچیدگیهای زمانی و بصری سینما به کار گرفته است.
در حالی که خودرمزگذارهای (Autoencoders) سنتی دادهها را در تنسورهای (Tensors) متراکم فشرده میکنند، AVA-Encoder یک نقشه صریح از گرههای معنایی میسازد.

بر اساس مستندات منتشرشده، هسته فنی این سامانه شامل موارد زیر است:
- نگاشت گرافمحور: تبدیل فیلمها به گرافهای دانش قابل ویرایش به جای بردارهای نهان.
- جهش کیفیت: بهبود ۲۰.۷ امتیازی در بازسازی نسبت به خطمبناهای موجود. این پیشرفت در حالی رخ میدهد که پیش از این چارچوب PROVE تلاش کرده بود تا خطاهای ارزیابی در حذف اشیا از ویدیوها را برطرف کند.
- قابلیت ویرایش معنایی: امکان تغییر گرههای خاص (مانند یک شخصیت یا رابطه بین صحنهها) بدون نیاز به رمزگذاری مجدد کل ویدیو.

برای جامعه فنی، این یک چرخش بنیادین در مفروضات سنتز ویدیو است. اگر نمایش گراف واقعاً دانهریز باشد، صنعت از «تغییر پیکسلها» به سمت «دستکاری معنایی» حرکت میکند. توانایی جایگزینی یک شیء یا محیط تنها با ویرایش یک گره، میتواند آرتیفکتهای رایج در مدلهای انتشار (Diffusion Model) را به کلی حذف کند. این سطح از تکامل در تولید محتوا، چالشهای جدیدی را ایجاد میکند، چرا که حذف آرتیفکتها در ویدیوهای مولد میتواند سیستمهای شناسایی جعل عمیق را با شکست مواجه کند.
با این حال، گزارشهای فعلی در مورد دادههای اعتبارسنجی راگی است. علیبابا هنوز جزئیات مربوط به محک (Benchmark) مورد استفاده، مدل خطمبنا یا پروتکل ارزیابی را افشا نکرده است. بدون این جزئیات، عدد ۲۰.۷ امتیازی بیشتر یک ادعای تبلیغاتی است تا یک نتیجه علمی تأییدشده. در این راستا، شناسایی دقیقتر این دست ادعاها نیازمند بررسی سیگنالهای فنی برای تشخیص جعلهای عمیق با کیفیت بالا است تا مرز بین بهبود کیفیت و دستکاریهای غیرشفاف مشخص شود.
گام بعدی شما
- منتظر انتشار مقاله کامل پژوهشی باشید تا مشخص شود این گرافها بهصورت سرتاسری (End-to-End) یاد گرفته شدهاند یا از رمزگذارهای پیشآموزشدیده استخراج شدهاند.
- بررسی کنید که آیا این تکنیک در خط لوله تولید ویدیوی Qwen برای حذف آرتیفکتها ادغام میشود یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو