
تبدیل عکسهای ثابت به ویدیوهای POV با همگامسازی صوتی TalkPix AI
ابزار TalkPix AI اکنون قادر است یک تصویر ثابت و یک فایل صوتی را به ویدیویی واقعگرایانه با انیمیشنهای لبخوانی دقیق تبدیل کند. این فناوری نیاز به تجهیزات گرانقیمت ضبط حرکت یا…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۶ مقاله منتشر شده

ابزار TalkPix AI اکنون قادر است یک تصویر ثابت و یک فایل صوتی را به ویدیویی واقعگرایانه با انیمیشنهای لبخوانی دقیق تبدیل کند. این فناوری نیاز به تجهیزات گرانقیمت ضبط حرکت یا…

متا مدل Muse Glimmer را به عنوان یک مدل وزنباز ۳۰ میلیارد پارامتری برای اجرای محلی عاملهای هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانهزنانه، روی…

بایتدنس با معرفی SeedRealtime، یک مدل چندوجهی بومی را عرضه کرد که صوت، تصویر و متن را در یک معماری واحد پردازش میکند. این رویکرد با حذف لایههای واسط، تأخیر در گفتگوهای…

تحلیل دقیق Kling AI نشان میدهد که ساختار پرامپت پنجبخشی میتواند نورپردازی و حرکت دوربین را مدیریت کند، اما قادر به رفع نقصهای ساختاری مانند تغییر شکل چهره نیست. کاربران باید…

اکثر مهارتهای فعلی عاملهای هوش مصنوعی بر ورودی و استدلال متمرکز شدهاند و در تولید فایلهای واقعی مانند تصویر یا صوت ناتواناند. ابزار جدید Model Studio از علیبابا با ارائه یک…

گوگل قابلیتی را برای تولید اسلایدهای قابل ویرایش توسط Gemini معرفی کرد، اما محدودیتهای شدید در دسترسی، پشتیبانی تنها از زبان انگلیسی و خطاهای تبدیل به پاورپوینت، این ابزار را…

تشخیص رسانههای مصنوعی از تحلیل پیکسلها به بررسی سازگاری زمانی و همگامسازی چندوجهی تغییر مسیر داده است. توسعهدهندگان اکنون برای شناسایی ویدیوهای ساختهشده با هوش مصنوعی، از…

شرکت Runway دسترسی به ابزارهای خود را با انتشار اپلیکیشن اندروید گسترش داد، اما قابلیتهای کلیدی مانند ماسکگذاری دقیق و گردشکارهای سفارشی همچنان محدود به نسخه دسکتاپ هستند.…

یک ابزار جدید مبتنی بر هوش مصنوعی، طراحی نشانهای خانوادگی و نمادهای فانتزی را برای غیرطراحان ممکن کرده است. این سیستم با تمرکز بر قواعد سختگیرانه هنر نشانشناسی، نیاز به آزمون و…

یک بازرسی جامع روی ۱۴,۵۱۲ عکس نشان داد که استخراج تصاویر از متن مقالات ویکیپدیا بهشدت غیرقابل اعتماد است. این مطالعه ثابت کرد مدلهای بینایی هنگام مواجهه با نام مکانها دچار…

بررسی بیش از ۱,۵۰۰ پرامپت نشان میدهد که برای خروج از ظاهر «مصنوعی» تصاویر تجاری، باید بهجای صفتهای کلی، بر جزئیات فیزیکی و برندسازی تخیلی تمرکز کرد. این یافتهها نقشهای برای…

پژوهشگران دانشگاه ماهیدول مدل رایگان و محلی ThonburianTTS را برای شبیهسازی طبیعی صدای تایلندی منتشر کردند. این مدل امکان کپی صدای Zero-shot را تنها با ۵ تا ۱۰ ثانیه نمونه صوتی و…