
«کاهش اعوجاج چهره»؛ هدف فنی مدل ویدیوساز Wan3.0 علیبابا
مدل جدید Wan3.0 شرکت علیبابا میتواند با دریافت متن، تصویر و اسناد ساختاریافته، ویدیوهایی تا ۳۰ ثانیه تولید کند. این ابزار با هدف کاهش اعوجاجهای بصری در چهرهها و رابطهای…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

مدل جدید Wan3.0 شرکت علیبابا میتواند با دریافت متن، تصویر و اسناد ساختاریافته، ویدیوهایی تا ۳۰ ثانیه تولید کند. این ابزار با هدف کاهش اعوجاجهای بصری در چهرهها و رابطهای…

اوپنایآی با معرفی خانواده مدلهای GPT-5.6، ساختار قیمتگذاری API خود را تغییر داد. این بهروزرسانی شامل مدلهای Sol، Terra و Luna است و هزینههای جدیدی برای ابزارهای تخصصی مانند…

شرکت General Intuition در حال جذب سرمایه با ارزشگذاری ۶ میلیارد دلاری است تا مدلهای بنیادی خود را به دنیای فیزیکی منتقل کند. این شرکت از دادههای عظیم بازیهای ویدئویی برای…

شرکت Generalist AI مدل بنیادی GEN-1.5 را معرفی کرد که از طریق «پرامپت فیزیکی»، یادگیری وظایف جدید را برای رباتها به یک نمایش کوتاه کاهش میدهد. این مدل بدون نیاز به برنامهنویسی…

سامانه PolyTalk با پیادهسازی یک خط لوله گفتار-به-گفتار میزبانیشده، مشکل تأخیر بالا و خطاهای ترجمه در محیطهای شلوغ رستوران را حل میکند. این سیستم بهجای ترجمه جملات تکهتکه، از…

سازمانهای بهداشتی برای کاهش فرسودگی کادر درمان، وظایف تکراری اداری و برچسبگذاری تصاویر پزشکی را به سامانههای هوشمند میسپارند. این تغییر رویکرد، تمرکز پزشکان را از ثبت دادهها…

کودکان با کسری از دادههای مورد نیاز مدلهای زبانی بزرگ، تسلط بر زبان را به دست میآورند. پژوهشگران اکنون با مدلهای «مقیاس نوزاد» و دوربینهای سرپوشی در تلاشاند تا مکانیسم…

نسخه جدید Veo 3.1 گوگل با معرفی قابلیت تصاویر مرجع و همگامسازی صوتی، مشکل تغییر چهره شخصیتها در ویدیوهای تولیدی را حل کرده است. اگرچه سقف هر کلیپ همچنان ۸ ثانیه است، اما ابزار…

پلتفرم BhaShaVox با استفاده از فناوری دوبلهٔ خودکار، راهنمای محصولاتش را به زبان هندی بومیسازی کرد تا نرخ جذب کاربر در هند را افزایش دهد. این ابزار با ترکیب شبیهسازی صدا و…

مدلهای چندوجهی از خطلولههای ساده به سمت «تلفیق میانی» حرکت میکنند تا تصاویر را بهجای شرح متنی، بهعنوان توکنهای بومی پردازش کنند. این معماری نرخ توهم را کاهش داده و استدلال…

پژوهشگر سوریا ناردی سیستمی را توسعه داده که بهجای تولید پیکسل، با نوشتن کدهای جاوااسکریپت نقاشی میکند. این رویکرد به کاربران اجازه میدهد با تغییر خطوط کد، جزئیات اثر هنری را…

شرکت Pika با معرفی مجموعهای از چهار مدل صوتی، قیمت تولید صدا و گفتار هوش مصنوعی را بهشدت کاهش داد. این اقدام تمرکز صنعت را از توانایی مدلها به سمت توجیه اقتصادی اپلیکیشنهای…