
Suno v6 با همکاری غولهای موسیقی، ویرایش جراحی صدا را ممکن کرد
Suno نسخه ۶ مدلهای خود را با همکاری Warner Music و BMG معرفی کرد. این بهروزرسانی با جایگزینی مدل واحد با یک سیستم سهلایه، کنترلهای ویرایشی دقیق و مسیرهای قانونی برای توزیع…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۸ مقاله منتشر شده

Suno نسخه ۶ مدلهای خود را با همکاری Warner Music و BMG معرفی کرد. این بهروزرسانی با جایگزینی مدل واحد با یک سیستم سهلایه، کنترلهای ویرایشی دقیق و مسیرهای قانونی برای توزیع…

ابزار Voice Design شرکت Gradium امکان خلق صداهای کاملاً جدید را تنها از طریق توصیفات متنی فراهم میکند. این سیستم در آزمونهای مقایسهای، بهویژه در بازسازی لهجههای منطقهای،…

جایگزینی توصیفات مبهم با یک سند تکصفحهای از معیارهای موفقیت، از چرخههای بیپایان تولید مجدد جلوگیری میکند. این متد با تثبیت محدوده پروژه پیش از تولید اولین فریم، هزینههای…

یک API جدید با استفاده از مدلهای بینایی-زبانی، هزینهی تبدیل رسیدها به دادههای ساختاریافته را از ۱۰ سنت به ۱ هزارم دلار کاهش داده است. این رویکرد با حذف خط لولههای پیچیدهی…

پلتفرم BhaShaVox با استفاده از یک گردشکار مبتنی بر هوش مصنوعی، دورههای آنلاین را به بیش از ۱۲۵ زبان ترجمه و دوبله میکند. این سیستم با ترکیب صدای دوبلهشده و زیرنویس، موانع…

مدلهای پیشرو در تولید ویدیو بهدلیل فقدان ابزارهای تدوین و ریتمبندی، اغلب خروجیهای غیرقابلانتشاری تولید میکنند. در مقابل، پلتفرمهای تولیدی با تمرکز بر تحویل محتوای کاربردی،…

اوپنایآی مدل Images 2.5 را با تمرکز بر سرعت استنتاج و ویرایش دقیق چندمرحلهای معرفی کرد. این بهروزرسانی با ارائه ابزار Sketch و مدلهای تخصصی API، فاصله بین تولید ساده تصویر و…

ادوبی با یکپارچهسازی مدلهای مختلف هوش مصنوعی زاینده در محیط Premiere، امکان تولید مستقیم کلیپهای ویدئویی و صوتی را فراهم کرد. این بهروزرسانی با حذف نیاز به جابهجایی بین…

اوپنایآی مدل Astra را بهعنوان نخستین عضو خانواده GPT-6 معرفی کرد که بهجای تولید متن، بر تعامل سریع و خودمختار با نرمافزارها تمرکز دارد. این مدل در بنچمارکهای استدلال پیشرفت…

شرکت Neurologyca در حال توسعه لایهای برای درک سیگنالهای رفتاری انسان است تا عاملهای هوش مصنوعی بتوانند استرس و اعتمادبهنفس کاربر را تشخیص دهند. این شرکت معتقد است گلوگاه فعلی،…

شرکت Motional نخستین مجموعه داده باز با تمرکز بر استدلال در سناریوهای نادر (Long-tail) را منتشر کرد تا خودروهای خودران بهجای تقلید از حرکت، منطق پشت هر تصمیم را بیاموزند.

شرکت Reducto مدل r-1 را معرفی کرد که با جایگزینی خط لولههای چندمرحلهای OCR، یک معماری تکمرحلهای را جایگزین کرده است. این مدل علاوه بر کاهش ۲۰ درصدی خطاها، هزینه پردازش هر صفحه…