
ElevenLabs Music v2: ترمیم بخشهای منتخب آهنگ و دسترسی به API
شرکت ElevenLabs نسخه دوم مدل تولید موسیقی خود را با قابلیت ترمیم (Inpainting) در سطح بخشهای آهنگ منتشر کرد. این ابزار اکنون از طریق API برای تیمهای محصول در دسترس است و مدل…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۲ مقاله منتشر شده

شرکت ElevenLabs نسخه دوم مدل تولید موسیقی خود را با قابلیت ترمیم (Inpainting) در سطح بخشهای آهنگ منتشر کرد. این ابزار اکنون از طریق API برای تیمهای محصول در دسترس است و مدل…

شرکت رولند با معرفی افزونه Melody Flip، رویکردی متفاوت در تولید موسیقی با هوش مصنوعی پیش گرفت. این ابزار بهجای تولید آهنگهای کامل، بلوکهای سازندهی MIDI را برای تحریک خلاقیت…

گوگل با ادغام عامل Gemini Spark در سرویس گوگل فوتوز، سازماندهی آلبومها و ویرایش تصاویر را خودکار کرد. این بهروزرسانی که فعلاً برای مشترکان سطح بالای آمریکا در دسترس است، تلاشی…

تصاویر غذای تولیدشده توسط هوش مصنوعی اغلب بهدلیل ضعف در درک ساختارهای نازک و فقدان دانش فیزیکی، باعث ایجاد حس تهوع میشوند. این نقصها منجر به پدیدهای میشود که واکنشهای…

مدل Tsubaki.3 متعلق به PixAI میتواند یک تصویر مرجع را به مجموعهای کامل از نماهای مختلف، حالات چهره و ژستهای بدنی تبدیل کند. این قابلیت با تثبیت هویت بصری، مشکل «لغزش شخصیت»…

سازمانها در حال گذار از ابزارهای تکمنظوره به سامانههای چندوجهی هستند که متن، تصویر، صدا و دادههای حسگر را در یک فضای نهان مشترک ادغام میکنند. این چرخش معماری، درک انسانگونه…

یک توسعهدهنده با بهینهسازی تهاجمی پرامپتها و تنظیم دقیق تشخیص فعالیت صوتی، عامل صوتی Maya را برای یک کلینیک طراحی کرد. این پروژه نشان میدهد که فاصله بین یک دموی ساده و یک…

پلتفرم Magical Song با تبدیل روایتهای کوتاه شخصی به ترانههایی در سبکهای مختلف، موسیقی تولیدشده توسط هوش مصنوعی را از حالت کلیشهای به هدیهای شخصیسازیشده تبدیل کرده است. این…

گوگل قابلیت تولید خلاصههای ویدئویی هوشمند را برای مشترکان نسخههای پولی Gemini در بیش از ۷۰ زبان فعال کرد. این بهروزرسانی به تیمهای جهانی اجازه میدهد پژوهشهای متنی خود را…

مدل جدید MAI-Transcribe-2 مایکروسافت با کاهش شدید هزینهها و افزایش ۱۰ برابری سرعت، استانداردهای بازشناسی گفتار را تغییر داد. این مدل در ۶۰ زبان مختلف، نرخ خطای کلمه ۵.۲ درصدی را…

گوگل قابلیتهای هوش مصنوعی گفتاری را برای اپلیکیشنهای بهرهوری خود فعال کرد تا کاربران بتوانند ایمیلها و اسناد خود را از طریق دستورات صوتی مدیریت کنند. این ویژگیها در ابتدا…

مدیریت چندین ارائهدهنده برای متن، تصویر و صوت باعث ایجاد اصطکاک عملیاتی در تیمهای مهندسی میشود. Oxlo.ai با استانداردسازی APIها و قیمتگذاری در هفت دستهبندی مدل، این پیچیدگی را…