
درون فرآیند تبدیل تکتصویر به کاربرگهای شخصیتی در Tsubaki.3
مدل Tsubaki.3 متعلق به PixAI میتواند یک تصویر مرجع را به مجموعهای کامل از نماهای مختلف، حالات چهره و ژستهای بدنی تبدیل کند. این قابلیت با تثبیت هویت بصری، مشکل «لغزش شخصیت»…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۸ مقاله منتشر شده

مدل Tsubaki.3 متعلق به PixAI میتواند یک تصویر مرجع را به مجموعهای کامل از نماهای مختلف، حالات چهره و ژستهای بدنی تبدیل کند. این قابلیت با تثبیت هویت بصری، مشکل «لغزش شخصیت»…

سازمانها در حال گذار از ابزارهای تکمنظوره به سامانههای چندوجهی هستند که متن، تصویر، صدا و دادههای حسگر را در یک فضای نهان مشترک ادغام میکنند. این چرخش معماری، درک انسانگونه…

یک توسعهدهنده با بهینهسازی تهاجمی پرامپتها و تنظیم دقیق تشخیص فعالیت صوتی، عامل صوتی Maya را برای یک کلینیک طراحی کرد. این پروژه نشان میدهد که فاصله بین یک دموی ساده و یک…

پلتفرم Magical Song با تبدیل روایتهای کوتاه شخصی به ترانههایی در سبکهای مختلف، موسیقی تولیدشده توسط هوش مصنوعی را از حالت کلیشهای به هدیهای شخصیسازیشده تبدیل کرده است. این…

گوگل قابلیت تولید خلاصههای ویدئویی هوشمند را برای مشترکان نسخههای پولی Gemini در بیش از ۷۰ زبان فعال کرد. این بهروزرسانی به تیمهای جهانی اجازه میدهد پژوهشهای متنی خود را…

مدل جدید MAI-Transcribe-2 مایکروسافت با کاهش شدید هزینهها و افزایش ۱۰ برابری سرعت، استانداردهای بازشناسی گفتار را تغییر داد. این مدل در ۶۰ زبان مختلف، نرخ خطای کلمه ۵.۲ درصدی را…

گوگل قابلیتهای هوش مصنوعی گفتاری را برای اپلیکیشنهای بهرهوری خود فعال کرد تا کاربران بتوانند ایمیلها و اسناد خود را از طریق دستورات صوتی مدیریت کنند. این ویژگیها در ابتدا…

مدیریت چندین ارائهدهنده برای متن، تصویر و صوت باعث ایجاد اصطکاک عملیاتی در تیمهای مهندسی میشود. Oxlo.ai با استانداردسازی APIها و قیمتگذاری در هفت دستهبندی مدل، این پیچیدگی را…

شرکت HUMAIN مدل جدید humain-m3 را با ۴۲۸ میلیارد پارامتر و معماری MoE معرفی کرد که در استدلال و درک زبان عربی رکورد جدیدی ثبت کرده است. این مدل که توسط MiniMax توسعه یافته،…

آنتروپیک مدل Fable 5.1 را با تمرکز بر سرعت و کاهش شدید هزینههای عملیاتی عرضه کرد. این بهروزرسانی هزینهٔ کشینگ ورودی را ۷۵٪ کاهش داده و رقابت در بازار مدلها را از «قدرت مطلق» به…

شرکت Hugging Face مدل NeoMME را معرفی کرد؛ یک رمزگذار چندوجهی که بدون نیاز به برجهای بینایی مجزا، متن و تصویر را در یک ترنسفورمر واحد پردازش میکند. این مدل ضمن حفظ دقت بازیابی،…

مهندسی معکوس ابزارهای Flock Safety نشان میدهد پلیس میتواند با توصیفات متنی ساده، افراد را در شبکههای گسترده دوربینهای شهری ردیابی کند. با وجود ادعای وجود حفاظها، این سیستم…