
۷۰ میلیثانیه تا انسانیت: Mistral چگونه ElevenLabs را به چالش کشید؟
شرکت Mistral AI مدل Voxtral TTS را معرفی کرد؛ یک مدل ۴ میلیارد پارامتری که در طبیعی بودن صدا، ElevenLabs را شکست میدهد. این مدل با تأخیر بسیار کم و قابلیت تطبیق سریع صدا،…
دستهبندی
تولید تصویر و ویدیو، صدای مصنوعی، هنر و موسیقی هوشمند، بازیها و وجه سرگرمکنندهی AI.
۶۸۷ مقاله منتشر شده

شرکت Mistral AI مدل Voxtral TTS را معرفی کرد؛ یک مدل ۴ میلیارد پارامتری که در طبیعی بودن صدا، ElevenLabs را شکست میدهد. این مدل با تأخیر بسیار کم و قابلیت تطبیق سریع صدا،…

تولید ویدئو با هوش مصنوعی از ابر به دسکتاپ نقل مکان کرده است. مدلهای جدیدی مانند HunyuanVideo کیفیت تجاری را روی سختافزارهای مصرفکننده ممکن کردهاند و نیاز به اشتراکهای…

مایکروسافت با معرفی VibeVoice، عصر خرد کردن فایلهای صوتی را به پایان رساند. این چارچوب قادر است فایلهای ۶۰ دقیقهای را در یک مرحله پردازش کند و انسجام لحن گوینده را در بازههای…

پلتفرم OpenMOSS با معرفی MOSS-Audio، مرزهای تحلیل صوتی را جابهجا کرد. این مدل بنیادی با معماری نوآورانه، توانسته است در نسخهی ۸ میلیاردی خود، مدلهای ۳۰ میلیاردی را در دقت تحلیل…

علیبابا دسترسی عمومی به API مدل HappyHorse 1.0 را آغاز کرد تا تولید ویدیوهای صنعتی را متحول کند. این سیستم با ارائه چهار نقطه اتصال تخصصی، مشکل قدیمی «تغییر چهره» در ویدیوهای…

پژوهش جدید Contra Labs نشان میدهد که هیچ مدل هوش مصنوعی زایندهای در تمام مراحل خلق اثر برنده نیست. این مطالعه تفاوت میان «سلیقه» و «استانداردهای حرفهای» را رمزگشایی کرده و…

انویدیا با معرفی پلاگین TensorRT برای موتور عصبی Unreal Engine 5، سرعت استنتاج هوش مصنوعی را ۱.۵ برابر افزایش داد. این ابزار با استفاده از بهینهسازی JIT، زمان پردازش…

مدل X-WAM با معرفی روش نمونهبرداری نویز نامتقارن، توانسته است سنتز ۴ بعدی با کیفیت بالا را با اجرای لحظهای دستورات رباتیک ترکیب کند. این پیشرفت به معنای پایان دوران توقف رباتها…

پژوهشگران با معرفی چارچوب QYOLO توانستند حجم مدلهای تشخیص شیء را بیش از ۲۰ درصد کاهش دهند. این دستاورد با جایگزینی ماژولهای سنگین با میکسینگ الهامگرفته از کوانتوم به دست آمده و…

پژوهشگران مجموعهداده عظیم و چندوجهی CheXthought را معرفی کردند که مسیر تفکر و نقاط تمرکز رادیولوژیستها را ثبت کرده است. این ابزار با آموزش مدلها برای «دیدن» مانند انسان، توهمات…

ViCrop-Det یک چارچوب استنتاج بدون نیاز به آموزش است که با استفاده از آنتروپی توجه، دقت تشخیص اشیاء کوچک را بهطور چشمگیری افزایش میدهد. این متد بدون تغییر در وزنهای مدل، mAP را…

پژوهش جدید SynSur ثابت کرد که دادههای مصنوعی به تنهایی نمیتوانند جایگزین نمونههای واقعی صنعتی شوند. با این حال، ترکیب این دو منبع، دقت تشخیص عیوب را در محیطهای کمداده بهطور…