
تراشههای جدید اپل: پردازش هوش مصنوعی صوتی در محیط ایزوله
اپل در تراشههای جدید خود از یک بخش ایزوله سختافزاری برای پردازش صدا استفاده کرده است تا حتی سیستمعامل هم به فایلهای خام دسترسی نداشته باشد. این معماری اجازه میدهد ویژگیهای…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۸ مقاله منتشر شده

اپل در تراشههای جدید خود از یک بخش ایزوله سختافزاری برای پردازش صدا استفاده کرده است تا حتی سیستمعامل هم به فایلهای خام دسترسی نداشته باشد. این معماری اجازه میدهد ویژگیهای…

گوگل و ناسا با معرفی مدل یادگیری عمیق MAPL-EMIT، شناسایی نشتهای متان را ۵۰٪ دقیقتر از تحلیلگران انسانی کردند. این سامانه با تحلیل دادههای ماهوارهای، نشتهای متان را در ۲۴ مورد…

اپلیکیشنهای ترجمه در حال تبدیل شدن به گرافهای استنتاج پیچیدهای هستند که بینایی ماشین، بازشناسی گفتار و رباتیک را ادغام میکنند. توسعهدهندگان اکنون باید برای پاسخهای…

گوگل با ادغام ابزارهای صوتی تعاملی در Workspace و معرفی قابلیت ساخت اپلیکیشن با زبان طبیعی در Sheets، لایهی هوش مصنوعی خود را از یک دستیار جانبی به هستهی عملیاتی تبدیل میکند.…

شرکت Cloudphysician مدل بنیادی Nightingale را برای نظارت شبانهروزی بیماران معرفی کرد. این سامانه با پردازش دادهها در محیط بیمارستان، هزینههای پهنای باند و استنتاج را در مقایسه…

انتخاب یک ابزار تولید تصویر انیمه نیازمند چیزی فراتر از تماشای گالریهای تبلیغاتی است. این راهنما ۵ تست عملی — از ثبات شخصیت تا ویرایش دقیق — را معرفی میکند تا مشخص شود آیا یک…

شرکت ریویان با طراحی تراشه اختصاصی و عقد قرارداد ۱.۲۵ میلیارد دلاری با اوبر، قصد دارد از سطح ۲ به سطح ۴ اتونومی جهش کند. این استراتژی بر پایه مدلهای رانندگی بزرگ و ادغام…

شرکت Suno برای کاهش دعاوی حقوقی، مدلهای نسل ششم خود را با دادههای قانونی از برچسبهای موسیقی بزرگ آموزش داد. این بهروزرسانی شامل ابزارهای ویرایش دقیق و سیستمی طبقهبندیشده…

شرکت دیپسیک مدل V4.1 Flash را جایگزین V4 Pro کرد. این مدل جدید در تمامی معیارهای کلیدی از جمله سرعت و هزینه، عملکرد بهتری دارد و هزینههای عملیاتی را برای کاربران بهشدت کاهش…

آمازون با ترکیب هوش مصنوعی و جلوههای ویژه، حرکت لب بازیگران را با صدای دوبله تطبیق میدهد. این قابلیت ابتدا در سریال Maxton Hall اجرا شده و قرار است به سایر آثار گسترش یابد.

متخصصان صنعت هشدار میدهند که افزایش مقیاس مدلها لزوماً منجر به انسانیتر شدن عاملهای صوتی نمیشود. در این حوزه، تأخیر (Latency) و مبنیسازی (Grounding) جایگزین تعداد پارامترها…

یک مدل منتشرنشده از OpenAI با استفاده از ۱۰ هزار عامل هوش مصنوعی، یکی از دشوارترین مسائل ریاضی قرن را در ۸۸ ساعت حل کرد. این موفقیت با اتهامات جدی درباره سرقت مالکیت فکری از…