پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

تبدیل GLM-5.3-Flash به مدل سیستم یکی شبیه جِو
آموزش کاربردی

آیا خواندن Logprobs می‌تواند مدل‌های زبانی را به سرعت Jev برساند؟

پژوهشگران راهکاری برای تبدیل مدل‌های زبانی عمومی به مدل‌های تصمیم‌گیرنده با سرعت بسیار بالا یافته‌اند. این روش به‌جای تولید متن، توزیع احتمالات توکن‌ها را می‌خواند و در مدل…

۱۰ دقیقه خواندن۲
ربات انسان‌نمای HomeBody در حال تعامل با محیط خانگی و یادگیری فضای اطراف
آموزش کاربردی

سامانه HomeBody با دوقلوهای دیجیتال محیط‌های ناشناخته را پیمایش می‌کند

پژوهشگران استنفورد رباتی انسان‌نما توسعه داده‌اند که با ساخت دوقلوهای دیجیتال از محیط‌های جدید، کارهای پیچیده خانگی را بدون اسکریپت‌های پیش‌نویس اجرا می‌کند. این سیستم با ترکیب…

۸ دقیقه خواندن۱
استخراج دانش چندوجهی برای ماموریت‌های زمین‌شناسی سیاره‌ای با داده‌های بسیار کم
آموزش کاربردی

تقلیل دانش متقاطع: راهکار مقابله با کمبود شدید داده در هوش مصنوعی فضایی

رویکرد جدیدی به نام تقلیل دانش متقاطع (CMKD) به کاوشگرهای سیاره‌ای اجازه می‌دهد تا با استفاده از داده‌های غنی حسگرهای مداری، زمین‌شناسی پیچیده را حتی بدون داشتن تصاویر برچسب‌دار…

۱۰ دقیقه خواندن۱
نمودار رشد فناوری پردازش گفتار در سال‌های ۲۰۲۴ تا ۲۰۲۶
آموزش کاربردی

شبیه‌سازی صدای انسان روی موبایل در کمتر از یک ثانیه ممکن شد

زیرساخت‌های هوش مصنوعی صوتی از ابر به لبه منتقل شده‌اند و اکنون شبیه‌سازی فوق‌واقع‌گرایانه صدا روی دستگاه‌های موبایل در کمتر از یک ثانیه رخ می‌دهد. این تحول با ادغام قابلیت‌های…

۶ دقیقه خواندن
ربات چت مبتنی بر هوش مصنوعی در حال تعامل با کاربر
آموزش کاربردی

Oxlo.ai هزینه استنتاج چت‌بات‌ها را با مدل قیمت‌گذاری ثابت به‌ازای هر درخواست

پلتفرم Oxlo.ai با جایگزینی مدل توکن‌محور با قیمت‌گذاری ثابت به‌ازای هر درخواست، هزینه استنتاج مدل‌های زبانی را پیش‌بینی‌پذیر کرد. این تغییر اجازه می‌دهد توسعه‌دهندگان بدون نگرانی…

۴ دقیقه خواندن۲
دستیار هوش مصنوعی در حال تولید توضیحات صوتی محصولات فروشگاه آنلاین
آموزش کاربردی

ElevenLabs: تبدیل توصیفات متنی محصولات به صدای برند برای ارتقای دسترسی‌پذیری

توسعه‌دهندگان با استفاده از تبدیل متن به گفتار و شبیه‌سازی صدا، توصیفات متنی محصولات را به روایت‌های صوتی طبیعی تبدیل می‌کنند. این رویکرد با ارائه صدای سازگار با هویت برند، نرخ…

۶ دقیقه خواندن۱
آواتار دیجیتال تعاملی از خودم ساختم — می‌توانید با آن صحبت کنید | تک‌کرانچ

قمار ۴ میلیارد دلاری Synthesia برای جایگزینی روابط عمومی با آواتارهای تعاملی

شرکت Synthesia با معرفی پلتفرم Sessions، از ویدیوهای ایستا به سمت «عامل‌های دیجیتال» حرکت می‌کند که می‌توانند به‌جای خواندن متن، به‌صورت زنده با مخاطب گفتگو کنند. این فناوری با…

۶ دقیقه خواندن۳
سگ‌ها در حال قدم زدن روی مریخ هستند
آموزش کاربردی

سازوکار تبدیل نویز ریاضی به ویدیوهای واقع‌گرایانه در هوش مصنوعی زاینده

مدل‌های بصری مدرن با ترکیب رمزگذارهای چندوجهی و انتشار گوسی، تصاویر و ویدیوها را از دل نویز ریاضی می‌سازند. این فرآیند از تولید تصاویر دوبعدی به شبیه‌سازی فضای سه-بعدی زمان-مکان…

۸ دقیقه خواندن۳