پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۶ مقاله منتشر شده

آمازون الکسا پلاس را با پشتیبانی از زبان هندی در هند آزمایش می‌کند

بازار هند: پشتیبانی Alexa+ از زبان‌های ترکیبی برای جذب کاربران بومی

آمازون دسترسی بتای دستیار هوشمند Alexa+ را برای کاربران هندی باز کرد. هدف این اقدام، جذب میلیون‌ها کاربر native است که در گفتگوهای روزمره از ترکیب زبان‌های هندی و انگلیسی استفاده…

۲ دقیقه خواندن
همکاری گوگل دیپ‌مایند و A24 برای پژوهش در سینمای هوش مصنوعی

سرمایه‌گذاری ۷۵ میلیون دلاری گوگل دیپ‌مایند در استودیوی A24

گوگل دیپ‌مایند با سرمایه‌گذاری ۷۵ میلیون دلاری در استودیو A24، مسیر خود را از تولید ویدیوهای عمومی به سمت ابزارهای تخصصی تولید فیلم تغییر داد. هدف این همکاری، دریافت بازخوردهای…

۱ دقیقه خواندن۱
شماره ۳۶ خبرنامه هوش مصنوعی فیزیکی FutureX — ۲۳ ژوئن

سامانه Halos انویدیا: لایه‌ی ایمنی سخت‌افزاری و نرم‌افزاری برای روبوتاکسی‌ها

انویدیا با معرفی Halos، استانداردهای ایمنی خودرویی را به رباتیک صنعتی آورد تا استقرار انبوه ربات‌های انسان‌نما در کارخانه‌ها ممکن شود. این اقدام هم‌زمان با جذب سرمایه‌های کلان در…

۱۴ دقیقه خواندن
صفحه پروژه موبیوس

مدل Moebius با ۲ درصد پارامترها، کیفیت ترمیم تصاویر مدل‌های ۱۰ میلیارد‌تایی را

پژوهشگران مدل Moebius را معرفی کردند؛ چارچوبی سبک برای ترمیم تصویر (Inpainting) که با کمتر از ۲٪ پارامترهای مدل‌های غول‌آسا، کیفیتی مشابه آن‌ها ارائه می‌دهد. این مدل با دستیابی به…

۳ دقیقه خواندن۲
توافق اوپن‌ای‌ای و گتی ایمجز برای نمایش تصاویر در چت‌جی‌پی‌تی

«ادغام محتوای لایسنس‌دار»؛ تغییر استراتژی گتی ایمیجز در برابر OpenAI

گتی ایمیجز و OpenAI قراردادی چندساله برای ادغام کتابخانه‌های بصری رسمی در نتایج جست‌وجوی ChatGPT منعقد کردند. این چرخش استراتژیک توسط شرکتی رخ می‌دهد که پیش‌تر به دلیل نقض…

۲ دقیقه خواندن