پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۷ مقاله منتشر شده

اندروید ۱۷ با ابزارهای چندوظیفگی جدید عرضه شد؛ گوگل قابلیت‌های جمینی را گسترش می‌دهد

گوگل: دسترسی رایگان به تولید تصویر شخصی‌سازی‌شده برای کاربران آمریکا

گوگل قابلیت تولید تصویر بر اساس داده‌های شخصی حساب کاربری را برای تمامی کاربران واجد شرایط در آمریکا رایگان کرد. این ویژگی که پیش‌تر محدود به اشتراک‌های پولی بود، حالا با تکیه بر…

۲ دقیقه خواندن
ربات انسان‌نمای کارآمد در محیط اداری

Flexion Robotics با آموزش شبیه‌ساز-محور، ربات‌های انسان‌نما را به محیط اداری

استارت‌آپ سوئیسی Flexion Robotics با استفاده از یادگیری تقویتی و محیط‌های شبیه‌سازی، ربات‌های انسان‌نما را از دموهای ساده فراتر برده است. این سیستم به ربات‌ها اجازه می‌دهد وظایف…

۳ دقیقه خواندن
موسیقیدان در حال کار با رابط هوش مصنوعی برای ساخت موزیک ویدیو
آموزش کاربردی

چارچوب چهاربخشی برای رفع تناقض بصری در موزیک‌ویدیوهای هوش مصنوعی

برای تولید ویدیوهای موسیقی با کیفیت حرفه‌ای، باید از توصیفات کلی به ساختاری شامل سبک، موتیف، رنگ و ضرب‌آهنگ تغییر مسیر داد. این متد حدس‌زنی مدل را حذف و انسجام بصری بین صحنه‌ها را…

۶ دقیقه خواندن
ترکیب‌بندی گفتار با قدرت مدل‌های زبانی بزرگ: بررسی عمیق
آموزش کاربردی

پردازش سیگنال در برابر مدل‌های زبانی؛ مسیر جدید کاهش هزینه صوت

سنتز گفتار از پردازش سیگنال به سمت مدل‌سازی خودبازگشتی زبانی حرکت کرده و با صوت به عنوان توکن‌های گسسته برخورد می‌کند. این تغییر، شبیه‌سازی صفر-نمونه و لحن پویا را ممکن کرده، اما…

۴ دقیقه خواندن۱