پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۶ مقاله منتشر شده

تصویر: نمونه‌ای از خروجی مقاله که در آن نشانگرهای تفکر یا توکن‌های ویژه در متن نهایی ظاهر شده‌اند.
آموزش کاربردی

مقایسه‌ی مدل‌های چینی؛ DeepSeek و Qwen هزینه‌ی استنتاج را به کف رساندند

بررسی چهار خانواده مدل برتر چینی نشان می‌دهد که این مدل‌ها اکنون با قیمت‌هایی بسیار پایین‌تر و عملکردی رقابتی در برابر غول‌های غربی قرار دارند. تحلیل‌ها DeepSeek را برای کدنویسی…

۸ دقیقه خواندن۱
مقایسه دو روش هوش مصنوعی: تبدیل متن به میم در برابر تبدیل تصویر به میم
سرگرمی و خلاقیت

متن در برابر تصویر؛ دو مسیر متفاوتی برای تولید میم‌های ویروسی

تولیدکنندگان محتوای ویروسی اکنون بین دو مسیر «متن به میم» برای ایده‌های نو و «تصویر به میم» برای شخصی‌سازی بصری انتخاب می‌کنند. این تفکیک، نقش سازنده را از یک ویرایشگر دستی به یک…

۴ دقیقه خواندن
انتشار Audex توسط انویدیا: مدل زبانی یکپارچه صدا-متن با حفظ هوشمتدی متنی مدل پایه

مدل Audex انویدیا دلیل افت استدلال متنی در سیستم‌های چندوجهی را حل کرد

انویدیا مدل Audex را معرفی کرد؛ یک مدل ۳۰ میلیارد پارامتری که بدون کاهش توان استدلالی، صوت و متن را پردازش می‌کند. این مدل یکی از معدود مدل‌های وزن‌باز است که می‌تواند صداهای…

۵ دقیقه خواندن
مدل تصویرسازی Muse متا می‌تواند کاربران دیگر اینستاگرام را در عکس‌های هوش مصنوعی جای دهد.

«ادغام هویت کاربران»؛ قابلیت جدید Meta برای شخصی‌سازی عکس‌های تولیدی

متا مدل Muse Image را برای ادغام شباهت ظاهری کاربران تگ‌شده در اینستاگرام در عکس‌های تولیدی هوش مصنوعی عرضه کرد. این مدل عامل‌محور جایگزین Llama در ابزارهای تصویری متا شده و…

۲ دقیقه خواندن
ویرایشگر ویدیوی داخلی به اپ X برای iOS اضافه شد

X با ابزار تدوین ویدیو در iOS به جنگ بازنشرهای تیک‌تاک آمد

پلتفرم X برای کاهش نرخ بازنشر کلیپ‌ها و تشویق تولید محتوای اصیل، ویرایشگر و ضبط‌کننده داخلی ویدیو را برای iOS عرضه کرد. این اقدام علاوه بر رقابت با تیک‌تاک، هدف تامین داده‌های…

۲ دقیقه خواندن