پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۷ مقاله منتشر شده

شرط ۲.۳ میلیارد دلاری جنرال اینتویشن: بازی‌های ویدیویی می‌توانند عامل‌های هوش مصنوعی را برای دنیای واقعی آموزش دهند.

آموزش ربات‌ها با داده‌های بازی‌های ویدئویی؛ کاهش زمان یادگیری به ۸ دقیقه

استارتاپ General Intuition با استفاده از میلیون‌ها ساعت داده‌های بازی‌های ویدئویی، مدلی بنیادی برای هوش مصنوعی فیزیکی ساخته است. این روش اجازه می‌دهد ربات‌ها حرکات پیچیده را با…

۳ دقیقه خواندن
ویژگی جدید «ریمیکس ویدیو» گوگل برای مشترکان هوش مصنوعی رونمایی شد

گوگل با قابلیت Video Remix خاطرات تصویری را به استودیو تولید تبدیل کرد

گوگل ابزار Video Remix را برای مشترکان سرویس‌های هوش مصنوعی خود عرضه کرد. این قابلیت با بهره‌گیری از مدل Gemini Omni، امکان تغییر سبک، نورپردازی و پس‌زمینه ویدیوهای ذخیره شده را…

۲ دقیقه خواندن
مدیرعامل: داده‌های بازی ویدیویی برای آموزش هوش مصنوعی از اینترنت بهترند

داده‌های بازی‌های ویدئویی در برابر وب برای آموزش درک مکانی هوش مصنوعی

استارت‌آپ General Intuition با استفاده از داده‌های بازی‌های ویدئویی، در حال آموزش هوش مصنوعی برای درک حرکت اشیاء در مکان و زمان است. این شرکت با جذب ۳۲۰ میلیون دلار سرمایه، قصد…

۲ دقیقه خواندن۱
تصویر: نمونه‌ای از خروجی مقاله که در آن نشانگرهای تفکر یا توکن‌های ویژه در متن نهایی ظاهر شده‌اند.
آموزش کاربردی

مقایسه‌ی مدل‌های چینی؛ DeepSeek و Qwen هزینه‌ی استنتاج را به کف رساندند

بررسی چهار خانواده مدل برتر چینی نشان می‌دهد که این مدل‌ها اکنون با قیمت‌هایی بسیار پایین‌تر و عملکردی رقابتی در برابر غول‌های غربی قرار دارند. تحلیل‌ها DeepSeek را برای کدنویسی…

۸ دقیقه خواندن۱
مقایسه دو روش هوش مصنوعی: تبدیل متن به میم در برابر تبدیل تصویر به میم

متن در برابر تصویر؛ دو مسیر متفاوتی برای تولید میم‌های ویروسی

تولیدکنندگان محتوای ویروسی اکنون بین دو مسیر «متن به میم» برای ایده‌های نو و «تصویر به میم» برای شخصی‌سازی بصری انتخاب می‌کنند. این تفکیک، نقش سازنده را از یک ویرایشگر دستی به یک…

۴ دقیقه خواندن۱
انتشار Audex توسط انویدیا: مدل زبانی یکپارچه صدا-متن با حفظ هوشمتدی متنی مدل پایه

مدل Audex انویدیا دلیل افت استدلال متنی در سیستم‌های چندوجهی را حل کرد

انویدیا مدل Audex را معرفی کرد؛ یک مدل ۳۰ میلیارد پارامتری که بدون کاهش توان استدلالی، صوت و متن را پردازش می‌کند. این مدل یکی از معدود مدل‌های وزن‌باز است که می‌تواند صداهای…

۵ دقیقه خواندن۲
مدل تصویرسازی Muse متا می‌تواند کاربران دیگر اینستاگرام را در عکس‌های هوش مصنوعی جای دهد.

«ادغام هویت کاربران»؛ قابلیت جدید Meta برای شخصی‌سازی عکس‌های تولیدی

متا مدل Muse Image را برای ادغام شباهت ظاهری کاربران تگ‌شده در اینستاگرام در عکس‌های تولیدی هوش مصنوعی عرضه کرد. این مدل عامل‌محور جایگزین Llama در ابزارهای تصویری متا شده و…

۲ دقیقه خواندن۱