
متن در برابر تصویر؛ دو مسیر متفاوتی برای تولید میمهای ویروسی
تولیدکنندگان محتوای ویروسی اکنون بین دو مسیر «متن به میم» برای ایدههای نو و «تصویر به میم» برای شخصیسازی بصری انتخاب میکنند. این تفکیک، نقش سازنده را از یک ویرایشگر دستی به یک…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

تولیدکنندگان محتوای ویروسی اکنون بین دو مسیر «متن به میم» برای ایدههای نو و «تصویر به میم» برای شخصیسازی بصری انتخاب میکنند. این تفکیک، نقش سازنده را از یک ویرایشگر دستی به یک…

انویدیا و هانینگفیس با ادغام مدل GR00T 1.7 و یک مجموعه داده عظیم در کتابخانه LeRobot، دسترسی به آموزش هوش مصنوعی فیزیکی را تسهیل کردند. این اقدام در حالی رخ میدهد که ریسکهای…

انویدیا مدل Audex را معرفی کرد؛ یک مدل ۳۰ میلیارد پارامتری که بدون کاهش توان استدلالی، صوت و متن را پردازش میکند. این مدل یکی از معدود مدلهای وزنباز است که میتواند صداهای…

مدل جدید Muse Image متعلق به متا به کاربران اجازه میدهد با تگ کردن پروفایلهای عمومی، تصاویری با شباهت چهره آنها تولید کنند. برای توقف این دسترسی، کاربران باید بهصورت دستی…

متا مدل Muse Image را برای ادغام شباهت ظاهری کاربران تگشده در اینستاگرام در عکسهای تولیدی هوش مصنوعی عرضه کرد. این مدل عاملمحور جایگزین Llama در ابزارهای تصویری متا شده و…

مدل DiffusionGemma با وجود سرعت ۴ برابری نسبت به نسلهای قبل، بهدلیل یک اختلاف فنی در پروژه llama.cpp برای کاربران ابزارهای Ollama و LM Studio در دسترس نیست. در حال حاضر تنها…

شرکت Cohere یک مدل بازمتن با ۲ میلیارد پارامتر برای تبدیل گفتار به متن در زبان عربی منتشر کرد. این مدل در مدیریت گویشهای محلی و جملات ترکیبی (عربی-انگلیسی) عملکردی برتر از…

پلتفرم X برای کاهش نرخ بازنشر کلیپها و تشویق تولید محتوای اصیل، ویرایشگر و ضبطکننده داخلی ویدیو را برای iOS عرضه کرد. این اقدام علاوه بر رقابت با تیکتاک، هدف تامین دادههای…

شرکت Solos مدل AirGo A6 را معرفی کرد؛ عینکی فوقسبک که با حذف دوربین، تمرکز خود را بر تجربه صوتی و دستیار هوشمند گذاشته است. این محصول با وزن ۱۹ گرم، جایگزینی ظریف و مناسب برای…

ویدیوهای ویروسی از ارلینگ هالند در جام جهانی ۲۰۲۶ نشان میدهند که طرفداران اکنون «داستانهای ساختگی» را به واقعیتهای مستند ترجیح میدهند. ورزشکاران در حال تبدیل شدن به پرسوناهای…

اوپنایآی دو مدل جدید API با تمرکز بر صوت معرفی کرد که یکی از آنها نسخهی بهینهی mini با قابلیت استدلال است. این بهروزرسانی با ارتقای مکانیزمهای کشینگ، تأخیر در پاسخدهی را…

ترکیب مدلهای زبانی با بینایی ماشین باعث انفجار توکنها و افزایش هزینهها میشود. Oxlo.ai با جایگزینی پرداخت توکنی با یک مدل قیمتگذاری ثابت برای هر درخواست، این چالش عملیاتی را…