پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۵ مقاله منتشر شده

جمینی رایگان در آمریکا: دسترسی به ساخت تصویر شخصی از گوگل فوتوز برای همه باز نشده — قبل از دسترسی به عکس‌ها این موارد را بررس
آموزش کاربردی

تولید تصویر با داده‌های شخصی؛ Gemini چگونه حریم خصوصی را بازتعریف می‌کند؟

گوگل به بخشی از کاربران ایالات متحده اجازه داد تا از عکس‌های شخصی خود در Google Photos به‌عنوان زمینه مستقیم برای تولید تصویر در Gemini استفاده کنند. این تغییر، تمرکز کاربر را از…

۳ دقیقه خواندن۴
پشتیبانی روز صفر MiniMax H3 در ComfyUI: وزن‌های باز، صدای بومی و ویدیوی ۲K
آموزش کاربردی

مدل MiniMax H3 مصرف حافظه گرافیکی را برای تولید ویدیوهای 2K تا ۶۶٪ کاهش داد

شرکت MiniMax مدل H3 را با وزن‌های باز منتشر کرد که تولید ویدیوهای 2K همراه با صدای استریو را ممکن می‌سازد. به‌ دلیل بهینه‌سازی‌های شدید در وزن‌ها، این مدل اکنون روی کارت‌های…

۲ دقیقه خواندن۳
برش ۹:۱۶ قبل از خرج کردن اعتبار: نکته‌ای برای تبدیل عکس به ویدیوی کوتاه با هوش مصنوعی
آموزش کاربردی

برش دستی تصاویر ۹:۱۶؛ راهکاری برای رفع تاری و اعوجاج در ویدیوهای هوش مصنوعی

یک گردش‌کار جدید برای مدل‌های تبدیل تصویر به ویدیو، از طریق برش دستی عکس‌ها به نسبت ۹:۱۶ پیش از آپلود، مانع از افت کیفیت می‌شود. با جداسازی ترکیب‌بندی از حرکت در پرامپت، کاربران…

۲ دقیقه خواندن۵
لوگوی نرم‌افزار Likeness Lock نسخه ۲.۴ با پس‌زمینه تیره و نماد قفل دیجیتال آبی رنگ
آموزش کاربردی

مدل‌های دیجیتال در برابر عکاسی فیزیکی در کمپین‌های تجارت الکترونیک

نسخه ۲.۴ ابزار Likeness Lock با تضمین تداوم چهره و لباس در ویدیوهای تولید شده با هوش مصنوعی، نیاز به عکاسی‌های مکرر فیزیکی را از بین برد. این سیستم اکنون اجازه می‌دهد برندهای…

۱ دقیقه خواندن۱
هم‌بنیان‌گذار اوپن‌ای‌ای در جستجوی «ویب تست» بعدی هوش مصنوعی: از تک‌شاخ تا پلیکان و سرزمین میانه

کارپاتی: تبدیل توصیفات تولکین به محیط‌های سه‌بعدی توسط Claude Opus 5

اندریج کارپاتی با استفاده از مدل Claude Opus 5، توصیفات ادبی کتاب «ارباب حلقه‌ها» را به محیط‌های گرافیکی سه‌بعدی در مرورگر تبدیل کرد. این آزمایش نشان می‌دهد که هوش مصنوعی در حال…

۲ دقیقه خواندن
تشخیص چهره هوشمند: فراتر از قفل صفحه، تجربه‌ای نوین در دنیای دیجیتال
آموزش کاربردی

«احراز هویت پیچیده»؛ هدف جدید اپلیکیشن‌های بازشناسی چهره

سیستم‌های بازشناسی چهره از امنیت ساده‌ی دستگاه‌ها به سمت احراز هویت پیچیده و خرده‌فروشی شخصی‌سازی‌شده حرکت می‌کنند. مدل‌های جدید یادگیری عمیق اکنون قادرند چهره‌ها را حتی با وجود…

۴ دقیقه خواندن۲
نقشه آموزش جهان آلی‌بابا با یک پردازنده گرافیکی به مدت ۲۴ ساعت اجرا شد

«تثبیت بصری ۲۴ ساعته»؛ دستاورد جدید علی‌بابا در مدل‌های جهانی

پلتفرم Amap متعلق به علی‌بابا مدلی را معرفی کرد که می‌تواند محیط‌های تعاملی هوش مصنوعی را به مدت ۲۴ ساعت بدون فروپاشی بصری روی یک کارت گرافیک مصرف‌کننده اجرا کند. این دستاورد با…

۴ دقیقه خواندن۱
نقش مدل‌های زبانی بزرگ در چت‌بات‌ها و دستیارهای مجازی
آموزش کاربردی

دستیارهای پویا در برابر چت‌بات‌های مبتنی بر کلمات کلیدی

مدل‌های زبانی بزرگ در حال جایگزینی چت‌بات‌های قدیمی مبتنی بر کلمات کلیدی هستند. این تغییر اجازه می‌دهد دستیاران هوشمند به جای دنبال کردن مسیرهای ثابت، خودشان جریان کاری را در لحظه…

۲ دقیقه خواندن۴
مدل جستجوی نوروسمبولیک Ontology 1 با دقت ۲.۷ برابر موتورهای جستجوی برتر تجارت الکترونیک جهان

مدل Ontology 1 دقت جست‌وجوی محصولات را در برابر گوگل و آمازون بالا برد

شرکت Onton مدل هوش مصنوعی Neurosymbolic را معرفی کرد که با استفاده از گراف دانش، در پاسخ به پرس‌وجوهای پیچیده تجاری، گوگل شاپینگ و آمازون را شکست می‌دهد. این مدل به‌جای تکیه بر…

۴ دقیقه خواندن۲