پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۷ مقاله منتشر شده

تنظیم دقیق مدل‌های ویدیویی و تصویری در مقیاس بزرگ با NVIDIA NeMo Automodel و 🤗 Diffusers
آموزش کاربردی

چطور NeMo Automodel محدودیت‌های مقیاس‌پذیری در مدل‌های پخش را برطرف می‌کند؟

کتابخانه NeMo Automodel با ادغام در Diffusers، امکان تنظیم دقیق مدل‌های عظیم تصویر و ویدیو را بدون نیاز به تبدیل فرمت وزن‌ها فراهم کرد. این ابزار آموزش توزیع‌شده در مقیاس صنعتی را…

۸ دقیقه خواندن
پلیکان روی تیر چوبی در آب ایستاده، نمادی از بنچمارک پلیکان در یادگیری ماشین.

«قدرت خالص»؛ تغییر استراتژی رقابتی چین در برابر مدل‌های آمریکایی

آزمایشگاه چینی Moonshot AI مدل Kimi K3 را با ۲.۸ تریلیون پارامتر معرفی کرد که در کدنویسی و کارهای پیچیده از رقبای آمریکایی پیشی می‌گیرد. این مدل با قیمت‌گذاری جدید، گران‌ترین…

۵ دقیقه خواندن
پیش‌نمایش iOS 27: هوش مصنوعی سیری کاربردی اما ساده است

کاربردی‌گرایی در برابر تزیینات هوش مصنوعی در استراتژی جدید iOS ۲۷

اپل با انتشار بتای عمومی iOS 27، سیری را از یک فرمان‌پذیر صوتی ساده به دستیاری تبدیل کرد که بستر و زمینه کاربر را می‌فهمد. این به‌روزرسانی به‌جای تمرکز بر نمایش‌های زرق‌وبرق…

۹ دقیقه خواندن
تولید ۳۰۰ اثر هوش مصنوعی در نتفلیکس: سرعت گسترش این فناوری در صنعت سرگرمی

چگونه نتفلیکس بدون کاهش بودجه، ۳۰۰ اثر را با هوش مصنوعی بهینه‌کرد؟

نتفلیکس در سال ۲۰۲۶ هوش مصنوعی زاینده را در حدود ۳۰۰ تولید خود ادغام کرده است. این شرکت عمدتاً روی بهینه‌سازی مراحل پس‌تولید تمرکز کرده و بدون کاهش بودجه کلی محتوا، به صرفه‌جویی…

۱ دقیقه خواندن