پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۸ مقاله منتشر شده

انویدیا دیپ‌استریم ۹.۱ را منتشر کرد: هوش مصنوعی عاملی با ۱۳ مهارت و ردیابی سه‌بعدی چندنمایی
آموزش کاربردی

انویدیا با DeepStream 9.1 استقرار بینایی سه‌بعدی را عامل‌محور کرد

انویدیا نسخه ۹.۱ ابزار DeepStream را منتشر کرد که از طریق مهارت‌های عامل‌محور، اجازه می‌دهد خط‌لوله‌های پیچیده بینایی ماشین با زبان طبیعی طراحی شوند. این به‌روزرسانی مشکل قدیمی…

۵ دقیقه خواندن
لوگوی پروژه متن‌باز OpenMontage که دستیار کدنویسی هوشمند را به استودیوی ویدیویی تبدیل می‌کند.
آموزش کاربردی

«ستودیوی کامل ویدیو»؛ دستاورد جدید دستیارهای کدنویسی با OpenMontage

پروژه متن‌باز OpenMontage با تعریف یک خط لوله ساختارمند، دستیارهای کدنویسی AI را به کارگردان و تدوینگر ویدیو تبدیل می‌کند. این ابزار به‌جای تکیه بر یک پرامپت واحد، فرآیند تولید را…

۴ دقیقه خواندن
تنظیم دقیق مدل‌های ویدیویی و تصویری در مقیاس بزرگ با NVIDIA NeMo Automodel و 🤗 Diffusers
آموزش کاربردی

چطور NeMo Automodel محدودیت‌های مقیاس‌پذیری در مدل‌های پخش را برطرف می‌کند؟

کتابخانه NeMo Automodel با ادغام در Diffusers، امکان تنظیم دقیق مدل‌های عظیم تصویر و ویدیو را بدون نیاز به تبدیل فرمت وزن‌ها فراهم کرد. این ابزار آموزش توزیع‌شده در مقیاس صنعتی را…

۸ دقیقه خواندن
پلیکان روی تیر چوبی در آب ایستاده، نمادی از بنچمارک پلیکان در یادگیری ماشین.

«قدرت خالص»؛ تغییر استراتژی رقابتی چین در برابر مدل‌های آمریکایی

آزمایشگاه چینی Moonshot AI مدل Kimi K3 را با ۲.۸ تریلیون پارامتر معرفی کرد که در کدنویسی و کارهای پیچیده از رقبای آمریکایی پیشی می‌گیرد. این مدل با قیمت‌گذاری جدید، گران‌ترین…

۵ دقیقه خواندن۲
پیش‌نمایش iOS 27: هوش مصنوعی سیری کاربردی اما ساده است

کاربردی‌گرایی در برابر تزیینات هوش مصنوعی در استراتژی جدید iOS ۲۷

اپل با انتشار بتای عمومی iOS 27، سیری را از یک فرمان‌پذیر صوتی ساده به دستیاری تبدیل کرد که بستر و زمینه کاربر را می‌فهمد. این به‌روزرسانی به‌جای تمرکز بر نمایش‌های زرق‌وبرق…

۹ دقیقه خواندن۱