پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

لوگوی پروژه لی ترنسلیت: مترجم زیرنویس متن‌باز با هوش مصنوعی
آموزش کاربردی

Li Translate با خط لوله متن‌باز، زیرنویس‌های هوش مصنوعی را از ترجمه لغوی نجات

پروژه Li Translate یک خط لوله (Pipeline) متن‌باز برای تولید زیرنویس است که به‌جای ترجمه کلمه به کلمه، از پردازش متنیِ مبتنی بر زمینه استفاده می‌کند. این ابزار به توسعه‌دهندگان…

۲ دقیقه خواندن۲
مدل زبانی شما واقعاً نمی‌تواند ویدیو ببیند. این کوچک‌ترین راه‌حل است (MIT)
آموزش کاربردی

داده‌های بصری در برابر زیرنویس‌ها؛ تحول در درک ویدیو توسط AI

یک ابزار متن‌باز جدید با تبدیل ویدیوها به فریم‌های آگاه از صحنه و متون زمان‌بندی‌شده، امکان مشاهده واقعی ویدیو را برای LLMها فراهم می‌کند. این متد مشکل اتکای مدل‌های چندوجهی به…

۲ دقیقه خواندن۲
انویدیا دیپ‌استریم ۹.۱ را منتشر کرد: هوش مصنوعی عاملی با ۱۳ مهارت و ردیابی سه‌بعدی چندنمایی
آموزش کاربردی

انویدیا با DeepStream 9.1 استقرار بینایی سه‌بعدی را عامل‌محور کرد

انویدیا نسخه ۹.۱ ابزار DeepStream را منتشر کرد که از طریق مهارت‌های عامل‌محور، اجازه می‌دهد خط‌لوله‌های پیچیده بینایی ماشین با زبان طبیعی طراحی شوند. این به‌روزرسانی مشکل قدیمی…

۵ دقیقه خواندن
لوگوی پروژه متن‌باز OpenMontage که دستیار کدنویسی هوشمند را به استودیوی ویدیویی تبدیل می‌کند.
آموزش کاربردی

«ستودیوی کامل ویدیو»؛ دستاورد جدید دستیارهای کدنویسی با OpenMontage

پروژه متن‌باز OpenMontage با تعریف یک خط لوله ساختارمند، دستیارهای کدنویسی AI را به کارگردان و تدوینگر ویدیو تبدیل می‌کند. این ابزار به‌جای تکیه بر یک پرامپت واحد، فرآیند تولید را…

۴ دقیقه خواندن