
دگرگونی در تحلیل چندوجهی: Nemotron 3 و رکورد ۹ برابری سرعت در پردازش ویدئو
انویدیا با معرفی Nemotron 3 Nano Omni، استانداردهای تحلیل اسناد و ویدئو را جابهجا کرد. این مدل با معماری ترکیبی، کارایی را در پردازشهای پیچیده تا ۹ برابر افزایش داده است.
موضوع
Models that natively process text+image+audio+video
۱٬۴۱۸ مقاله منتشر شده

انویدیا با معرفی Nemotron 3 Nano Omni، استانداردهای تحلیل اسناد و ویدئو را جابهجا کرد. این مدل با معماری ترکیبی، کارایی را در پردازشهای پیچیده تا ۹ برابر افزایش داده است.

شرکت Mistral AI مدل Voxtral TTS را معرفی کرد؛ یک مدل ۴ میلیارد پارامتری که در طبیعی بودن صدا، ElevenLabs را شکست میدهد. این مدل با تأخیر بسیار کم و قابلیت تطبیق سریع صدا،…

تولید ویدئو با هوش مصنوعی از ابر به دسکتاپ نقل مکان کرده است. مدلهای جدیدی مانند HunyuanVideo کیفیت تجاری را روی سختافزارهای مصرفکننده ممکن کردهاند و نیاز به اشتراکهای…

مایکروسافت با معرفی VibeVoice، عصر خرد کردن فایلهای صوتی را به پایان رساند. این چارچوب قادر است فایلهای ۶۰ دقیقهای را در یک مرحله پردازش کند و انسجام لحن گوینده را در بازههای…

گوگل در حال آزمایش Ask YouTube است؛ قابلیتی که لیستهای سنتی جستجو را با یک رابط گفتگوی مبتنی بر هوش مصنوعی جایگزین میکند. این ابزار نتایج را به صورت ترکیبی از متن و ویدیو ارائه…

سری مدلهای جدید Qwen3-VL با معرفی معماریهای DeepStack و MRope، استانداردهای درک ویدیو را تغییر دادند. این مدلها با استفاده از همراستاسازی متنی، دقت خیرهکنندهای در شناسایی…

پلتفرم OpenMOSS با معرفی MOSS-Audio، مرزهای تحلیل صوتی را جابهجا کرد. این مدل بنیادی با معماری نوآورانه، توانسته است در نسخهی ۸ میلیاردی خود، مدلهای ۳۰ میلیاردی را در دقت تحلیل…

علیبابا دسترسی عمومی به API مدل HappyHorse 1.0 را آغاز کرد تا تولید ویدیوهای صنعتی را متحول کند. این سیستم با ارائه چهار نقطه اتصال تخصصی، مشکل قدیمی «تغییر چهره» در ویدیوهای…

متا با معرفی Sapiens2، استانداردهای بینایی ماشین را جابهجا کرد. این مدل بنیادی با آموزش روی ۱ میلیارد تصویر، پیچیدهترین حالتهای بدن انسان را با دقت ۴K بازسازی میکند.

شرکت Cohere ابزار Transcribe را برای تبدیل دقیق صدا به متن در محیطهای پر سر و صدا معرفی کرد. این سیستم با پشتیبانی از وزنهای باز و استقرار محلی، امنیت دادههای سازمانی را در ۱۴…

مدل جدید xAI با نام grok-voice-think-fast-1.0 با حذف تأخیرهای مکالمهای، رقبای خود یعنی Gemini و GPT را در بنچمارکهای صوتی شکست داد. این سیستم هماکنون در پشتیبانی مشتریان…

بنیاد LightSeek با معرفی SMG، گلوگاههای پایتون را حذف و پردازشهای سنگین را به زبان Rust منتقل کرد. این تغییر معماری باعث شد سرعت استنتاج مدل Llama-3.3 تا ۳.۵ برابر افزایش یابد.