پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

ضریب‌کننده متغیر: جایگزینی بخش‌های تبلیغات موفق در نسخه‌های جدید
آموزش کاربردی

Variant Multiplier هزینه تولید تبلیغات AI را با جایگزینی جراحی‌وار بخش‌ها کاهش

ابزار جدید Variant Multiplier به بازاریابان اجازه می‌دهد بدون بازسازی کامل ویدیو، تنها بخش‌های خسته‌کننده تبلیغات را جایگزین کنند. این سیستم با حفظ عناصر تبدیل‌کننده و بازنویسی…

۷ دقیقه خواندن
سه فاز تصویر فرعی هوش مصنوعی: از ضرباهنگ دستی تا برش‌های مبتنی بر بینایی
آموزش کاربردی

اتوماسیون B-Roll در تبلیغات AI با استفاده از پرامپت‌های مبتنی بر بینایی

یک خط لوله تولید ویدیو در سه مرحله، جایگذاری دستی نماهای برش (B-roll) را با تولید خودکار و مبتنی بر تحلیل بصری جایگزین کرد. این سیستم با تحلیل فریم‌های صحنه اصلی، نور و محیط را در…

۷ دقیقه خواندن
هوش مصنوعی در ارتباطات لحظه‌ای توسعه: پردازش زبان طبیعی و یادگیری ماشین برای همکاری کارآمد تیم‌های نرم‌افزاری
آموزش کاربردی

پردازش در لبه در برابر پردازش ابری برای بهینه‌سازی ارتباطات لحظه‌ای

توسعه‌دهندگان برای کاهش تأخیر در پلتفرم‌های ارتباطی، از مدل‌های هوش مصنوعی در لبه شبکه استفاده می‌کنند. این رویکرد تمرکز را از پیام‌رسانی ساده به قابلیت‌هایی مثل ترجمه هم‌زمان و…

۲ دقیقه خواندن۲
آی‌بی‌ام: مدل Granite Speech 5.0، ۳.۵ ساعت گفتار را در یک ثانیه رونویسی می‌کند

مدل Granite Speech 5.0 آی‌بی‌ام ۳.۵ ساعت صوت را در یک ثانیه تبدیل به متن می‌کند

آی‌بی‌ام دو مدل فشرده برای بازشناسی گفتار منتشر کرد که سرعت پردازش آن‌ها ۱۲ هزار برابر بیشتر از زمان واقعی است. این مدل‌ها با حذف کامل لایه زبانی، توان عملیاتی عظیمی را برای…

۴ دقیقه خواندن
تکنولوژی تشخیص چهره در سال ۲۰۲۶: ارزیابی دقت و چالش‌های پیش رو
آموزش کاربردی

دقت ۹۵ درصدی در محیط کنترل‌شده در برابر چالش‌های نورپردازی واقعی

تکنولوژی بازشناسی چهره در محیط‌های کنترل‌شده تا اوت ۲۰۲۶ به دقت ۹۵٪ رسیده است. با این حال، عملکرد این سیستم‌ها در دنیای واقعی همچنان تحت تأثیر متغیرهایی چون نورپردازی و سوگیری‌های…

۴ دقیقه خواندن۱
دوربین‌های مداربسته با هوش مصنوعی فراتر از تشخیص حرکت عمل می‌کنند
آموزش کاربردی

تحلیل ویدئویی هوشمند در برابر تشخیص سادهٔ حرکت در سیستم‌های IP

امنیت صنعتی از تشخیص سادهٔ حرکت به سمت طبقه‌بندی اشیا با هوش مصنوعی حرکت می‌کند. با افزودن یک لایه نرم‌افزاری به دوربین‌های IP موجود، اپراتورها می‌توانند بدون تعویض سخت‌افزار،…

۷ دقیقه خواندن۱
مدل متن‌باز جدید SuperQwen3.8-27b-abliterated: هوش مصنوعی بدون محدودیت محتوایی
آموزش کاربردی

مدل SuperQwen3.8 با پنجرهٔ متنی یک میلیون توکنی و ساختار بدون سانسور منتشر شد

مدل متن‌باز SuperQwen3.8-27b-abliterated با قابلیت پردازش یک میلیون توکن و حذف محدودیت‌های سانسور عرضه شده است. این مدل با استفاده از روش تنظیم دسته‌جمعی عامل‌ها، مشکلاتی نظیر…

۱ دقیقه خواندن
تصویر: ادغام درک محتوای ویدیویی و صوتی در پلتفرم مایکروسافت فاندری IQ
آموزش کاربردی

مایکروسافت ویدیوهای سازمان‌ها را به داده‌های ساختاریافته برای عامل‌های AI تبدیل

مایکروسافت با ادغام Azure Content Understanding در Foundry IQ، امکان استناد دقیق عامل‌های هوش مصنوعی به ثانیه‌ها و فریم‌های تصویری ویدیوها را فراهم کرد. این قابلیت با تبدیل…

۱۲ دقیقه خواندن۱