
چارچوب PROVE خطای ارزیابی حذف اشیا در ویدیوها را حذف کرد
تیم MiLM Plus در شیائومی ابزاری به نام PROVE معرفی کرد که کیفیت حذف اشیا از ویدیو را بدون نیاز به ویدیوهای مرجع میسنجد. این سیستم با تکیه بر ویژگیهای DINOv2، همبستگی بسیار…
موضوع
Models that natively process text+image+audio+video
۸۶۰ مقاله منتشر شده

تیم MiLM Plus در شیائومی ابزاری به نام PROVE معرفی کرد که کیفیت حذف اشیا از ویدیو را بدون نیاز به ویدیوهای مرجع میسنجد. این سیستم با تکیه بر ویژگیهای DINOv2، همبستگی بسیار…

پیادهسازی APIهای تبدیل متن به تصویر در برنامههای چندکاربره اغلب به دلیل قطع اتصال شبکه، منجر به پرداخت هزینههای مضاعف میشود. معماری جدیدی بر پایه کلیدهای یکتایی و دفتر کل…

یک گردشکار جدید برای مدلهای تبدیل تصویر به ویدیو، تمرکز را از نتایج تصادفی به یک سامانه ارزیابی کنترلشده تغییر میدهد. سازندگان اکنون میتوانند با ردیابی پنج معیار انسجام،…

مایکروسافت با ترکیب سیستمهای تبدیل سریع گفتار به متن و Foundry IQ، امکان تبدیل ضبطهای صوتی جلسات به پایگاههای دانش قابل جستوجو را فراهم کرد. این زیرساخت به عاملهای هوش مصنوعی…

اپلیکیشن Gemini گوگل با جذب یک میلیارد کاربر ماهانه، رکورد سریعترین رشد محصول در تاریخ این شرکت را شکست. این جهش مدیون تغییر رویکرد به تعاملات صوتی و عرضه قابلیتهای عاملمحور…

مدل Pony Diffusion V6 XL یک جایگزین رایگان و متنباز برای تولید تصاویر با استایلهای خاص و شناسایی دقیق شخصیتهاست. این مدل با استفاده از سیستم برچسبگذاری کیفی، محدودیتهای…

پلتفرم Poppy AI با معرفی یک بوم بصری، امکان اتصال مستقیم منابعی مانند ویدیوهای یوتیوب و فایلهای PDF را برای تولید محتوا فراهم کرد. این رویکرد نیاز به توضیح مکرر زمینه (Context)…

برای اپلیکیشنهای فعال در اتحادیه اروپا، اقامت دادهها و گزارشهای SOC-2 پیشنیازهای غیرقابلمذاکرهای هستند که باید پیش از ارزیابی دقت تبدیل صوت به متن بررسی شوند. معماری…

دیستیل کردن مدلهای انتشار برخلاف مدلهای متنی، به جای تقلید از یک پاسخ نهایی، بر فشردهسازی کل مسیر تبدیل نویز به تصویر تمرکز دارد. این تغییر رویکرد، آموزش هوش مصنوعی را از تقلید…

اپلیکیشن دسکتاپ SoundScript با استفاده از حافظهٔ محلی و اتوماسیون Gemini، هزینههای تولید صدای هوش مصنوعی را بهشدت کاهش میدهد. این ابزار با حذف تولیدات تکراری، از اتلاف اعتبار…

یک زیرساخت جدید با تبدیل ComfyUI به یک بکاند بدون رابط گرافیکی، تولید ویدیو و صدای همگام را از طریق APIهای پایتون ممکن کرده است. این سامانه با تطبیق هوشمند دقت مدل با حافظه VRAM،…

موتور استنتاج بومی h3.c با بهینهسازی حافظه و کوانتش int8، اجرای محلی مدل MiniMax-H3 را روی تراشههای اپل ممکن کرد. این ابزار زمان حذف نویز (Denoising) برای کلیپهای کوتاه را از…