
تشخیصدهندههای تجاری در برابر مدلهای انتشار؛ شکست در ۲۲٪ موارد
بنچمارکهای جدید نشان میدهند تشخیصدهندههای تجاری در برابر مدلهای انتشار شکست میخورند و ۲۲٪ از ویدیوهای جعلی از سد آنها میگذرند. کارشناسان خواستار جایگزینی تشخیصهای احتمالی…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۶ مقاله منتشر شده

بنچمارکهای جدید نشان میدهند تشخیصدهندههای تجاری در برابر مدلهای انتشار شکست میخورند و ۲۲٪ از ویدیوهای جعلی از سد آنها میگذرند. کارشناسان خواستار جایگزینی تشخیصهای احتمالی…

پژوهگران PreserveMy.World در حال ارزیابی پنج تکنیک بازسازی سهبعدی برای ثبت دیجیتال مکانهای تاریخی هستند. هدف این پروژه، ایجاد تعادلی میان کیفیت بصری و محدودیتهای جمعآوری داده…

ابزار جدید Ad Reframe با استفاده از هوش مصنوعی، تبلیغات عمودی ۹:۱۶ را به فرمت عریض ۱۶:۹ برای تلویزیونهای هوشمند تبدیل میکند. این سیستم بهجای استفاده از تاری یا نوارهای سیاه،…

مدل Seedance 2.0 شرکت بایتدنس با تمرکز بر تبدیل تصویر به ویدیو و همزمانی بومی صدا، اجازه میدهد کاربران با دستورات حرکتی دقیق، کلیپهای باکیفیت تولید کنند. این مدل از طریق…

اپل در بتای توسعهدهندگان iOS 27، قابلیتهای هوش مصنوعی بصری (Visual Intelligence) را مستقیماً در اپلیکیشن دوربین ادغام کرد. این تغییر باعث میشود کاربران بدون خروج از دوربین،…

تیم تحقیقاتی علیبابا مدل Wan-Streamer را معرفی کرد؛ نخستین مدل یکپارچهای که متن، صوت و ویدیو را بهطور همزمان پردازش میکند. این معماری با حذف زنجیرههای پردازش متوالی، تأخیر…

پلتفرم Aantraa با استفاده از لایهبندی مدلهای زبانی و ابزار FFmpeg، فرآیند ترجمه، دوبله و استخراج کلیپهای کوتاه را بهطور کامل خودکار کرده است. این پروژه نشان میدهد که ترکیب…

شرکت Anthropic با معرفی Claude Tag، امکان فراخوانی مشترک Claude Code را در محیط Slack فراهم کرد. این قابلیت اجازه میدهد عاملهای هوش مصنوعی با دسترسی به تاریخچه گفتگوها، وظایف…

یوتیوب برای رقابت با تیکتاک، رابط کاربری شورتس را بازطراحی کرد. در این بهروزرسانی، دکمهٔ دیسلایک حذف شده و قابلیت پخش با سرعت دو برابر جایگزین شده است.

استودیوی RenderEel برای حل مشکل رندرینگ کند و کیفیت ناپایدار در ویدیوهای هوش مصنوعی، از مدلهای تخصصی LoRA استفاده میکند. این رویکرد به فیلمسازان اجازه میدهد تا کنترل بصری…

دانشنامههای کودکان تولید شده با هوش مصنوعی، حاوی اشکالات بصری شدید و تصاویر unsettling، بازار آمازون را تسخیر کردهاند. نبود نظارت انسانی بر خروجی مدلهای پیشرفته، محتوای آموزشی…

یک چارچوب جدید به نام V-F-C به هوش مصنوعی اجازه میدهد به جای تکیه بر متون مبهم، نشانههای بصری مانند فلشها و هایلایتها را در طرحها بفهمد. این متد با اتصال بازخوردها به عناصر…