
فریب خوردن انسانها؛ حقیقت تکاندهنده دربارهی تشخیص جعل عمیق
انسانها در شناسایی جعلهای عمیق پیشرفته، بهویژه مدلهای ترکیبی صوتی-تصویری، بهشدت ناتوان هستند. این مطالعه نشان میدهد که تکیه بر شهود انسانی برای تشخیص محتوای دستکاریشده…
موضوع
Models that natively process text+image+audio+video
۱٬۳۳۶ مقاله منتشر شده

انسانها در شناسایی جعلهای عمیق پیشرفته، بهویژه مدلهای ترکیبی صوتی-تصویری، بهشدت ناتوان هستند. این مطالعه نشان میدهد که تکیه بر شهود انسانی برای تشخیص محتوای دستکاریشده…

پژوهشگران با معرفی FaithfulFaces، مشکل تغییر ناگهانی چهره در ویدیوهای تولید شده توسط هوش مصنوعی را حل کردند. این سیستم با استفاده از بردار معنایی زوایای اویلر، ثبات چهره را حتی در…

پژوهشگران چارچوب MB2L را برای همراستاسازی سیگنالهای EEG با تصاویر دیجیتال توسعه دادهاند. این سیستم با تقلید از پردازشهای قشر مغز، دقت خیرهکنندهای در بازیابی تصاویر بدون آموزش…

پژوهشگران با معرفی VocalParse، تبدیل صدای خواننده به نتهای موسیقی را خودکار کردند. این مدل با بهرهگیری از مدلهای زبانی صوتی بزرگ، مشکل همراستاسازی متن و نت را در سبکهای متنوع…

چارچوب RLFSeg با جایگزینی فرآیندهای نویزی مدلهای انتشار با «جریان اصلاحشده»، دقت بخشبندی تصاویر را متحول کرده است. این رویکرد با ایجاد نقشهبرداری مستقیم از تصویر به ماسک، سرعت…

چارچوب جدید JASTIN به مدلهای زبانی اجازه میدهد تا کیفیت صدا، گفتار و موسیقی را بدون نیاز به آموزشهای خاص و در حالت صفر-شات ارزیابی کنند. این سیستم با دستیابی به دقت در سطح…

معرفی بنچمارک DiffCap-Bench نشان داد که مدلهای تجاری در درک تفاوتهای بصری، فرسنگها از مدلهای متنباز جلوترند. این یافته ثابت میکند که صرفاً بزرگتر کردن مدلها، مشکل استدلال…

چارچوب EBOD با ادغام SAM3 و DINOv3، خطاهای تکراری در تشخیص اشیاء را بدون نیاز به آموزش مجدد مدل حذف میکند. این رویکرد هزینههای محاسباتی سنگین را کنار گذاشته و یادگیری از…

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقشآفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

اوبر با پیادهسازی یک معماری عاملمحور بر پایه OpenAI، منوهای پیچیده اپلیکیشن را با راهنماییهای صوتی و استدلالی جایگزین کرده است. این سیستم با هدف بهینهسازی درآمد رانندگان و…

استارتاپ Genesis AI با معرفی مدل بنیادی GENE-26.5 و سختافزارهای پیشرفته، قصد دارد شکاف میان دادههای آموزشی و واقعیت فیزیکی را از بین ببرد. این سیستم با استفاده از دستکشهای…

پلتفرم Mininglamp-AI با عرضه یک اکوسیستم کامل برای تراشههای اپل، امکان اجرای عاملهای گرافیکی را بهصورت کاملاً محلی فراهم کرد. این اقدام ریسکهای امنیتی آپلود دادهها در ابر را…