
حل چالش توزیع دمدراز در مدلهای چندوجهی با رویکرد وزندهی پویا
پژوهشگران چارچوب جدیدی برای رفع عدم توازن کلاسها در هوش مصنوعی چندوجهی معرفی کردهاند. این مدل با وزندهی پویا به منابع داده، سوگیری به سمت کلاسهای اکثریت را کاهش و دقت شناسایی…
موضوع
Models that natively process text+image+audio+video
۸۶۱ مقاله منتشر شده

پژوهشگران چارچوب جدیدی برای رفع عدم توازن کلاسها در هوش مصنوعی چندوجهی معرفی کردهاند. این مدل با وزندهی پویا به منابع داده، سوگیری به سمت کلاسهای اکثریت را کاهش و دقت شناسایی…

پژوهشهای جدید نشان میدهد بنچمارکهای استاندارد زیستصوتی (Bioacoustic) به دلیل استفاده از پروبهای خطی بیش از حد ساده، کیفیت رمزگذارهای صوتی را کمتر از حد واقعی تخمین میزنند.…

مدل CoWorld-VLA با معرفی توکنهای تخصصی برای دادههای هندسی و پویا، استدلال سطح بالا را به عمل دقیق در رانندگی خودکار متصل میکند. این چارچوب در بنچمارک NAVSIM v1 دقت مسیر و ایمنی…

عامل AnomalyClaw با جایگزینی استنتاج تکمرحلهای با یک فرآیند ردّیه چندمرحلهای، دقت تشخیص ناهنجاریهای بصری را بهطور چشمگیری افزایش میدهد. این ابزار بدون نیاز به آموزش مجدد،…

تیم Phoenix و Mistral AI مدل Phoenix-VL 1.5 Medium را معرفی کردند؛ یک مدل چندوجهی با ۱۲۳ میلیارد پارامتر که در عین حفظ توانمندیهای جهانی در STEM، در حقوق و فرهنگ سنگاپور به سطح…

بنچمارک جدید PrimeKG-CL نشان میدهد که استفاده از ویژگیهای چندوجهی میتواند دقت وظایف هوش مصنوعی در حوزه زیستپزشکی را تا ۶۰٪ افزایش دهد. این مطالعه همچنین شکستهای جدی در…

چارچوب MoPO با معرفی مکانیسم پیشفرضهای حرکتی، مشکل لرزش و عدم دقت در بازسازی مشهای انسانی هنگام انسداد (Occlusion) را حل میکند. این مدل با استفاده از دادههای تاریخی ژستها،…

یک مدل تخصصی با نام Fashion Florence با تنها ۰.۷۷ میلیارد پارامتر، در استخراج دادههای ساختاریافتهی مد از تصاویر، مدلهای پیشرویی چون GPT-4o-mini را شکست داد. این دستاورد نشان…

بنچمارک جدید BenchCAD نشان میدهد مدلهای پیشرو در عین توانایی در تقلید بصری، در تولید کدهای پارامتریک دقیق برای تولید صنعتی شکست میخورند. این مطالعه شکاف عمیق میان استدلال فضایی…

چارچوب استدلالی جدیدی به نام SFFL با تفکیک مسیرهای استدلال برای هر مودالیته، توهمات در مدلهای زبانی چندوجهی را بهطور چشمگیری کاهش داده است. این متد دقت کلی را ۵.۱۶٪ و نرخ کاهش…

چارچوب جدیدی به نام Deep Arguing با ادغام یادگیری عمیق و منطق استدلالی، پیشبینیهای هوش مصنوعی را تفسیرپذیر میکند. این مدل بدون کاهش دقت، دادهها را به عنوان استدلالهایی برای…

چارچوب GuardAD با تبدیل ایمنی به یک وضعیت منطقی پویا، نرخ تصادفات در مدلهای زبانی چندوجهی (MLLM) را ۳۲.۰۷٪ کاهش داده است. این سیستم بدون نیاز به بازآموزی مدل، خطرات پنهان را…