پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

سازوکار DRAPE: انتقال از انطباق سطح-وظیفه به سطح-نمونه در مدل‌های چندوجهی

سازوکار DRAPE: انتقال از انطباق سطح-وظیفه به سطح-نمونه در مدل‌های چندوجهی

چارچوب DRAPE با جایگزینی پرامپت‌های ایستا با پرامپت‌های نرم پویا و مختص به هر نمونه، مشکل فراموشی فاجعه‌بار در مدل‌های چندوجهی را حل می‌کند. این روش با تکیه بر شرطی‌سازی بر اساس…

۲ دقیقه خواندن۱
۲.۳ میلیون نمونه داده جدید برای انتقال تحلیل ماهواره‌ای به عصر استدلال زمانی

۲.۳ میلیون نمونه داده جدید برای انتقال تحلیل ماهواره‌ای به عصر استدلال زمانی

پژوهشگران با معرفی مجموعه داده SMART-HC-VQA، تحلیل تصاویر ماهواره‌ای را از تشخیص ساده‌ی تغییرات به استدلال زمانی پیچیده ارتقا دادند. این چارچوب با بهره‌گیری از مدل LLaVA-NeXT…

۲ دقیقه خواندن
سازوکار AllocMV: مدیریت منابع محاسباتی برای حفظ ثبات بصری در ویدیوهای بلند

سازوکار AllocMV: مدیریت منابع محاسباتی برای حفظ ثبات بصری در ویدیوهای بلند

AllocMV چارچوب جدیدی است که تولید ویدیوهای موسیقی را به یک مسئله تخصیص منابع تبدیل می‌کند تا هزینه‌های محاسباتی کاهش و ثبات بصری افزایش یابد. این سیستم با استفاده از یک حل‌کننده…

۲ دقیقه خواندن
LLaVA-CKD: کاهش شکاف ظرفیت در مدل‌های بینایی-زبانی از طریق تقطیر متوالی

LLaVA-CKD: کاهش شکاف ظرفیت در مدل‌های بینایی-زبانی از طریق تقطیر متوالی

چارچوب LLaVA-CKD با معرفی ساختار آموزشی پله‌ای، مشکل افت کیفیت در انتقال دانش از مدل‌های غول‌پیکر به مدل‌های کوچک را حل کرده است. این روش با استفاده از معلمان میانی، امکان استقرار…

۲ دقیقه خواندن۲
چرا تسلط زبانی در مدل‌های چندوجهی، نشانهٔ درک درست از تصاویر ماهواره‌ای نیست؟

چرا تسلط زبانی در مدل‌های چندوجهی، نشانهٔ درک درست از تصاویر ماهواره‌ای نیست؟

پژوهشگران با معرفی بنچمارک SenseBench دریافتند که مدل‌های بینایی-زبانی در تحلیل تصاویر ماهواره‌ای دچار «توهم روانی» هستند. این مدل‌ها توصیفاتی بسیار متقاعدکننده اما از نظر فیزیکی…

۲ دقیقه خواندن۲
حل چالش توزیع دم‌دراز در مدل‌های چندوجهی با رویکرد وزن‌دهی پویا

حل چالش توزیع دم‌دراز در مدل‌های چندوجهی با رویکرد وزن‌دهی پویا

پژوهشگران چارچوب جدیدی برای رفع عدم توازن کلاس‌ها در هوش مصنوعی چندوجهی معرفی کرده‌اند. این مدل با وزن‌دهی پویا به منابع داده، سوگیری به سمت کلاس‌های اکثریت را کاهش و دقت شناسایی…

۲ دقیقه خواندن۲
چرا پروب‌های خطی کیفیت واقعی رمزگذارهای صوتی را پنهان می‌کنند؟

چرا پروب‌های خطی کیفیت واقعی رمزگذارهای صوتی را پنهان می‌کنند؟

پژوهش‌های جدید نشان می‌دهد بنچمارک‌های استاندارد زیست‌صوتی (Bioacoustic) به دلیل استفاده از پروب‌های خطی بیش از حد ساده، کیفیت رمزگذارهای صوتی را کمتر از حد واقعی تخمین می‌زنند.…

۲ دقیقه خواندن۱
چگونه توکن‌های تخصصی CoWorld-VLA خطای استدلال در رانندگی خودکار را کاهش می‌دهند؟

چگونه توکن‌های تخصصی CoWorld-VLA خطای استدلال در رانندگی خودکار را کاهش می‌دهند؟

مدل CoWorld-VLA با معرفی توکن‌های تخصصی برای داده‌های هندسی و پویا، استدلال سطح بالا را به عمل دقیق در رانندگی خودکار متصل می‌کند. این چارچوب در بنچمارک NAVSIM v1 دقت مسیر و ایمنی…

۲ دقیقه خواندن
AnomalyClaw: افزایش ۷.۹۳ واحدی AUROC در تشخیص ناهنجاری‌های بصری با رویکرد ردّیه

AnomalyClaw: افزایش ۷.۹۳ واحدی AUROC در تشخیص ناهنجاری‌های بصری با رویکرد ردّیه

عامل AnomalyClaw با جایگزینی استنتاج تک‌مرحله‌ای با یک فرآیند ردّیه چندمرحله‌ای، دقت تشخیص ناهنجاری‌های بصری را به‌طور چشم‌گیری افزایش می‌دهد. این ابزار بدون نیاز به آموزش مجدد،…

۲ دقیقه خواندن
گزارش PrimeKG-CL: اثر ۶۰ درصدی ویژگی‌های چندوجهی بر دقت مدل‌های زیست‌پزشکی

گزارش PrimeKG-CL: اثر ۶۰ درصدی ویژگی‌های چندوجهی بر دقت مدل‌های زیست‌پزشکی

بنچمارک جدید PrimeKG-CL نشان می‌دهد که استفاده از ویژگی‌های چندوجهی می‌تواند دقت وظایف هوش مصنوعی در حوزه زیست‌پزشکی را تا ۶۰٪ افزایش دهد. این مطالعه همچنین شکست‌های جدی در…

۲ دقیقه خواندن
رمزگشایی از MoPO: حذف لرزش در مدل‌های سه بعدی با الگوهای حرکتی

رمزگشایی از MoPO: حذف لرزش در مدل‌های سه بعدی با الگوهای حرکتی

چارچوب MoPO با معرفی مکانیسم پیش‌فرض‌های حرکتی، مشکل لرزش و عدم دقت در بازسازی مش‌های انسانی هنگام انسداد (Occlusion) را حل می‌کند. این مدل با استفاده از داده‌های تاریخی ژست‌ها،…

۲ دقیقه خواندن