پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۰ مقاله منتشر شده

AHA-WAM: کاهش ۴.۵۹ برابری تأخیر در کنترل رباتیک با مدل‌سازی نامتقارن جهان

AHA-WAM: کاهش ۴.۵۹ برابری تأخیر در کنترل رباتیک با مدل‌سازی نامتقارن جهان

چارچوب AHA-WAM با جداسازی پیش‌بینی جهان از اجرای عملیات، تأخیر کنترل بسته-حلقه در ربات‌ها را ۴.۵۹ برابر کاهش داده است. این معماری مبتنی بر ترنسفورمرهای انتشار دوگانه، امکان کنترل…

۲ دقیقه خواندن۲
چرا نمرات «شروع سرد» برای سنجش قابلیت یادگیری عامل‌های VLM کافی نیستند؟

چرا نمرات «شروع سرد» برای سنجش قابلیت یادگیری عامل‌های VLM کافی نیستند؟

پژوهشگران بنچمارک OmniGameArena را برای اندازه‌گیری نحوه بهبود عامل‌های مدل زبانی-دیداری از طریق بازتاب خودکار معرفی کرده‌اند. برخلاف تابلوهای امتیازات ایستا، این سیستم مسیر…

۱ دقیقه خواندن
MeCo: اصلاح تک‌مرحله‌ای با MeanFlow برای ارتقای کیفیت جداسازی گفتار به سطح SOTA

MeCo: اصلاح تک‌مرحله‌ای با MeanFlow برای ارتقای کیفیت جداسازی گفتار به سطح SOTA

سیستم MeCo با استفاده از رویکرد MeanFlow، شکاف میان معیارهای ریاضی و کیفیت شنیداری انسان در جداسازی گفتار چندکاناله را پر می‌کند. این مدل یک «اصلاح‌گر» تک‌مرحله‌ای است که…

۱ دقیقه خواندن
چگونه «باز کردن قفل» مدل‌های معلم، دقت تشخیص ناهماهنگی‌های صنعتی را بالا برد؟

چگونه «باز کردن قفل» مدل‌های معلم، دقت تشخیص ناهماهنگی‌های صنعتی را بالا برد؟

یک چارچوب جدید برای تشخیص ناهماهنگی‌های صنعتی با ترکیب پرومپت‌های بصری و نظارت دوقلو، مشکل تغییرات مقیاس و نورپردازی در محیط‌های واقعی را حل کرده است. این روش در بنچمارک AeBAD،…

۱ دقیقه خواندن۱
کاهش محاسبات بصری در MLLM با سازوکار ادغام لایه‌های انتهایی DPVR-LF

کاهش محاسبات بصری در MLLM با سازوکار ادغام لایه‌های انتهایی DPVR-LF

پژوهشگران دریافتند که توکن‌های بصری در مدل‌های چندوجهی پیش از رسیدن به لایه‌های نهایی اشباع می‌شوند. چارچوب DPVR-LF با مسیریابی این توکن‌ها به یک شاخه جانبی، عملکرد مدل را با تنها…

۲ دقیقه خواندن
چرا مدل‌های چندوجهی در تشخیص ناهماهنگی‌های تاریخی شکست می‌خورند؟

چرا مدل‌های چندوجهی در تشخیص ناهماهنگی‌های تاریخی شکست می‌خورند؟

محققان مجموعه‌داده‌ی ArtiFact را شامل بیش از ۶۵۰ هزار رکورد میراث فرهنگی منتشر کردند. این بنچمارک فاش می‌کند که سیستم‌های فعلی هوش مصنوعی در تشخیص ناهماهنگی‌های تاریخی ظریف و…

۱ دقیقه خواندن
برتری V-JEPA در کدگذاری قوانین فیزیک: تحلیل لایه‌ای مدل‌های بنیادی ویدیو

برتری V-JEPA در کدگذاری قوانین فیزیک: تحلیل لایه‌ای مدل‌های بنیادی ویدیو

تحلیلی بر مدل‌های بنیادی ویدیو نشان می‌دهد که V-JEPA در درک قوانین فیزیک شهودی را به مدل‌های مبتنی بر انتشار و بازسازی پیشی می‌برد. این یافته‌ها تأیید می‌کند که هدف پیش‌آموزش…

۱ دقیقه خواندن
سازه ReCoVLA: تبدیل VLM به انتخابگر پاداش برای بازیابی خطاهای رباتیک

سازه ReCoVLA: تبدیل VLM به انتخابگر پاداش برای بازیابی خطاهای رباتیک

چارچوب ReCoVLA با استفاده از مدل‌های چندوجهی برای هدایت پاداش‌ها، توانایی ربات‌ها در بازیابی از شکست‌ها را بدون نیاز به بازآموزی سیاست اصلی افزایش می‌دهد. این روش نرخ موفقیت…

۱ دقیقه خواندن
دستیابی به دقت ۹۸ درصدی در طبقه‌بندی عیوب STEM با مدل‌های زمینه‌آگاه

دستیابی به دقت ۹۸ درصدی در طبقه‌بندی عیوب STEM با مدل‌های زمینه‌آگاه

یک چارچوب جدید یادگیری عمیق با ادغام داده‌های تصویری و متادیتای تجربی، مشکل ابهام کنتراست در میکروسکوپ‌های الکترونی را حل کرده است. این سیستم در طبقه‌بندی عیوب تصویربرداری با…

۱ دقیقه خواندن
توت‌فرنگی عجیب با شکلی شبیه شکم باردار

«شستشوی زیبایی‌شناختی»؛ سازوکاری برای دور زدن فیلترهای ایمنی در درام‌های میوه‌ای

یک تحلیل آکادمیک نشان می‌دهد درام‌های کوتاه تولیدشده توسط هوش مصنوعی، از زیبایی‌شناسی «بانمک» برای پنهان کردن کلیشه‌های جنسیتی و نژادی استفاده می‌کنند. این متد که «شستشوی…

۱ دقیقه خواندن
مدل CT-VAM: دستیابی به عملکرد VLAهای غول‌پیکر با تنها ۶۸ میلیون پارامتر

مدل CT-VAM: دستیابی به عملکرد VLAهای غول‌پیکر با تنها ۶۸ میلیون پارامتر

مدل جدید CT-VAM با استفاده از معماری الهام‌گرفته از سیستم عصبی انسان، موفق شد با ۶۸ میلیون پارامتر، عملکرد مدل‌های عظیم بینایی-زبانی-کنشی (VLA) را در کنترل ربات‌ها بازتولید کند.…

۱ دقیقه خواندن