پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۳۳ مقاله منتشر شده

سراب عملکرد: چرا دقت بالای مدل‌های صوتی در پزشکی یک توهم خطرناک است

سراب عملکرد: چرا دقت بالای مدل‌های صوتی در پزشکی یک توهم خطرناک است

پژوهشگران ابزاری برای شناسایی همبستگی‌های کاذب در مجموعه‌داده‌های صوتی معرفی کرده‌اند که باعث تورم مصنوعی معیارهای موفقیت می‌شود. این ابزار مانع از آن می‌شود که مدل‌های AI به جای…

۲ دقیقه خواندن۱
پایان کابوس دقت در رباتیک: ATLAS چگونه مرزهای عملیاتی را بازتعریف کرد

پایان کابوس دقت در رباتیک: ATLAS چگونه مرزهای عملیاتی را بازتعریف کرد

ابزار جدید ATLAS با ترکیب داده‌های بصری و سیگنال‌های داخلی ربات، خطای مرزی در تقطیع عملیات را ۵ برابر کاهش داد. این پیشرفت، مسیر یادگیری وظایف پیچیده و طولانی‌مدت را برای ربات‌ها…

۲ دقیقه خواندن
چرا دقت ۸۵ درصدی در تحلیل اسناد، تضمین‌کننده‌ی پاسخ کامل نیست؟

چرا دقت ۸۵ درصدی در تحلیل اسناد، تضمین‌کننده‌ی پاسخ کامل نیست؟

معرفی چارچوب EnterpriseDocBench نشان می‌دهد سیستم‌های تحلیل اسناد علی‌رغم دقت بالا، در ارائه پاسخ‌های جامع شکست می‌خورند. این مطالعه همچنین برتری بازیابی ترکیبی بر بردارهای معنایی…

۲ دقیقه خواندن
CheXthought: ۶ میلیون نقطه توجه بصری برای پایان دادن به توهمات پزشکی

CheXthought: ۶ میلیون نقطه توجه بصری برای پایان دادن به توهمات پزشکی

پژوهشگران مجموعه‌داده عظیم و چندوجهی CheXthought را معرفی کردند که مسیر تفکر و نقاط تمرکز رادیولوژیست‌ها را ثبت کرده است. این ابزار با آموزش مدل‌ها برای «دیدن» مانند انسان، توهمات…

۲ دقیقه خواندن
پایان عصر رگرسیون در ناوبری فضایی: رمزگشایی از قدرت Star-Fusion

پایان عصر رگرسیون در ناوبری فضایی: رمزگشایی از قدرت Star-Fusion

مدل جدید Star-Fusion با تغییر رویکرد از رگرسیون به طبقه‌بندی گسسته، مشکل «گم‌شدن در فضا» را حل کرده است. این معماری چندوجهی با دقت ۹۳.۴ درصد و تأخیر بسیار کم، استقرار ماهواره‌های…

۲ دقیقه خواندن
رمزگشایی از قدرت پنهان داده‌های متنی در مدل‌های تشخیص گفتار

رمزگشایی از قدرت پنهان داده‌های متنی در مدل‌های تشخیص گفتار

پژوهشگران راهکاری برای استفاده از داده‌های متنی خالص جهت ارتقای مدل‌های تشخیص گفتار یافته‌اند. این مطالعه نشان می‌دهد پیکربندی‌های ساده، مانند مدل‌های مدت‌زمان تصادفی، اغلب از خط…

۲ دقیقه خواندن۱
چرا «نمی‌دانم» ارزشمندترین پاسخی است که یک VLM می‌تواند بدهد

چرا «نمی‌دانم» ارزشمندترین پاسخی است که یک VLM می‌تواند بدهد

محققان با معرفی چارچوب Visual-Idk، مدل‌های بینایی-زبانی را قادر ساختند تا مرزهای دانش خود را بشناسند و از توهمات پرهیز کنند. این متدولوژی نرخ صداقت مدل‌ها را از ۵۷.۹٪ به ۶۷.۳٪…

۲ دقیقه خواندن۲
تله‌ی LLMها در طراحی گرافیکی: وقتی مدل‌های قدیمی دقیق‌تر عمل می‌کنند

تله‌ی LLMها در طراحی گرافیکی: وقتی مدل‌های قدیمی دقیق‌تر عمل می‌کنند

پژوهشی جدید نشان می‌دهد مدل‌های ترجمه سنتی در حفظ چیدمان بصری متون، از مدل‌های زبانی بزرگ پیشی می‌گیرند. این نتیجه‌ی غیرمنتظره، نیاز صنعت طراحی به معماری‌های ترکیبی را بیش از پیش…

۲ دقیقه خواندن
پایان عصر مدل‌های ایستا: TimeMM چگونه سلیقه لحظه‌ای کاربران را پیش‌بینی می‌کند

پایان عصر مدل‌های ایستا: TimeMM چگونه سلیقه لحظه‌ای کاربران را پیش‌بینی می‌کند

پژوهشگران چارچوب TimeMM را معرفی کردند که با استفاده از فیلترینگ طیفی شرطی‌شده با زمان، تغییرات سریع سلیقه کاربران را مدل می‌کند. این سیستم با تعادل پویا میان داده‌های بصری و…

۲ دقیقه خواندن۱