
TimeVista: جایگزین کردن معیارهای عددی با مدلهای بینایی-زبانی در ارزیابی
پژوهشگران چارچوب TimeVista را معرفی کردهاند که با بهرهگیری از مدلهای بینایی-زبانی (VLMs)، پیشبینیهای سریهای زمانی را از طریق تحلیل نمودارها ارزیابی میکند. این رویکرد در…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۱ مقاله منتشر شده

پژوهشگران چارچوب TimeVista را معرفی کردهاند که با بهرهگیری از مدلهای بینایی-زبانی (VLMs)، پیشبینیهای سریهای زمانی را از طریق تحلیل نمودارها ارزیابی میکند. این رویکرد در…

محققان با معرفی روش «تفکر مبنیساز»، مدلهای کوچک را قادر ساختند تا گامهای استدلالی خود را به نقاط دقیق تصویر متصل کنند. این رویکرد باعث شد مدل Gemma3-4B-IT در استدلالهای مکانی،…

ماهواره YAM-9 با استفاده از مدل Gemma 3 موفق شد برای نخستین بار اهداف زمینی را بدون دخالت انسان در مدار شناسایی کند. این انتقال پردازش به لبه، گلوگاههای ارسال داده را حذف کرده و…

متا با معرفی AI Mode، پستهای عمومی و بحثهای گروههای فیسبوک را به پاسخهای مستقیم و خلاصه تبدیل میکند. این بهروزرسانی شامل ابزارهای ویرایش عکس و دستیارهای تولید محتوا است و…

پژوهشگران راهکاری برای دستیابی به مهارت گرفتن اشیاء بدون استفاده از دوربین ابداع کردهاند که صرفاً بر بازخوردهای لمسی تکیه میکند. این سیستم با استفاده از یک دوقلوی دیجیتال…

مدل BridgeVLM با تبدیل گرافهای علی به توکنهای ساختاریافته، استدلال علی را در مدلهای چندوجهی درونی کرده است. این رویکرد در وظایف پیچیده و خلاف-واقع، بهطور قابلتوجهی از…

بنچمارک جدید MedCTA نشان میدهد که پیشرفتهترین مدلهای چندوجهی در اجرای وظایف بالینی چندمرحلهای شکست میخورند. این مطالعه شکاف عمیقی را میان توانایی مدل در درک دادههای پزشکی و…

پلتفرم Argus با جایگزینی مدلهای مرجع تک-تصویری با یک موزاییک پویا و ۳x۳، مشکل تغییر هویت سوژه در ویدیوهای ساختهشده با هوش مصنوعی را حل کرده است. این رویکرد باعث میشود چهرهها…

پژوهشگران چارچوب AVIS را معرفی کردند که با مقیاسگذاری تطبیقی توکنهای بصری و مراحل استدلال، هزینه استنتاج مدلهای چندوجهی را کاهش میدهد. این سیستم بدون نیاز به آموزش مجدد، تعادل…

چارچوب MODF-SIR با ترکیب تقطیر دانش و تطبیق زمان تست، استدلالهای اجتماعی پیچیده را با بهرهگیری از تنها ۳۰٪ از مجموعهداده IntentTrain بهینهسازی کرده است. این مدل با تمرکز بر…

AutoMine با ترکیب مدلهای زبانی و بینایی، استخراج خودکار سناریوهای بحرانی رانندگی از دادههای حجیم را ممکن کرده است. این چارچوب با استفاده از حلقهی اصلاح کد، توانست در رقابت…

یک توسعهدهنده تکنفره توانست تنها در دو ماه اپلیکیشن Traverba را بسازد. او با استفاده از Claude Code، پیچیدگیهای فنی کدنویسی موبایل را حذف کرد تا روی بهینهسازی حافظه و باتری در…