
چگونه FADA تحلیل تخصصی سونوگرافی جنین را به سختافزار موبایل منتقل کرد؟
مدل FADA با یکپارچهسازی تشخیص و تحلیل سونوگرافی جنین در یک خط لوله واحد، امکان تشخیص بالینی آفلاین را روی گوشیهای هوشمند فراهم کرده است. این سیستم با هدف کاهش شکاف تشخیصی در…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۰ مقاله منتشر شده

مدل FADA با یکپارچهسازی تشخیص و تحلیل سونوگرافی جنین در یک خط لوله واحد، امکان تشخیص بالینی آفلاین را روی گوشیهای هوشمند فراهم کرده است. این سیستم با هدف کاهش شکاف تشخیصی در…

پژوهشهای جدید روی مدلهای زبانی چندوجهی نشان میدهد که القای شخصیت در حالی که کیفیت توصیف تصاویر را بالا میبرد، باعث افت عملکرد در وظایف استدلالی دقیق میشود. این مطالعه همچنین…

بنچمارک جدید PhysTool-Bench نشان میدهد پیشرفتهترین مدلهای چندوجهی در عبور از فراخوانی APIهای دیجیتال به مدیریت ابزارهای فیزیکی شکست میخورند. حتی مدل Gemini-3.1-Pro به دلیل…

معرفی روش Spatial-Omni برای ادغام صدای فضایی در مدلهای زبانی چندوجهی. این سیستم با استفاده از کدگذاری FOA، بدون نیاز به تغییر در رمزگذارهای صوتی اولیه، دقت مکانیابی صدا و…

توکنایزر جدیدی به نام UniDexTok وضعیت دستهای انسان و رباتهای مختلف را به یک رابط مشترک با ۲۲ درجه آزادی منتقل میکند. این فناوری نیاز به بازنگری دستی (retargeting) را حذف کرده و…

بنچمارک جدیدی به نام ImageTime توانایی مدلهای تولید تصویر را در حفظ سازگاری بصری و علّی در توالیهای زمانی چهار مرحلهای میسنجد. این ارزیابی با استفاده از GPT-5.5 بهعنوان داور،…

پژوهشگران با معرفی روش DeBias-Attack، اثربخشی نمونههای تقابلی را در مدلهای پیشآموزشدیده بصری-زبانی (VLP) افزایش دادند. این متد با حذف سوگیریهای خاصِ مدلهای جایگزین،…

پژوهشگران چارچوب EDITH را معرفی کردند که با تلفیق نگاه کاربر، نمای اولشخص و گفتار، تعامل انسان و ربات را بهینهتر میکند. این سیستم با تبدیل سیگنالهای نویزی به زیر-وظایف، نیاز…

چارچوب جدید Visual-SDPO با استفاده از بازخوردهای بصری رندر شده، مدلهای زبانی را برای تولید کدهای دقیقتر در نمودارها و رابطهای کاربری آموزش میدهد. این روش با هدف قرار دادن…

پژوهشگران با معرفی چارچوب Architect-Ant، چیدمان خودکار پلانهای معماری را از تولید تصویر صرف به یک مسئلهی استدلالی تبدیل کردهاند. این سامانه با استفاده از یک زبان مختص دامنه…

مدلهای پیشرو در بینایی-زبان (VLM) در مواجهه با مفاهیم فیزیکی و مهندسی شکست میخورند. بنچمارک جدید EngVQA نشان میدهد که این مدلها پاسخهایی «ظاهراً متقاعدکننده» اما از نظر علمی…

یک چارچوب نظری جدید به نام Soul Computing پیشنهاد داده است که هدف آن تبدیل عاملهای هوش مصنوعی از ابزارهای کاربردی به موجوداتی با آگاهی مستقل است. این رویکرد بر ایجاد یک «هسته…