
BareWave: حذف نمایشهای آکوستیکی برای تولید مستقیم موج صوتی از متن
چارچوب BareWave با حذف نمایشهای میانی و مراحل کدگشایی، امکان تولید مستقیم موجهای صوتی را از روی متن فراهم میکند. این رویکرد پیچیدگی مسیر استنتاج را کاهش داده و در عین حال کیفیت…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۰ مقاله منتشر شده

چارچوب BareWave با حذف نمایشهای میانی و مراحل کدگشایی، امکان تولید مستقیم موجهای صوتی را از روی متن فراهم میکند. این رویکرد پیچیدگی مسیر استنتاج را کاهش داده و در عین حال کیفیت…

پژوهشگران چارچوب TLDR را معرفی کردند که با گروهبندی توکنهای صوتی در قالب «وصلههای» فشرده، سرعت استنتاج در سیستمهای تبدیل متن به گفتار را ۱.۸ برابر افزایش میدهد. این روش بدون…

پژوهشگران با توسعهی خانوادهی مدلهای NutriMLLM، توانستهاند ۶۵ ریزمغذی مختلف را از روی تصاویر غذا تخمین بزنند. این دستاورد از طریق تولید ۱.۱ میلیون تصویر مصنوعی بر اساس دادههای…

پژوهشگران یک چارچوب بینایی-زبانی دو-مرحلهای طراحی کردهاند که قادر است خطاهای خود را در تشخیص نقصهای لیتوگرافی شناسایی و اصلاح کند. این سیستم با آموزش یک ماژول پالایش روی…

پژوهشگران با معرفی SpineAgent، سیستمی عاملمحور ساختهاند که گزارشهای پیچیده MRI ستون فقرات را از طریق هماهنگی ۳۷ عامل تخصصی تولید میکند. این مدل با آموزش روی ۱۳ میلیون برش…

پژوهشگران متد جدیدی به نام «استدلال بصری» را معرفی کردهاند که تحلیلهای متنی داخلی را با نمایشهای تصویری جایگزین میکند. این رویکرد بدون کاهش دقت، حجم توکنهای مورد نیاز برای…

عامل جدید SuperBrowser با دستیابی به نرخ موفقیت ۸۹.۴۷ درصدی در بنچمارک Mind2Web Hard، استانداردهای ناوبری وب را جابهجا کرد. این سیستم به جای پردازش جامع دادههای صفحه، از مکانیزم…

بنچمارک جدید IMUG-Bench نشان میدهد مدلهای چندوجهی یکپارچه در حفظ سازگاری طی گفتگوهای طولانی با تصاویر شکست میخورند. این پژوهش ثابت میکند «سوگیری مواجهه» عامل اصلی خطاهاست و…

پژوهشگران با معرفی VisShield و مجموعهدادهی OPTIC، چارچوبی برای شناسایی و ماسکگذاری دقیق اطلاعات خصوصی در مدلهای بینایی-زبانی (VLMs) ارائه کردند. این رویکرد ریسک نشت دادههای…

چهارچوب AlloSpatial با تبدیل دیدهای محدود به نقشههای جهانی، مشکل «شکنندگی مکانی» در مدلهای چندوجهی را حل کرده است. این سیستم استدلال فضایی در مدلهایی مانند Qwen3-VL را تا ۱۸٪…

سیستم Baichuan-M4 رویکرد هوش مصنوعی در پزشکی را از پاسخهای تکمرحلهای به «مراقبت مستمر» تغییر میدهد. این سامانه با بهرهگیری از معماری عاملمحور (Agentic) و آموزش تخصصی RL، نرخ…

سامانهی مسیریابی ARMS با بهرهگیری از یک مجموعهدادهی تخصصی، قادر است بهینهترین مدل چندوجهی را برای هر پرسوجو انتخاب کند. این سیستم با وجود ابعاد بسیار کوچکتر، در دقت انتخاب…