
گفتار در برابر تایپ؛ افت شدید کیفیت LLM در وظایف پیچیده
پژوهشی جدید نشان میدهد لایههای «پاکسازی» متن در مسیر تبدیل گفتار به نوشتار، با حذف جزئیات ساختاری، عملکرد مدلهای هوش مصنوعی را بهشدت تخریب میکنند. این افت کیفیت در وظایف…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۶ مقاله منتشر شده

پژوهشی جدید نشان میدهد لایههای «پاکسازی» متن در مسیر تبدیل گفتار به نوشتار، با حذف جزئیات ساختاری، عملکرد مدلهای هوش مصنوعی را بهشدت تخریب میکنند. این افت کیفیت در وظایف…

یک معماری جدید در فینتکها، مدلهای زبانی را بهجای سیستمهای اجرایی، به عنوان طبقهبندیکننده ساختاریافته سیاستها به کار میگیرد. این روش با قرار دادن یک JSON Schema بین مدل و…

شرکت Liquid AI مدل بینایی-زبانی LFM2.5-VL-3B را برای سختافزارهای محلی عرضه کرد. این مدل با تمرکز بر سرعت استنتاج و درک رابطهای کاربری، استانداردهای عملکرد مدلهای کوچک در لبه را…

انویدیا با معرفی خانواده مدلهای Nemotron 3، معماری هوش مصنوعی را از قوانین انتزاعی مقیاسپذیری به سمت بهینهسازی مستقیم برای سختافزار برد. این مدلها با هدف کاهش هزینه استنتاج…

تیم MiLM Plus در شیائومی ابزاری به نام PROVE معرفی کرد که کیفیت حذف اشیا از ویدیو را بدون نیاز به ویدیوهای مرجع میسنجد. این سیستم با تکیه بر ویژگیهای DINOv2، همبستگی بسیار…

پیادهسازی APIهای تبدیل متن به تصویر در برنامههای چندکاربره اغلب به دلیل قطع اتصال شبکه، منجر به پرداخت هزینههای مضاعف میشود. معماری جدیدی بر پایه کلیدهای یکتایی و دفتر کل…

یک گردشکار جدید برای مدلهای تبدیل تصویر به ویدیو، تمرکز را از نتایج تصادفی به یک سامانه ارزیابی کنترلشده تغییر میدهد. سازندگان اکنون میتوانند با ردیابی پنج معیار انسجام،…

مایکروسافت با ترکیب سیستمهای تبدیل سریع گفتار به متن و Foundry IQ، امکان تبدیل ضبطهای صوتی جلسات به پایگاههای دانش قابل جستوجو را فراهم کرد. این زیرساخت به عاملهای هوش مصنوعی…

اپلیکیشن Gemini گوگل با جذب یک میلیارد کاربر ماهانه، رکورد سریعترین رشد محصول در تاریخ این شرکت را شکست. این جهش مدیون تغییر رویکرد به تعاملات صوتی و عرضه قابلیتهای عاملمحور…

مدل Pony Diffusion V6 XL یک جایگزین رایگان و متنباز برای تولید تصاویر با استایلهای خاص و شناسایی دقیق شخصیتهاست. این مدل با استفاده از سیستم برچسبگذاری کیفی، محدودیتهای…

پلتفرم Poppy AI با معرفی یک بوم بصری، امکان اتصال مستقیم منابعی مانند ویدیوهای یوتیوب و فایلهای PDF را برای تولید محتوا فراهم کرد. این رویکرد نیاز به توضیح مکرر زمینه (Context)…

برای اپلیکیشنهای فعال در اتحادیه اروپا، اقامت دادهها و گزارشهای SOC-2 پیشنیازهای غیرقابلمذاکرهای هستند که باید پیش از ارزیابی دقت تبدیل صوت به متن بررسی شوند. معماری…