
چرا Darwin-180B نخستین مدل با امتیاز ۱۰۰٪ در AIME است؟
مدل استدلالی جدید شرکت VIDRAFT با ۱۸۰ میلیارد پارامتر، برای نخستین بار توانست در بنچمارکهای سختگیرانه AIME و HMMT ۲۰۲۶ به امتیاز ۱۰۰٪ دست یابد. این مدل با بهرهگیری از مکانیزم…
موضوع
Models that natively process text+image+audio+video
۱٬۴۱۸ مقاله منتشر شده

مدل استدلالی جدید شرکت VIDRAFT با ۱۸۰ میلیارد پارامتر، برای نخستین بار توانست در بنچمارکهای سختگیرانه AIME و HMMT ۲۰۲۶ به امتیاز ۱۰۰٪ دست یابد. این مدل با بهرهگیری از مکانیزم…

یک چکلیست جامع، کتابخانهها و APIهای ضروری برای خودکارسازی خط لولههای داراییهای رسانهای را معرفی کرده است. تمرکز این ابزارها بر پردازش سریع تصاویر، حذف پسزمینه با هوش مصنوعی…

مقایسهای جامع نشان میدهد ElevenLabs در شبیهسازی احساسات و سرعت کلونینگ صدا پیشتاز است، در حالی که Azure Speech همچنان استاندارد طلایی برای انطباق سازمانی و مقیاس چندزبانه است.…

ناشران با ادغام APIهای تبدیل متن به گفتار و شبیهسازی صدا، هزینهها و زمان تولید کتابهای صوتی را به شدت کاهش دادهاند. این رویکرد امکان مقیاسپذیری بومیسازی و حفظ ثبات صدا در…

مایکروسافت مدل چندوجهی Quine را معرفی کرد که با شبیهسازی سیستمهای بیولوژیک، هزاران ترکیب شیمیایی را برای درمان سرطان پانکراس غربال میکند. این سیستم توانست در یک آخر هفته، لیستی…

شرکت MachGen با طراحی یک زیرساخت اختصاصی برای مدلهای انتشار، سرعت تولید ویدیوهای هوش مصنوعی را تا ۶ برابر افزایش داد. این دستاورد بدون استفاده از روشهای تقطیر مدل به دست آمده و…

ماریسا مایر، مدیرعامل سابق یاهو، دستیار هوش مصنوعی Dazzle را معرفی کرد که بهجای ایمیلها و تقویمها، تنها از گالری عکسها برای شناخت کاربر استفاده میکند. این ابزار با تحلیل…

آنتروپیک مدل Claude Sonnet 5.5 را منتشر کرد که در کدنویسی با مدل تراز اول Opus رقابت میکند و درک تصاویر و نمودارها را بهشدت بهبود بخشیده است. این بهروزرسانی در حالی رخ میدهد…

استونی با همکاری شرکت Owkin، پلتفرم K Pro را در زیرساختهای امن ملی خود ادغام کرد تا پژوهشگران بتوانند بدون خروج دادهها از مرزهای کشور، تحلیلهای پزشکی در مقیاس جمعیت انجام دهند.

علیبابا با معرفی مدل Qwen-Audio-3.1-Realtime، قابلیتهای استدلال و فراخوانی ابزار را به تعاملات صوتی بلادرنگ آورد. این عرضه با کاهش شدید قیمتها در کل پشته صوتی همراه است تا سد…

سامانه جدید Tareekh برای جلوگیری از تثبیت خطاهای نویسهخوانی نوری (OCR) در حافظه بلندمدت عاملهای هوش مصنوعی، یک لایه بازبینی انسانی را به عنوان شرط ثبت دادهها معرفی کرده است.…

ادغام فناوریهای تبدیل متن به گفتار و شبیهسازی صدا میتواند محتوای متنی وب را به تجربههای صوتی فراگیر تبدیل کند. این رویکرد به کاربرانی که دارای اختلالات بینایی یا شناختی هستند…