
درون سازوکار h3.c برای کاهش زمان پردازش ویدیو در مک
موتور استنتاج بومی h3.c با بهینهسازی حافظه و کوانتش int8، اجرای محلی مدل MiniMax-H3 را روی تراشههای اپل ممکن کرد. این ابزار زمان حذف نویز (Denoising) برای کلیپهای کوتاه را از…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

موتور استنتاج بومی h3.c با بهینهسازی حافظه و کوانتش int8، اجرای محلی مدل MiniMax-H3 را روی تراشههای اپل ممکن کرد. این ابزار زمان حذف نویز (Denoising) برای کلیپهای کوتاه را از…

پلتفرم Backboard با ارائه داشبوردهای no-code، مدیریت حافظه بلندمدت و جابهجایی بین مدلهای مختلف هوش مصنوعی را تسهیل کرده است. این ابزار با ادغام در اپلیکیشن Nash، قابلیتهای…

یک سیستم بدون سرور (Serverless) در AWS با ترکیب سه مدل هوش مصنوعی، فرآیند طبقهبندی، برش و استخراج متن از عکس کارتهای کلکسیونی را خودکار کرده است. این معماری با حفظ نظارت انسانی،…

پروژه FineBooks نشان داد مدلهای کوچک با وزنهای باز میتوانند دادههای متنی کتابهای قدیمی را با هزینهای اندک و دقتی بسیار بالا پاکسازی کنند. این دستاورد بازدهی آموزش مدلهای…

شرکت Dyna Robotics با معرفی مدل DYNA-2، یادگیری مهارتهای فیزیکی رباتها را از دادههای گرانقیمت رباتیک به ویدیوهای انسانی منتقل کرد. این مدل با تماشای میلیونها ساعت رفتار…

متا مدل Muse Glimmer را با وزنهای باز منتشر کرد تا اجرای عاملهای هوش مصنوعی بهصورت محلی و خصوصی روی سختافزارهای مصرفکننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشمانداز…

انویدیا مدل Magpie TTS را با وزنهای باز و پشتیبانی از ۱۲ زبان منتشر کرد. این مدل با کاهش شدید تأخیر در استنتاج، امکان ساخت عاملهای صوتی با پاسخدهی آنی و استقرار محلی را فراهم…

بررسی سامانه GRAIL متعلق به شرکت RAND نشان میدهد که در دهه ۶۰ میلادی، بدون استفاده از شبکههای عصبی، به دقت ۹۰ درصدی در تشخیص دستخط دست یافتهاند. این سیستم با تکیه بر هندسه و…

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، رباتهای خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظهای اشیا و…

ابزار TalkPix AI اکنون قادر است یک تصویر ثابت و یک فایل صوتی را به ویدیویی واقعگرایانه با انیمیشنهای لبخوانی دقیق تبدیل کند. این فناوری نیاز به تجهیزات گرانقیمت ضبط حرکت یا…

متا مدل Muse Glimmer را به عنوان یک مدل وزنباز ۳۰ میلیارد پارامتری برای اجرای محلی عاملهای هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانهزنانه، روی…

بایتدنس با معرفی SeedRealtime، یک مدل چندوجهی بومی را عرضه کرد که صوت، تصویر و متن را در یک معماری واحد پردازش میکند. این رویکرد با حذف لایههای واسط، تأخیر در گفتگوهای…