
پلتفرم Backboard مدیریت حافظهٔ عاملها را به محیط بدون کد آورد
پلتفرم Backboard با ارائه داشبوردهای no-code، مدیریت حافظه بلندمدت و جابهجایی بین مدلهای مختلف هوش مصنوعی را تسهیل کرده است. این ابزار با ادغام در اپلیکیشن Nash، قابلیتهای…
موضوع
Models that natively process text+image+audio+video
۸۶۰ مقاله منتشر شده

پلتفرم Backboard با ارائه داشبوردهای no-code، مدیریت حافظه بلندمدت و جابهجایی بین مدلهای مختلف هوش مصنوعی را تسهیل کرده است. این ابزار با ادغام در اپلیکیشن Nash، قابلیتهای…

یک سیستم بدون سرور (Serverless) در AWS با ترکیب سه مدل هوش مصنوعی، فرآیند طبقهبندی، برش و استخراج متن از عکس کارتهای کلکسیونی را خودکار کرده است. این معماری با حفظ نظارت انسانی،…

پروژه FineBooks نشان داد مدلهای کوچک با وزنهای باز میتوانند دادههای متنی کتابهای قدیمی را با هزینهای اندک و دقتی بسیار بالا پاکسازی کنند. این دستاورد بازدهی آموزش مدلهای…

شرکت Dyna Robotics با معرفی مدل DYNA-2، یادگیری مهارتهای فیزیکی رباتها را از دادههای گرانقیمت رباتیک به ویدیوهای انسانی منتقل کرد. این مدل با تماشای میلیونها ساعت رفتار…

متا مدل Muse Glimmer را با وزنهای باز منتشر کرد تا اجرای عاملهای هوش مصنوعی بهصورت محلی و خصوصی روی سختافزارهای مصرفکننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشمانداز…

انویدیا مدل Magpie TTS را با وزنهای باز و پشتیبانی از ۱۲ زبان منتشر کرد. این مدل با کاهش شدید تأخیر در استنتاج، امکان ساخت عاملهای صوتی با پاسخدهی آنی و استقرار محلی را فراهم…

بررسی سامانه GRAIL متعلق به شرکت RAND نشان میدهد که در دهه ۶۰ میلادی، بدون استفاده از شبکههای عصبی، به دقت ۹۰ درصدی در تشخیص دستخط دست یافتهاند. این سیستم با تکیه بر هندسه و…

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، رباتهای خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظهای اشیا و…

ابزار TalkPix AI اکنون قادر است یک تصویر ثابت و یک فایل صوتی را به ویدیویی واقعگرایانه با انیمیشنهای لبخوانی دقیق تبدیل کند. این فناوری نیاز به تجهیزات گرانقیمت ضبط حرکت یا…

متا مدل Muse Glimmer را به عنوان یک مدل وزنباز ۳۰ میلیارد پارامتری برای اجرای محلی عاملهای هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانهزنانه، روی…

بایتدنس با معرفی SeedRealtime، یک مدل چندوجهی بومی را عرضه کرد که صوت، تصویر و متن را در یک معماری واحد پردازش میکند. این رویکرد با حذف لایههای واسط، تأخیر در گفتگوهای…

تحلیل دقیق Kling AI نشان میدهد که ساختار پرامپت پنجبخشی میتواند نورپردازی و حرکت دوربین را مدیریت کند، اما قادر به رفع نقصهای ساختاری مانند تغییر شکل چهره نیست. کاربران باید…