پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

تصویر شماره ۹۱۱: تقطیر مدل‌های انتشار و چندوجهی
آموزش کاربردی

فشرده‌سازی مسیر در برابر تقلید پاسخ در دیستیل کردن مدل‌ها

دیستیل کردن مدل‌های انتشار برخلاف مدل‌های متنی، به جای تقلید از یک پاسخ نهایی، بر فشرده‌سازی کل مسیر تبدیل نویز به تصویر تمرکز دارد. این تغییر رویکرد، آموزش هوش مصنوعی را از تقلید…

۱ دقیقه خواندن۲
متن جایگزین: کتاب‌های قدیمی با OCR ضعیف، آموزش مدل‌های زبانی را ناتوان می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد.

مدل‌های کوچک OCR دقت استخراج متن از کتاب‌های تاریخی را به ۹۷٪ رساندند

پروژه FineBooks نشان داد مدل‌های کوچک با وزن‌های باز می‌توانند داده‌های متنی کتاب‌های قدیمی را با هزینه‌ای اندک و دقتی بسیار بالا پاک‌سازی کنند. این دستاورد بازدهی آموزش مدل‌های…

۴ دقیقه خواندن۱
مدل هوش مصنوعی Glimmer متا، نگاهی به چشم‌انداز زاکربرگ از هوش شخصی

مدل Muse Glimmer قابلیت اجرای عامل‌های ۳۰ میلیارد پارامتری را به GPUهای خانگی

متا مدل Muse Glimmer را با وزن‌های باز منتشر کرد تا اجرای عامل‌های هوش مصنوعی به‌صورت محلی و خصوصی روی سخت‌افزارهای مصرف‌کننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشم‌انداز…

۳ دقیقه خواندن۳
ساخت دستیارهای صوتی چندزبانه کم‌تأخیر با NVIDIA Magpie TTS: وزن باز و کنترل کامل استقرار
آموزش کاربردی

آیا Magpie TTS استقرار محلی عامل‌های صوتی چندزبانه را تسهیل می‌کند؟

انویدیا مدل Magpie TTS را با وزن‌های باز و پشتیبانی از ۱۲ زبان منتشر کرد. این مدل با کاهش شدید تأخیر در استنتاج، امکان ساخت عامل‌های صوتی با پاسخ‌دهی آنی و استقرار محلی را فراهم…

۷ دقیقه خواندن۱
ربات‌های MyZubster اکنون می‌بینند: یکپارچه‌سازی دوربین هوشمند کامل شد!
آموزش کاربردی

MyZubster: انتقال ربات‌ها به سیستم تشخیص لحظه‌ای اشیا با دوربین‌های باز

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، ربات‌های خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظه‌ای اشیا و…

۸ دقیقه خواندن۱