پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

متن جایگزین: کتاب‌های قدیمی با OCR ضعیف، آموزش مدل‌های زبانی را ناتوان می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد.

مدل‌های کوچک OCR دقت استخراج متن از کتاب‌های تاریخی را به ۹۷٪ رساندند

پروژه FineBooks نشان داد مدل‌های کوچک با وزن‌های باز می‌توانند داده‌های متنی کتاب‌های قدیمی را با هزینه‌ای اندک و دقتی بسیار بالا پاک‌سازی کنند. این دستاورد بازدهی آموزش مدل‌های…

۴ دقیقه خواندن۱
مدل هوش مصنوعی Glimmer متا، نگاهی به چشم‌انداز زاکربرگ از هوش شخصی

مدل Muse Glimmer قابلیت اجرای عامل‌های ۳۰ میلیارد پارامتری را به GPUهای خانگی

متا مدل Muse Glimmer را با وزن‌های باز منتشر کرد تا اجرای عامل‌های هوش مصنوعی به‌صورت محلی و خصوصی روی سخت‌افزارهای مصرف‌کننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشم‌انداز…

۳ دقیقه خواندن۳
ساخت دستیارهای صوتی چندزبانه کم‌تأخیر با NVIDIA Magpie TTS: وزن باز و کنترل کامل استقرار
آموزش کاربردی

آیا Magpie TTS استقرار محلی عامل‌های صوتی چندزبانه را تسهیل می‌کند؟

انویدیا مدل Magpie TTS را با وزن‌های باز و پشتیبانی از ۱۲ زبان منتشر کرد. این مدل با کاهش شدید تأخیر در استنتاج، امکان ساخت عامل‌های صوتی با پاسخ‌دهی آنی و استقرار محلی را فراهم…

۷ دقیقه خواندن۱
ربات‌های MyZubster اکنون می‌بینند: یکپارچه‌سازی دوربین هوشمند کامل شد!
آموزش کاربردی

MyZubster: انتقال ربات‌ها به سیستم تشخیص لحظه‌ای اشیا با دوربین‌های باز

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، ربات‌های خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظه‌ای اشیا و…

۸ دقیقه خواندن۱
معرفی Muse Glimmer: مدل عاملی متن‌باز که روی دستگاه شما اجرا می‌شود
آموزش کاربردی

مدل Muse Glimmer متا: اجرای عامل‌های ۳۰ میلیارد پارامتری روی GPUهای خانگی

متا مدل Muse Glimmer را به عنوان یک مدل وزن‌باز ۳۰ میلیارد پارامتری برای اجرای محلی عامل‌های هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانه‌زنانه، روی…

۶ دقیقه خواندن۳