پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۶۰ مقاله منتشر شده

متن جایگزین: کتاب‌های قدیمی با OCR ضعیف، آموزش مدل‌های زبانی را ناتوان می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد.

مدل‌های کوچک OCR دقت استخراج متن از کتاب‌های تاریخی را به ۹۷٪ رساندند

پروژه FineBooks نشان داد مدل‌های کوچک با وزن‌های باز می‌توانند داده‌های متنی کتاب‌های قدیمی را با هزینه‌ای اندک و دقتی بسیار بالا پاک‌سازی کنند. این دستاورد بازدهی آموزش مدل‌های…

۴ دقیقه خواندن۱
مدل هوش مصنوعی Glimmer متا، نگاهی به چشم‌انداز زاکربرگ از هوش شخصی

مدل Muse Glimmer قابلیت اجرای عامل‌های ۳۰ میلیارد پارامتری را به GPUهای خانگی

متا مدل Muse Glimmer را با وزن‌های باز منتشر کرد تا اجرای عامل‌های هوش مصنوعی به‌صورت محلی و خصوصی روی سخت‌افزارهای مصرف‌کننده ممکن شود. این اقدام گامی عملی در مسیر تحقق چشم‌انداز…

۳ دقیقه خواندن۲
ربات‌های MyZubster اکنون می‌بینند: یکپارچه‌سازی دوربین هوشمند کامل شد!

MyZubster: انتقال ربات‌ها به سیستم تشخیص لحظه‌ای اشیا با دوربین‌های باز

پروژه MyZubster با معرفی یک ماژول دوربین هوشمند و بازاستفاده، ربات‌های خود را از مدل «دستور-عملکرد» به معماری «ادراک-تصمیم-عمل» منتقل کرد. این سیستم امکان تشخیص لحظه‌ای اشیا و…

۸ دقیقه خواندن
معرفی Muse Glimmer: مدل عاملی متن‌باز که روی دستگاه شما اجرا می‌شود

مدل Muse Glimmer متا: اجرای عامل‌های ۳۰ میلیارد پارامتری روی GPUهای خانگی

متا مدل Muse Glimmer را به عنوان یک مدل وزن‌باز ۳۰ میلیارد پارامتری برای اجرای محلی عامل‌های هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانه‌زنانه، روی…

۶ دقیقه خواندن
فرمول پنج‌بخشی پرامپت کلينگ: کنترل دوربین، نه چهره و دست‌ها

فرمول ۵‌گانه Kling AI کنترل دوربین را تضمین می‌کند اما چهره‌ها را نه

تحلیل دقیق Kling AI نشان می‌دهد که ساختار پرامپت پنج‌بخشی می‌تواند نورپردازی و حرکت دوربین را مدیریت کند، اما قادر به رفع نقص‌های ساختاری مانند تغییر شکل چهره نیست. کاربران باید…

۸ دقیقه خواندن۱