پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۲ مقاله منتشر شده

رمزگذار چندوجهی و چندزبانه کارآمد NeoMME
آموزش کاربردی

مدل NeoMME هزینهٔ ذخیره‌سازی بردار‌های بصری را ۲۵۵ برابر کاهش داد

شرکت Hugging Face مدل NeoMME را معرفی کرد؛ یک رمزگذار چندوجهی که بدون نیاز به برج‌های بینایی مجزا، متن و تصویر را در یک ترنسفورمر واحد پردازش می‌کند. این مدل ضمن حفظ دقت بازیابی،…

۱۱ دقیقه خواندن۳
ابزار جستجوی هوش مصنوعی فلاک برای پلیس‌ها

ابزار FreeForm شرکت Flock Safety؛ تبدیل شهرها به پایگاه‌داده‌ای برای تعقیب پلیس

مهندسی معکوس ابزارهای Flock Safety نشان می‌دهد پلیس می‌تواند با توصیفات متنی ساده، افراد را در شبکه‌های گسترده دوربین‌های شهری ردیابی کند. با وجود ادعای وجود حفاظ‌ها، این سیستم…

۱۳ دقیقه خواندن
مقایسه کلود پرو و چت‌جی‌پی‌تی پلاس در ۲۰۲۶: کدام دستیار هوشمند را انتخاب کنید؟
زندگی با AI

کلود پرو در برابر چت‌جی‌پی‌تی پلاس؛ تفکیک ابزارهای جراحی و سوئیسی

مقایسه اشتراک‌های ۲۰ دلاری آنتروپیک و اوپن‌ای‌آی در سپتامبر ۲۰۲۶ نشان می‌دهد که کلود پرو در کدنویسی فنی و تحلیل اسناد طولانی پیشتاز است، در حالی که چت‌جی‌پی‌تی پلاس در تطبیق‌پذیری…

۵ دقیقه خواندن
آموزش مدل کدنویسی برای نقاشی آبرنگ با TRL و OpenEnv
آموزش کاربردی

آموزش سلیقهٔ هنری به مدل‌های زبانی کوچک با یادگیری تقویتی

یک پیاده‌سازی متن‌باز جدید نشان می‌دهد چگونه می‌توان از یادگیری تقویتی برای آموزش «سلیقه» به مدل‌های زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگ‌های زیباتری…

۲۰ دقیقه خواندن
راهنمای خرید API ویدیویی هوش مصنوعی چندمدلی
آموزش کاربردی

۵ مسیر استقرار APIهای ویدیو برای مقیاس‌پذیری در محیط تولید

یک راهنمای فنی جدید، توازن میان تأمین‌کنندگان مدل، تجمیع‌کنندگان و لایه‌های انتزاعی داخلی برای ویدیوهای هوش مصنوعی را تحلیل می‌کند. این چارچوب با هدف جلوگیری از «شکست‌های خاموش» و…

۹ دقیقه خواندن۲