پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۸ مقاله منتشر شده

۱,۳۷۷ فریم ورودی، ۶۰ فریم خروجی، و هیچ‌کس نمی‌دانست ساعت چند است.
آموزش کاربردی

ابزار crv خطای زمانی مدل‌های زبانی در تحلیل ویدیو را حذف کرد

ابزار متن‌باز crv با پیاده‌سازی ردیابی دقیق زمان‌بندی‌ها (PTS)، مشکل «لغزش زمانی» در تحلیل ویدیو توسط مدل‌های زبانی را حل کرد. این به‌روزرسانی باعث می‌شود شواهد بصری ارائه شده…

۳ دقیقه خواندن۱
اثر آندره دیاز موریرا پُل — هوش مصنوعی چندوجهی: متن، تصویر، صدا و ویدیو
آموزش کاربردی

فضای برداری مشترک؛ مکانیزم جدید برای حذف خطای تبدیل در مدل‌های چندوجهی

مدل‌های پیشرفته هوش مصنوعی از تبدیل داده‌های تصویری و صوتی به متن فاصله گرفته‌اند و اکنون همه را در یک فضای برداری واحد پردازش می‌کنند. این تغییر معماری، تأخیر و خطای تحلیل…

۳ دقیقه خواندن
دوازده‌لَبز و لایه حافظه ویدیویی: انقلابی در درک هوش مصنوعی

معماری Jockey: جایگزینی لایهٔ حافظهٔ مکانی-زمانی با رویکرد تکه‌تکه‌سازی فریم‌ها

شرکت TwelveLabs با معرفی زیرساخت Jockey، رویکرد سنتی «مجموعه‌ای از فریم‌ها» را در تحلیل ویدیو به چالش می‌کشد. این سیستم با ایجاد یک لایه حافظه اختصاصی، ویدیو را به‌جای تصاویر…

۵ دقیقه خواندن۱
لوگوی آزمایشگاه آندون و عنوان Drone-Bench

شکست ۱۰۰ درصدی مدل‌های پیشرو در مأموریت‌های نظارتی Drone-Bench

محک جدید Drone-Bench نشان می‌دهد مدل‌های هوش مصنوعی پیشرو در حال حاضر قادر به اجرای زنجیره‌ای از وظایف برای نظارت خودمختار نیستند. اگرچه این مدل‌ها در تک‌وظیفه‌ها موفق‌اند، اما در…

۸ دقیقه خواندن
ربات چت هوش مصنوعی متا شبیه دستیار شخصی‌تر می‌شود

«گذار از سرگرمی به بهره‌وری»؛ استراتژی جدید متا برای ارتقای چت‌بات خود

متا با معرفی مدل Muse Spark 1.1، چت‌بات خود را از یک ابزار سرگرمی به دستیاری برای مدیریت زمان و انجام خودکار تکالیف تبدیل کرد. این به‌روزرسانی برای رقابت مستقیم با گوگل و OpenAI…

۲ دقیقه خواندن۱
متا پلتفرم فروشگاهی را از طریق فیسبوک مارکت‌پلیس راه‌اندازی کرد

متا با اپلیکیشن Seller بازار فیس‌بوک را به ویترین حرفه‌ای تبدیل کرد

متا اپلیکیشن اختصاصی Seller را برای تغییر ماهیت Marketplace از یک تابلوی محله‌ای به یک فروشگاه تخصصی معرفی کرد. این ابزار با بهره‌گیری از هوش مصنوعی، فرآیند ثبت کالا را خودکار…

۲ دقیقه خواندن
مردی که «مدل‌های جهانی» را کلیدواژه بعدی می‌داند، ۱ میلیارد دلار برای ساخت آن جمع‌آوری کرد.

قمار ۱ میلیارد دلاری AMI Labs برای جایگزینی LLMها با مدل‌های جهانی

آزمایشگاه AMI Labs با جذب بزرگ‌ترین سرمایه اولیه در تاریخ اروپا، قصد دارد با استفاده از معماری JEPA، مدل‌هایی بسازد که قوانین فیزیکی جهان را می‌فهمند. هدف این پروژه عبور از…

۹ دقیقه خواندن
جایگزین Tensor.Art برای انیمه: هزینه پنهان تنظیمات پیش‌فرض
آموزش کاربردی

تضاد در کنترل؛ چرا پیک‌س‌آی در حفظ هویت شخصیت‌های انیمه‌ای برنده است

مقایسه‌ای جامع بین PixAI و Tensor.Art نشان می‌دهد که پیچیدگی بیش از حد و تنظیمات پیش‌فرض پنهان، دقت مدل را کاهش می‌دهد. در حالی که PixAI با رویکردی ساده بر حفظ تداوم شخصیت‌ها…

۶ دقیقه خواندن