پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۲ مقاله منتشر شده

دستگاه Photon-1 شرکت Induction Labs با یک آموزش اولیه، دسکتاپ شبیه‌سازی می‌کند، دمبل بازی می‌کند و فیزیک بیلیارد مدل‌سازی می‌

آیا آموزش از طریق ویدئو جایگزین برچسب‌های متنی در مدل‌های استدلالی می‌شود؟

آزمایشگاه Induction Labs با معرفی مدل Photon-1 ثابت کرد که هوش مصنوعی می‌تواند بدون نیاز به برچسب‌های متنی، تنها از طریق پیش‌بینی فریم‌های ویدئویی، کار با رایانه را بیاموزد. این…

۵ دقیقه خواندن۲
نحوه کار رونویسی هوش مصنوعی: راهنمای فنی عملی ۲۰۲۶
آموزش کاربردی

درون خط‌لوله‌های مدرن تبدیل گفتار به متن و مدیریت نویز

خط‌لوله‌های مدرن تبدیل گفتار به متن از سیستم‌های تکه‌تکه به شبکه‌های عصبی سرتاسری تغییر مسیر داده‌اند. این مدل‌ها با ترکیب پردازش سیگنال و رمزگشایی احتمالی، نویز و لهجه‌ها را در…

۸ دقیقه خواندن۱
راهنمای گام‌به‌گام ساخت اپ یادگیری زبان با مدل زبانی بزرگ
آموزش کاربردی

Oxlo.ai هزینه استنتاج مدل‌های زبانی را با قیمت‌گذاری درخواست‌محور ثابت کرد

توسعه‌دهندگان اپلیکیشن‌های آموزش زبان از توکن‌محوری فاصله گرفته و به سمت معماری‌های چندوجهی می‌روند. Oxlo.ai با تغییر مدل قیمت‌گذاری از توکن به درخواست، مشکل افزایش هزینه‌ها در…

۶ دقیقه خواندن
دستیار مجازی مبتنی بر پردازش زبان طبیعی و مدل‌های زبانی بزرگ در حال پاسخگویی به کاربر
آموزش کاربردی

هزینهٔ ثابت در برابر مدل توکن‌محور؛ تغییر رویکرد Oxlo.ai در قیمت‌گذاری

پلتفرم Oxlo.ai با معرفی هزینه ثابت به‌ازای هر درخواست، مدل توکن‌محور در قیمت‌گذاری هوش مصنوعی را به چالش کشید. این رویکرد جریمه مالی توسعه‌دهندگانی که از پرامپت‌های طولانی و…

۴ دقیقه خواندن۲
۱,۳۷۷ فریم ورودی، ۶۰ فریم خروجی، و هیچ‌کس نمی‌دانست ساعت چند است.
آموزش کاربردی

ابزار crv خطای زمانی مدل‌های زبانی در تحلیل ویدیو را حذف کرد

ابزار متن‌باز crv با پیاده‌سازی ردیابی دقیق زمان‌بندی‌ها (PTS)، مشکل «لغزش زمانی» در تحلیل ویدیو توسط مدل‌های زبانی را حل کرد. این به‌روزرسانی باعث می‌شود شواهد بصری ارائه شده…

۳ دقیقه خواندن۱
اثر آندره دیاز موریرا پُل — هوش مصنوعی چندوجهی: متن، تصویر، صدا و ویدیو
آموزش کاربردی

فضای برداری مشترک؛ مکانیزم جدید برای حذف خطای تبدیل در مدل‌های چندوجهی

مدل‌های پیشرفته هوش مصنوعی از تبدیل داده‌های تصویری و صوتی به متن فاصله گرفته‌اند و اکنون همه را در یک فضای برداری واحد پردازش می‌کنند. این تغییر معماری، تأخیر و خطای تحلیل…

۳ دقیقه خواندن
دوازده‌لَبز و لایه حافظه ویدیویی: انقلابی در درک هوش مصنوعی

معماری Jockey: جایگزینی لایهٔ حافظهٔ مکانی-زمانی با رویکرد تکه‌تکه‌سازی فریم‌ها

شرکت TwelveLabs با معرفی زیرساخت Jockey، رویکرد سنتی «مجموعه‌ای از فریم‌ها» را در تحلیل ویدیو به چالش می‌کشد. این سیستم با ایجاد یک لایه حافظه اختصاصی، ویدیو را به‌جای تصاویر…

۵ دقیقه خواندن۲