پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۷۸ مقاله منتشر شده

لوگوی بلک فارست لبز و عنوان FLUX 3: مدل چندوجهی برای تولید تصویر، ویدیو، صدا و کنترل ربات

مدل FLUX 3 ویدیو، صدا و حرکات رباتیک را در یک مجموعه وزن‌ها یکپارچه کرد

شرکت Black Forest Labs مدل بنیاد چندوجهی FLUX 3 را معرفی کرد که قادر است ویدیو، صدا و پیش‌بینی‌های حرکتی ربات را تنها با یک مجموعه وزن تولید کند. این مدل با استفاده از معماری…

۳ دقیقه خواندن۱
تزریق سریع در لایه تصویر: سنجش یک دفاع در ۱۰۸٬۰۱۵ نمونه
آموزش کاربردی

«پاک‌سازی فیزیکی نقاط پنهان»؛ راهکار Crossguard-py برای توقف حملات استگانوگرافیک

ابزار متن‌باز Crossguard-py با حذف فیزیکی نقاط پنهان‌سازی کد در تصاویر، تزریق‌های پرامپت مبتنی بر تصویر را به‌طور مؤثر خنثی می‌کند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

۷ دقیقه خواندن۱
«حساب شما تا ۲ ساعت دیگر بسته می‌شود» — ۶ کلمه‌ای که امشب حساب‌های بانکی را خالی می‌کنند
آموزش کاربردی

بانک مرکزی هند: نرخ کلاهبرداری‌های دیجیتال ۱۶۸٪ افزایش یافت

افزایش شدید کلاهبرداری‌های دیجیتال در هند، شکست گسترده در حلقه‌های تأیید هویت را برملا کرد. متخصصان اکنون خواستار دسترسی محققان مستقل به ابزارهای تخصصی مقایسه چهره برای ردیابی…

۳ دقیقه خواندن۲
تصویری از صفحه ابزار رایگان تبدیل ویدیوی یوتیوب به متن با نشانگر ماوس روی دکمه شروع
آموزش کاربردی

پشت‌پردهٔ تبدیل لینک یوتیوب به متن؛ چرا ابزارهای رایگان در ویدیوهای بلند شکست

ابزارهای رایگان تبدیل ویدیو به متن از یک درخت تصمیم چندمرحله‌ای استفاده می‌کنند تا هزینه‌های پردازشی را کاهش دهند. این سازوکار توضیح می‌دهد چرا بسیاری از این ابزارها در مواجهه با…

۲ دقیقه خواندن
دستگاه Photon-1 شرکت Induction Labs با یک آموزش اولیه، دسکتاپ شبیه‌سازی می‌کند، دمبل بازی می‌کند و فیزیک بیلیارد مدل‌سازی می‌

آیا آموزش از طریق ویدئو جایگزین برچسب‌های متنی در مدل‌های استدلالی می‌شود؟

آزمایشگاه Induction Labs با معرفی مدل Photon-1 ثابت کرد که هوش مصنوعی می‌تواند بدون نیاز به برچسب‌های متنی، تنها از طریق پیش‌بینی فریم‌های ویدئویی، کار با رایانه را بیاموزد. این…

۵ دقیقه خواندن
نحوه کار رونویسی هوش مصنوعی: راهنمای فنی عملی ۲۰۲۶
آموزش کاربردی

درون خط‌لوله‌های مدرن تبدیل گفتار به متن و مدیریت نویز

خط‌لوله‌های مدرن تبدیل گفتار به متن از سیستم‌های تکه‌تکه به شبکه‌های عصبی سرتاسری تغییر مسیر داده‌اند. این مدل‌ها با ترکیب پردازش سیگنال و رمزگشایی احتمالی، نویز و لهجه‌ها را در…

۸ دقیقه خواندن۱
راهنمای گام‌به‌گام ساخت اپ یادگیری زبان با مدل زبانی بزرگ
آموزش کاربردی

Oxlo.ai هزینه استنتاج مدل‌های زبانی را با قیمت‌گذاری درخواست‌محور ثابت کرد

توسعه‌دهندگان اپلیکیشن‌های آموزش زبان از توکن‌محوری فاصله گرفته و به سمت معماری‌های چندوجهی می‌روند. Oxlo.ai با تغییر مدل قیمت‌گذاری از توکن به درخواست، مشکل افزایش هزینه‌ها در…

۶ دقیقه خواندن
دستیار مجازی مبتنی بر پردازش زبان طبیعی و مدل‌های زبانی بزرگ در حال پاسخگویی به کاربر
آموزش کاربردی

هزینهٔ ثابت در برابر مدل توکن‌محور؛ تغییر رویکرد Oxlo.ai در قیمت‌گذاری

پلتفرم Oxlo.ai با معرفی هزینه ثابت به‌ازای هر درخواست، مدل توکن‌محور در قیمت‌گذاری هوش مصنوعی را به چالش کشید. این رویکرد جریمه مالی توسعه‌دهندگانی که از پرامپت‌های طولانی و…

۴ دقیقه خواندن۲