
مدل FLUX 3 ویدیو، صدا و حرکات رباتیک را در یک مجموعه وزنها یکپارچه کرد
شرکت Black Forest Labs مدل بنیاد چندوجهی FLUX 3 را معرفی کرد که قادر است ویدیو، صدا و پیشبینیهای حرکتی ربات را تنها با یک مجموعه وزن تولید کند. این مدل با استفاده از معماری…
موضوع
Models that natively process text+image+audio+video
۸۷۸ مقاله منتشر شده

شرکت Black Forest Labs مدل بنیاد چندوجهی FLUX 3 را معرفی کرد که قادر است ویدیو، صدا و پیشبینیهای حرکتی ربات را تنها با یک مجموعه وزن تولید کند. این مدل با استفاده از معماری…

شرکت xAI حالت جدیدی به نام Quality Mode را برای API مدل Grok Imagine معرفی کرد که بر واقعگرایی و رندر دقیق متن تمرکز دارد. این مدل با قرارگیری در ۵ رتبه اول LMArena، استانداردهای…

ابزار متنباز Crossguard-py با حذف فیزیکی نقاط پنهانسازی کد در تصاویر، تزریقهای پرامپت مبتنی بر تصویر را بهطور مؤثر خنثی میکند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

افزایش شدید کلاهبرداریهای دیجیتال در هند، شکست گسترده در حلقههای تأیید هویت را برملا کرد. متخصصان اکنون خواستار دسترسی محققان مستقل به ابزارهای تخصصی مقایسه چهره برای ردیابی…

ابزارهای رایگان تبدیل ویدیو به متن از یک درخت تصمیم چندمرحلهای استفاده میکنند تا هزینههای پردازشی را کاهش دهند. این سازوکار توضیح میدهد چرا بسیاری از این ابزارها در مواجهه با…

گوگل سیستم ظرفیت پویا در مدل Veo را با سهمیههای سختگیرانه جایگزین کرد. مشترکان طرح Pro اکنون تنها ۳ و کاربران Ultra ۵ ویدیو در روز تولید میکنند که این تغییر، فرآیندهای خلاقانه و…

آزمایشگاه Induction Labs با معرفی مدل Photon-1 ثابت کرد که هوش مصنوعی میتواند بدون نیاز به برچسبهای متنی، تنها از طریق پیشبینی فریمهای ویدئویی، کار با رایانه را بیاموزد. این…

خطلولههای مدرن تبدیل گفتار به متن از سیستمهای تکهتکه به شبکههای عصبی سرتاسری تغییر مسیر دادهاند. این مدلها با ترکیب پردازش سیگنال و رمزگشایی احتمالی، نویز و لهجهها را در…

توسعهدهندگان اپلیکیشنهای آموزش زبان از توکنمحوری فاصله گرفته و به سمت معماریهای چندوجهی میروند. Oxlo.ai با تغییر مدل قیمتگذاری از توکن به درخواست، مشکل افزایش هزینهها در…

اوون سانگ، توسعهدهنده مستقل، مدل Inflect-Micro-v2 را منتشر کرد که با حجمی بسیار کم (۳۷.۵ مگابایت)، کیفیت صدای طبیعی را به صورت محلی و بدون نیاز به اینترنت ارائه میدهد. این سیستم…

پلتفرم Oxlo.ai با معرفی هزینه ثابت بهازای هر درخواست، مدل توکنمحور در قیمتگذاری هوش مصنوعی را به چالش کشید. این رویکرد جریمه مالی توسعهدهندگانی که از پرامپتهای طولانی و…

گروه پژوهشی Reactor با معرفی Open Dreamer، معماری و جزئیات آموزشی مدلهای جهانی Dreamer 4 را بهصورت متنباز منتشر کرد. این پروژه با تمرکز بر پایداری آموزش در مقیاس بالا، دموهای…