
Robotics-U0: تجمیع تولید صحنه و ویدیو در ۳۸ میلیارد پارامتر
شیائومی مدل Robotics-U0 را با ۳۸ میلیارد پارامتر بهعنوان نخستین معماری ترنسفورمر بازمتن برای یکپارچهسازی وظایف رباتیک معرفی کرد. این مدل تولید صحنه، ویدیو، تصویر و انتقال تجسمی…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۸ مقاله منتشر شده

شیائومی مدل Robotics-U0 را با ۳۸ میلیارد پارامتر بهعنوان نخستین معماری ترنسفورمر بازمتن برای یکپارچهسازی وظایف رباتیک معرفی کرد. این مدل تولید صحنه، ویدیو، تصویر و انتقال تجسمی…

پروژه Argus ابزار libargus را برای اجرای مدلهای زبانی و چندوجهی در جاوا ۲۲+ معرفی کرد. این سیستم با دور زدن حافظه Heap، تأخیرهای ناشی از Garbage Collection را کاملاً حذف کرده و…

یک رویکرد کاربردی جدید با استفاده از «پکهای پرامپت»، نیاز به آزمون و خطای مداوم در نوشتن دستورات دستی برای خلق هنر انیمه را از بین میبرد. کاربران با استفاده از قالبهای آماده در…

OpenAI در حال توسعه یک اسپیکر هوشمند بدون صفحه نمایش است که از طریق حرکات مکانیکی و شخصیت پیشکننده، حس زنده بودن را منتقل میکند. با این حال، دعوای حقوقی اپل بر سر سرقت اسرار…

شرکت Pantograph مدلی با ۴ میلیارد پارامتر به نام Pan توسعه داده که بدون نیاز به دادههای برچسبگذاریشده، تنها از طریق تماشای ویدیوهای اینترنتی، رفتارهای هدفمند را یاد میگیرد.…

بهینهسازی بازشناسی گفتار در زمان واقعی نیازمند گذار از مدلهای توکنی به قیمتگذاری مبتنی بر درخواست است. Oxlo.ai با ترکیب مدلهای کوانتیده و حذف جریمههای طول متن، تأخیر استنتاج…

استارتاپ Rime برای حذف سیستمهای IVR سنتی و جایگزینی آنها با هوش مصنوعی گفتار-به-گفتار ۲۴ میلیون دلار جذب کرد. این شرکت با ایجاد استودیوی ضبط اختصاصی، دقت تلفظ اصطلاحات تخصصی را…

اپلیکیشن Reelful با استفاده از عاملهای هوشمند، تبدیل عکسها و کلیپهای گالری به ویدیوهای حرفهای برای شبکههای اجتماعی را خودکار میکند. این ابزار با هدف کاهش زمان تدوین برای…

پلتفرم Hume با معرفی محک Real World VoiceEQ نشان داد که مدلهای صوتی علیرغم نمرات بالای فنی، در درک احساسات و بافتهای صوتی شکست میخورند. دادهها حاکی از آن است که هیچ مدل واحدی…

مدلهای صوتی OpenAI در نمایش «حق تقدمِ گفتگو» مشکل دارند و کاربر نمیداند چه کسی سخن میگوید یا گوش میدهد. برای حل این چالش، یک مدل رابط کاربری مبتنی بر «ماشین حالت» پیشنهاد شده…

متا تنظیماتی را معرفی کرد که به برخی کاربران اجازه میدهد از بهکارگیری محتوای عمومیشان برای آموزش هوش مصنوعی Muse Image جلوگیری کنند. در این سیستم، مدل میتواند بدون اطلاع…

اپل اولین بتای عمومی iOS 27 را با نسخه بازطراحیشدهی Siri AI منتشر کرد. این بهروزرسانی با تمرکز بر آگاهی از محتوای صفحه و جستوجوی پیشرفتهی فایلها، نرخ خطاهای عملیاتی را…