
پلتفرم Speko هزینهی تغییر مدلهای صوتی را با مسیریابی پویا حذف کرد
استارتاپ Speko با معرفی یک API مسیریاب، امکان انتخاب لحظهای بهترین ترکیب مدلهای تبدیل گفتار به متن، مدل زبانی و تبدیل متن به گفتار را فراهم کرد. این ابزار مشکل «قفلشدگی مدل» را…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

استارتاپ Speko با معرفی یک API مسیریاب، امکان انتخاب لحظهای بهترین ترکیب مدلهای تبدیل گفتار به متن، مدل زبانی و تبدیل متن به گفتار را فراهم کرد. این ابزار مشکل «قفلشدگی مدل» را…

مدل جدید PixAI با استفاده از سیستم مرجع شخصیت، امکان حفظ دقیق ویژگیهای بصری کاراکترها را در صحنهها و زوایای مختلف فراهم میکند. این رویکرد برخلاف متدهای متنی، از یک تصویر ثابت…

پژوهشگران دریافتند که مدلهای بینایی-زبانی (VLM) را میتوان تنها با تغییر رنگ کلمات، به نتایج مثبت یا منفی سوق داد، حتی اگر متن هیچ تغییری نکند. این آسیبپذیری ریسک امنیتی شدیدی…

استارتاپ Wispr با جذب ۲۸۰ میلیون دلار سرمایه، ارزش شرکت خود را به ۲ میلیارد دلار رساند. این شرکت قصد دارد از تبدیل ساده گفتار به متن فراتر رفته و به حوزهی مدیریت جلسات و تعامل…

در حالی که Sora در یافتن مدل درآمدی پایدار شکست خورد، استارتاپهایی مثل Higgsfield با تمرکز بر بازارهای تجاری و تولید محتوای تبلیغاتی به رشد سریع رسیدهاند. این موج جدید، کاربرد…

پلتفرم Skinova با تبدیل امتیازات فنی هوش مصنوعی به راهنماییهای ساده و روتینهای شخصیسازیشده، فاصله بین تحلیل داده و مراقبت روزانه از پوست را پر میکند. این ابزار که در هکاتون…

یک سیستم بیومتریک جدید با نام Nose ID از مدلهای پیشآموز برای شناسایی سگها از طریق الگوهای منحصربهفرد بینی آنها استفاده میکند. این ابزار ترکیبی از بینایی ماشین برای شناسایی و…

اجرای مدل Qwen 3.8 27B روی سختافزار شخصی نیازمند تعادلی دقیق میان رم سیستم و حافظه گرافیکی است. برای جلوگیری از افت شدید سرعت و خطاهای تولید متن، داشتن یک GPU با ۲۴ گیگابایت VRAM…

یک چارچوب جدید برای تولید موسیقی در SUNO، پرامپتها را بهجای متنهای توصیفی، به صورت «بستههای متغیر» تعریف میکند. این روش با اولویت دادن به نیازهای عملکردی متن بر ترندهای روز،…

عرضه اولیه Unitree در بازار STAR نخستین معیار عمومی برای ارزشگذاری رباتهای انساننما را ایجاد کرد. این اتفاق نشاندهنده گذار صنعت از دوران «روایتهای تخیلی» به عصر مطالبه…

بررسی جامع ۹ مدل چندوجهی نشان میدهد Qwen3-VL-32B بهینهترین گزینه برای OCR و تشخیص اشیا است. انتخاب اشتباه مدل در این حوزه میتواند هزینههای عملیاتی ماهانه را تا ۵۰۰٪ افزایش دهد.

توسعهدهندگان اکنون میتوانند با استفاده از مدل رایگان S2 شرکت Fish Audio و چارچوب Eve، عاملهای صوتی تعاملی بسازند. این رویکرد موانع مالی برای تست مدلهای صوتی در محیط عملیاتی را…