
۹۵٪ درامهای کوتاه چین با هوش مصنوعی تولید شدند
هوش مصنوعی زاینده با کاهش ۹۰ درصدی هزینههای تولید، جایگزین بازیگران و استریمرهای انسانی در چین شده است. در سه ماهه نخست ۲۰۲۶، تقریباً تمام ۱۲۸ هزار اثر منتشرشده در این حوزه توسط…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۲ مقاله منتشر شده

هوش مصنوعی زاینده با کاهش ۹۰ درصدی هزینههای تولید، جایگزین بازیگران و استریمرهای انسانی در چین شده است. در سه ماهه نخست ۲۰۲۶، تقریباً تمام ۱۲۸ هزار اثر منتشرشده در این حوزه توسط…

پروژه LAION با انتشار مجموعه دادهٔ Big Video Dataset (BVD)، ۱۰ میلیون ساعت ویدیو و ۳۰۰ میلیون تصویر را در اختیار پژوهشگران قرار داد. این اقدام با هدف شکستن انحصار دادههای عظیم در…

درآمدهای سالانه بازار درامهای عمودی هوش مصنوعی در آمریکا به ۴.۲ میلیارد دلار رسیده است. با این حال، ثروت در دست ۲۰ درصد از استودیوهای برتر متمرکز شده و مدلهای درآمدزایی آسیایی…

پلتفرم Hugging Face و Voice Arena با معرفی مجموعههای ارزیابی Monsoon، نشان دادند که نرخ خطای کلمه (WER) بهتنهایی معیار دقیقی نیست. این بنچمارکها فاش میکنند مدلهایی که در…

گوگل مدل Gemini 3.5 Transcribe را برای تبدیل دقیق و لحظهای صوت به متن معرفی کرد. این مدل با حذف کلمات زائد و مدیریت اصطلاحات تخصصی، تأخیر و دقت را نسبت به نسل قبلی بهشدت بهبود…

بنچمارکهای مدل Qwen3.8 27B روی مک استودیو نشان میدهد که با وجود کاهش سرعت تولید توکن، بهدلیل ایجاز بیشتر در پاسخها، زمان کل انتظار کاربر کاهش یافته است. این مدل امکان…

ساخت باتهای صوتی بلادرنگ معمولاً هزینههای گزافی دارد، اما ElevenLabs با یک اکوسیستم مبتنی بر اعتبار، این مانع را حذف کرده است. این راهکار با ترکیب LangChain و Vercel، مسیر تبدیل…

پلتفرم Mathondu با استفاده از ابزارهای گوگل، سیستمی ساخته است که عکسهای نامرتب و یادداشتهای صوتی فروشندگان خرد را به فروشگاههای دیجیتال تبدیل میکند. این سامانه تمام مراحل، از…

استارتاپ Paxa Labs مجموعهای از مدلهای تخصصی برای زبان تایلندی و انگلیسی عرضه کرد که مشکلاتی نظیر نبود فاصله بین کلمات و لهجههای منطقهای را برطرف میکند. این پلتفرم ابزارهای…

هنرمندان انیمه میان کنترل ذرهبینی ComfyUI و اکوسیستم یکپارچه PixAI Studio تقسیم شدهاند. انتخاب نهایی به این بستگی دارد که سازنده اولویت را به شخصیسازی خط لوله فنی بدهد یا فضای…

گوگل با بهروزرسانی مدل Gemini Omni Flash به نسخه ۱.۱، حالت پیشنویس ۳۶۰p را معرفی کرد که سرعت را ۶۰٪ افزایش و هزینهها را به شدت کاهش میدهد. این تغییر، تولید ویدیوهای هوش مصنوعی…

ادوبی یک محیط ویرایشی جدید در فتوشاپ معرفی کرد که ابزارهای هوش مصنوعی را در یک نوار ابزار متمرکز میکند. این بهروزرسانی قابلیت «مارکآپ» را اضافه کرده تا کاربران بهجای متن، با…