پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۶ مقاله منتشر شده

ویدیوی «فوری» رئیستان؟ چشمان دیگر نمی‌توانند جعلی بودن آن را تشخیص دهند
آموزش کاربردی

تشخیص‌دهنده‌های تجاری در برابر مدل‌های انتشار؛ شکست در ۲۲٪ موارد

بنچمارک‌های جدید نشان می‌دهند تشخیص‌دهنده‌های تجاری در برابر مدل‌های انتشار شکست می‌خورند و ۲۲٪ از ویدیوهای جعلی از سد آن‌ها می‌گذرند. کارشناسان خواستار جایگزینی تشخیص‌های احتمالی…

۳ دقیقه خواندن۱
آنچه در هفته اول کارآموزی هوش مصنوعی در PreserveMy.World درباره بازسازی سه‌بعدی آموختم
داستان‌ها و مصاحبه‌هاتأییدنشده · منبع منفرد

۵ روش بازسازی سه‌بعدی برای دیجیتالی کردن میراث فرهنگی

پژوهگران PreserveMy.World در حال ارزیابی پنج تکنیک بازسازی سه‌بعدی برای ثبت دیجیتال مکان‌های تاریخی هستند. هدف این پروژه، ایجاد تعادلی میان کیفیت بصری و محدودیت‌های جمع‌آوری داده…

۲ دقیقه خواندن۱
انقلاب تعامل ویدیویی لحظه‌ای با هوش مصنوعی: معرفی Wan Streamer

آیا مدل Wan-Streamer می‌تواند تعاملات ویدئویی را به زمان واقعی تبدیل کند؟

تیم تحقیقاتی علی‌بابا مدل Wan-Streamer را معرفی کرد؛ نخستین مدل یکپارچه‌ای که متن، صوت و ویدیو را به‌طور هم‌زمان پردازش می‌کند. این معماری با حذف زنجیره‌های پردازش متوالی، تأخیر…

۲ دقیقه خواندن
نرم‌افزار خودکار ساخت ویدیو — rendereelstudio.ai ژوئن ۲۰۲۶
آموزش کاربردیگزارش تأییدنشده

RenderEel: مدل‌های LoRA نرخ پایداری بصری در رندرینگ ویدیو را بالا بردند

استودیوی RenderEel برای حل مشکل رندرینگ کند و کیفیت ناپایدار در ویدیوهای هوش مصنوعی، از مدل‌های تخصصی LoRA استفاده می‌کند. این رویکرد به فیلمسازان اجازه می‌دهد تا کنترل بصری…

۲ دقیقه خواندن
کتاب‌های کودکانه هوش مصنوعی، نسخه ترس بدنی
زندگی با AI

درون مکانیزم تولید محتوای AI؛ وقتی Body Horror جایگزین آموزش می‌شود

دانشنامه‌های کودکان تولید شده با هوش مصنوعی، حاوی اشکالات بصری شدید و تصاویر unsettling، بازار آمازون را تسخیر کرده‌اند. نبود نظارت انسانی بر خروجی مدل‌های پیشرفته، محتوای آموزشی…

۲ دقیقه خواندن۱
هوش مصنوعی در حال تحلیل بازخورد بصری برای درک بهتر محتوای تصویری.
آموزش کاربردی

چارچوب V-F-C: کاهش خطاهای اصلاحی در طراحی با تحلیل بازخوردهای بصری

یک چارچوب جدید به نام V-F-C به هوش مصنوعی اجازه می‌دهد به جای تکیه بر متون مبهم، نشانه‌های بصری مانند فلش‌ها و هایلایت‌ها را در طرح‌ها بفهمد. این متد با اتصال بازخوردها به عناصر…

۲ دقیقه خواندن۲