پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

معرفی Muse Glimmer: مدل عاملی متن‌باز که روی دستگاه شما اجرا می‌شود
آموزش کاربردی

مدل Muse Glimmer متا: اجرای عامل‌های ۳۰ میلیارد پارامتری روی GPUهای خانگی

متا مدل Muse Glimmer را به عنوان یک مدل وزن‌باز ۳۰ میلیارد پارامتری برای اجرای محلی عامل‌های هوش مصنوعی منتشر کرد. این مدل با استفاده از کوانتش ۴ بیتی و رمزگشایی گمانه‌زنانه، روی…

۶ دقیقه خواندن۲
فرمول پنج‌بخشی پرامپت کلينگ: کنترل دوربین، نه چهره و دست‌ها
آموزش کاربردی

فرمول ۵‌گانه Kling AI کنترل دوربین را تضمین می‌کند اما چهره‌ها را نه

تحلیل دقیق Kling AI نشان می‌دهد که ساختار پرامپت پنج‌بخشی می‌تواند نورپردازی و حرکت دوربین را مدیریت کند، اما قادر به رفع نقص‌های ساختاری مانند تغییر شکل چهره نیست. کاربران باید…

۸ دقیقه خواندن۱
نصب دسته‌ای مهارت‌های عامل هوشمند، اما هنوز نتوانست فایلی را به من بدهد.
آموزش کاربردی

شکاف خروجی در عامل‌های هوش مصنوعی؛ چرا مدل‌ها نمی‌توانند فایل تولید کنند؟

اکثر مهارت‌های فعلی عامل‌های هوش مصنوعی بر ورودی و استدلال متمرکز شده‌اند و در تولید فایل‌های واقعی مانند تصویر یا صوت ناتوان‌اند. ابزار جدید Model Studio از علی‌بابا با ارائه یک…

۶ دقیقه خواندن
پیش‌نمایش اسلاید تولیدشده توسط Gemini در Google Slides
آموزش کاربردی

محدودیت‌های Gemini در گوگل اسلایدز: از خروجی‌های کلی تا شکست در اکسپورت

گوگل قابلیتی را برای تولید اسلایدهای قابل ویرایش توسط Gemini معرفی کرد، اما محدودیت‌های شدید در دسترسی، پشتیبانی تنها از زبان انگلیسی و خطاهای تبدیل به پاورپوینت، این ابزار را…

۷ دقیقه خواندن
باند فرودگاه از موبایل: سایت رسمی، اپلیکیشن اندروید و محدودیت‌های کار بدون دسکتاپ
آموزش کاربردی

اپلیکیشن اندروید Runway منتشر شد اما ابزارهای حرفه‌ای در دسکتاپ ماندند

شرکت Runway دسترسی به ابزارهای خود را با انتشار اپلیکیشن اندروید گسترش داد، اما قابلیت‌های کلیدی مانند ماسک‌گذاری دقیق و گردش‌کارهای سفارشی همچنان محدود به نسخه دسکتاپ هستند.…

۶ دقیقه خواندن۳
سازنده نشان سلطنتی هوش مصنوعی برای طراحی درفش و نشان‌های فانتزی سفارشی

ابزار Coat of Arms Maker متن‌های ساده را به نشان‌های خانوادگی تبدیل می‌کند

یک ابزار جدید مبتنی بر هوش مصنوعی، طراحی نشان‌های خانوادگی و نمادهای فانتزی را برای غیرطراحان ممکن کرده است. این سیستم با تمرکز بر قواعد سخت‌گیرانه هنر نشان‌شناسی، نیاز به آزمون و…

۲ دقیقه خواندن
بازبینی ۱۴۵۱۲ عکس میراث فرهنگی با مدل بینایی: منابع «معتبر» آلوده‌ترین بودند.
آموزش کاربردی

۳۰ درصد تصاویر استخراج‌شده از ویکی‌پدیا با موضوع مقاله تطبیق ندارند

یک بازرسی جامع روی ۱۴,۵۱۲ عکس نشان داد که استخراج تصاویر از متن مقالات ویکی‌پدیا به‌شدت غیرقابل اعتماد است. این مطالعه ثابت کرد مدل‌های بینایی هنگام مواجهه با نام مکان‌ها دچار…

۴ دقیقه خواندن۱
۱۵۰۰+ پرامپت عکاسی محصول با هوش مصنوعی: نکات کاربردی که واقعاً جواب می‌دهند
آموزش کاربردی

۵ الگوی مهندسی پرامپت برای تولید عکس‌های تجاری با کیفیت استودیویی

بررسی بیش از ۱,۵۰۰ پرامپت نشان می‌دهد که برای خروج از ظاهر «مصنوعی» تصاویر تجاری، باید به‌جای صفت‌های کلی، بر جزئیات فیزیکی و برندسازی تخیلی تمرکز کرد. این یافته‌ها نقشه‌ای برای…

۳ دقیقه خواندن۵
ThonburianTTS — سامانه متن‌به‌گفتار رایگان تایلندی با قابلیت اجرای محلی و شبیه‌سازی صدا، توسعه‌یافته توسط تیم تایلندی
آموزش کاربردی

مدل ThonburianTTS با ۱۰ ثانیه صوت، صدای تایلندی را با دقت ۸۹٪ شبیه‌سازی می‌کند

پژوهشگران دانشگاه ماهیدول مدل رایگان و محلی ThonburianTTS را برای شبیه‌سازی طبیعی صدای تایلندی منتشر کردند. این مدل امکان کپی صدای Zero-shot را تنها با ۵ تا ۱۰ ثانیه نمونه صوتی و…

۳ دقیقه خواندن۳