پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

فرمول پنج‌بخشی پرامپت کلينگ: کنترل دوربین، نه چهره و دست‌ها
آموزش کاربردی

فرمول ۵‌گانه Kling AI کنترل دوربین را تضمین می‌کند اما چهره‌ها را نه

تحلیل دقیق Kling AI نشان می‌دهد که ساختار پرامپت پنج‌بخشی می‌تواند نورپردازی و حرکت دوربین را مدیریت کند، اما قادر به رفع نقص‌های ساختاری مانند تغییر شکل چهره نیست. کاربران باید…

۸ دقیقه خواندن۱
نصب دسته‌ای مهارت‌های عامل هوشمند، اما هنوز نتوانست فایلی را به من بدهد.
آموزش کاربردی

شکاف خروجی در عامل‌های هوش مصنوعی؛ چرا مدل‌ها نمی‌توانند فایل تولید کنند؟

اکثر مهارت‌های فعلی عامل‌های هوش مصنوعی بر ورودی و استدلال متمرکز شده‌اند و در تولید فایل‌های واقعی مانند تصویر یا صوت ناتوان‌اند. ابزار جدید Model Studio از علی‌بابا با ارائه یک…

۶ دقیقه خواندن۱
پیش‌نمایش اسلاید تولیدشده توسط Gemini در Google Slides
آموزش کاربردی

محدودیت‌های Gemini در گوگل اسلایدز: از خروجی‌های کلی تا شکست در اکسپورت

گوگل قابلیتی را برای تولید اسلایدهای قابل ویرایش توسط Gemini معرفی کرد، اما محدودیت‌های شدید در دسترسی، پشتیبانی تنها از زبان انگلیسی و خطاهای تبدیل به پاورپوینت، این ابزار را…

۷ دقیقه خواندن
باند فرودگاه از موبایل: سایت رسمی، اپلیکیشن اندروید و محدودیت‌های کار بدون دسکتاپ
آموزش کاربردی

اپلیکیشن اندروید Runway منتشر شد اما ابزارهای حرفه‌ای در دسکتاپ ماندند

شرکت Runway دسترسی به ابزارهای خود را با انتشار اپلیکیشن اندروید گسترش داد، اما قابلیت‌های کلیدی مانند ماسک‌گذاری دقیق و گردش‌کارهای سفارشی همچنان محدود به نسخه دسکتاپ هستند.…

۶ دقیقه خواندن۳
سازنده نشان سلطنتی هوش مصنوعی برای طراحی درفش و نشان‌های فانتزی سفارشی

ابزار Coat of Arms Maker متن‌های ساده را به نشان‌های خانوادگی تبدیل می‌کند

یک ابزار جدید مبتنی بر هوش مصنوعی، طراحی نشان‌های خانوادگی و نمادهای فانتزی را برای غیرطراحان ممکن کرده است. این سیستم با تمرکز بر قواعد سخت‌گیرانه هنر نشان‌شناسی، نیاز به آزمون و…

۲ دقیقه خواندن۱
بازبینی ۱۴۵۱۲ عکس میراث فرهنگی با مدل بینایی: منابع «معتبر» آلوده‌ترین بودند.
آموزش کاربردی

۳۰ درصد تصاویر استخراج‌شده از ویکی‌پدیا با موضوع مقاله تطبیق ندارند

یک بازرسی جامع روی ۱۴,۵۱۲ عکس نشان داد که استخراج تصاویر از متن مقالات ویکی‌پدیا به‌شدت غیرقابل اعتماد است. این مطالعه ثابت کرد مدل‌های بینایی هنگام مواجهه با نام مکان‌ها دچار…

۴ دقیقه خواندن۱
۱۵۰۰+ پرامپت عکاسی محصول با هوش مصنوعی: نکات کاربردی که واقعاً جواب می‌دهند
آموزش کاربردی

۵ الگوی مهندسی پرامپت برای تولید عکس‌های تجاری با کیفیت استودیویی

بررسی بیش از ۱,۵۰۰ پرامپت نشان می‌دهد که برای خروج از ظاهر «مصنوعی» تصاویر تجاری، باید به‌جای صفت‌های کلی، بر جزئیات فیزیکی و برندسازی تخیلی تمرکز کرد. این یافته‌ها نقشه‌ای برای…

۳ دقیقه خواندن۵
ThonburianTTS — سامانه متن‌به‌گفتار رایگان تایلندی با قابلیت اجرای محلی و شبیه‌سازی صدا، توسعه‌یافته توسط تیم تایلندی
آموزش کاربردی

مدل ThonburianTTS با ۱۰ ثانیه صوت، صدای تایلندی را با دقت ۸۹٪ شبیه‌سازی می‌کند

پژوهشگران دانشگاه ماهیدول مدل رایگان و محلی ThonburianTTS را برای شبیه‌سازی طبیعی صدای تایلندی منتشر کردند. این مدل امکان کپی صدای Zero-shot را تنها با ۵ تا ۱۰ ثانیه نمونه صوتی و…

۳ دقیقه خواندن۳
نسخه ۸.۲ میدجرنی و یک سبک ثابت: جایی که --sref تمام می‌شود و سازش آغاز می‌شود
آموزش کاربردی

شکاف نسخه‌ای Midjourney V8.2؛ چرا ثبات شخصیت‌ها هنوز به V7 وابسته است؟

نسخه V8.2 میدجرنی کیفیت بصری را ارتقا داده اما به دلیل نبود پشتیبانی بومی از ارجاع به شخصیت، کاربران حرفه‌ای را مجبور به استفاده از یک خط لوله دوگانه بین V8.2 و V7 می‌کند. این نقص…

۷ دقیقه خواندن۱