پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۶۰ مقاله منتشر شده

نصب دسته‌ای مهارت‌های عامل هوشمند، اما هنوز نتوانست فایلی را به من بدهد.

شکاف خروجی در عامل‌های هوش مصنوعی؛ چرا مدل‌ها نمی‌توانند فایل تولید کنند؟

اکثر مهارت‌های فعلی عامل‌های هوش مصنوعی بر ورودی و استدلال متمرکز شده‌اند و در تولید فایل‌های واقعی مانند تصویر یا صوت ناتوان‌اند. ابزار جدید Model Studio از علی‌بابا با ارائه یک…

۶ دقیقه خواندن
پیش‌نمایش اسلاید تولیدشده توسط Gemini در Google Slides

محدودیت‌های Gemini در گوگل اسلایدز: از خروجی‌های کلی تا شکست در اکسپورت

گوگل قابلیتی را برای تولید اسلایدهای قابل ویرایش توسط Gemini معرفی کرد، اما محدودیت‌های شدید در دسترسی، پشتیبانی تنها از زبان انگلیسی و خطاهای تبدیل به پاورپوینت، این ابزار را…

۷ دقیقه خواندن
باند فرودگاه از موبایل: سایت رسمی، اپلیکیشن اندروید و محدودیت‌های کار بدون دسکتاپ
آموزش کاربردی

اپلیکیشن اندروید Runway منتشر شد اما ابزارهای حرفه‌ای در دسکتاپ ماندند

شرکت Runway دسترسی به ابزارهای خود را با انتشار اپلیکیشن اندروید گسترش داد، اما قابلیت‌های کلیدی مانند ماسک‌گذاری دقیق و گردش‌کارهای سفارشی همچنان محدود به نسخه دسکتاپ هستند.…

۶ دقیقه خواندن۳
سازنده نشان سلطنتی هوش مصنوعی برای طراحی درفش و نشان‌های فانتزی سفارشی

ابزار Coat of Arms Maker متن‌های ساده را به نشان‌های خانوادگی تبدیل می‌کند

یک ابزار جدید مبتنی بر هوش مصنوعی، طراحی نشان‌های خانوادگی و نمادهای فانتزی را برای غیرطراحان ممکن کرده است. این سیستم با تمرکز بر قواعد سخت‌گیرانه هنر نشان‌شناسی، نیاز به آزمون و…

۲ دقیقه خواندن
بازبینی ۱۴۵۱۲ عکس میراث فرهنگی با مدل بینایی: منابع «معتبر» آلوده‌ترین بودند.
آموزش کاربردی

۳۰ درصد تصاویر استخراج‌شده از ویکی‌پدیا با موضوع مقاله تطبیق ندارند

یک بازرسی جامع روی ۱۴,۵۱۲ عکس نشان داد که استخراج تصاویر از متن مقالات ویکی‌پدیا به‌شدت غیرقابل اعتماد است. این مطالعه ثابت کرد مدل‌های بینایی هنگام مواجهه با نام مکان‌ها دچار…

۴ دقیقه خواندن۱
۱۵۰۰+ پرامپت عکاسی محصول با هوش مصنوعی: نکات کاربردی که واقعاً جواب می‌دهند
آموزش کاربردی

۵ الگوی مهندسی پرامپت برای تولید عکس‌های تجاری با کیفیت استودیویی

بررسی بیش از ۱,۵۰۰ پرامپت نشان می‌دهد که برای خروج از ظاهر «مصنوعی» تصاویر تجاری، باید به‌جای صفت‌های کلی، بر جزئیات فیزیکی و برندسازی تخیلی تمرکز کرد. این یافته‌ها نقشه‌ای برای…

۳ دقیقه خواندن۴
ThonburianTTS — سامانه متن‌به‌گفتار رایگان تایلندی با قابلیت اجرای محلی و شبیه‌سازی صدا، توسعه‌یافته توسط تیم تایلندی
آموزش کاربردی

مدل ThonburianTTS با ۱۰ ثانیه صوت، صدای تایلندی را با دقت ۸۹٪ شبیه‌سازی می‌کند

پژوهشگران دانشگاه ماهیدول مدل رایگان و محلی ThonburianTTS را برای شبیه‌سازی طبیعی صدای تایلندی منتشر کردند. این مدل امکان کپی صدای Zero-shot را تنها با ۵ تا ۱۰ ثانیه نمونه صوتی و…

۳ دقیقه خواندن۱
نسخه ۸.۲ میدجرنی و یک سبک ثابت: جایی که --sref تمام می‌شود و سازش آغاز می‌شود
آموزش کاربردی

شکاف نسخه‌ای Midjourney V8.2؛ چرا ثبات شخصیت‌ها هنوز به V7 وابسته است؟

نسخه V8.2 میدجرنی کیفیت بصری را ارتقا داده اما به دلیل نبود پشتیبانی بومی از ارجاع به شخصیت، کاربران حرفه‌ای را مجبور به استفاده از یک خط لوله دوگانه بین V8.2 و V7 می‌کند. این نقص…

۷ دقیقه خواندن۱
شکایت اپل در بدترین زمان ممکن برای اوپن‌ای‌ای رخ داد
اخبار کوتاه روزانهگزارش تأییدنشده

OpenAI: بلندگوی هوشمند ۴۰۰ دلاری برای حضور فیزیکی ChatGPT

اوپن‌ای‌آی در همکاری با استودیوی LoveFrom در حال توسعه یک بلندگوی هوشمند لوکس با قیمت ۳۰۰ تا ۴۰۰ دلار است. این دستگاه که احتمالاً در سال ۲۰۲۷ عرضه می‌شود، هدفش تبدیل ChatGPT از یک…

۲ دقیقه خواندن