پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۶ مقاله منتشر شده

تأخیر، مشکل واقعی تجربه کاربری در آواتارهای هوش مصنوعی است، نه صدا
آموزش کاربردی

تحلیل UX: تأخیر در استریمینگ مانع اثرگذاری کیفیت صدای آواتارهاست

کیفیت بالای صدا نمی‌تواند نقص آواتارهای هوش مصنوعی را بپوشاند اگر تأخیر سیستم باعث سکوت‌های طولانی شود. توسعه‌دهندگان باید به‌جای تمرکز بر انتخاب ارائه‌دهنده TTS، اولویت خود را بر…

۲ دقیقه خواندن۲
هوش مصنوعی و استدلال چندوجهی ریاضی: از حدس زدن تا تفکر واقعی
آموزش کاربردی

مدل‌های استدلالی با ترکیب منطق نمادین به صحت ۹۶ درصدی در بنچمارک MATH رسیدند

تغییری بنیادین در معماری هوش مصنوعی، «حدس زدن» را با استدلال آگاهانه جایگزین کرد. مدل‌های جدید سال ۲۰۲۶ با ترکیب شبکه‌های عصبی و منطق نمادین، مسائل ریاضی سطح مسابقات و علوم دکتری…

۸ دقیقه خواندن۲
دیو گارگ، مدیرعامل و هم‌بنیان‌گذار AGI, Inc در مصاحبه‌ای اختصاصی

AGI Inc با حذف APIها، کنترل گوشی‌های هوشمند را به عامل‌های محلی سپرد

شرکت AGI Inc در حال توسعه سامانه AGI-0 است که به‌جای تکیه بر APIها، مستقیماً با رابط کاربری نمایشگر تعامل می‌کند. این شرکت برای کاهش تأخیر و افزایش حریم خصوصی، با کوالکام و لنوو…

۸ دقیقه خواندن۳
عوامل هوش مصنوعی ترجیح می‌دهند آثار دارای حق نشر را بدزدند تا از گزینه‌های متن‌باز استفاده کنند

Copyright-Bench: تمایل عامل‌های AI به سرقت تصاویر با وجود جایگزین‌های رایگان

پژوهش جدید نشان می‌دهد عامل‌های هوش مصنوعی، چه تجاری و چه متن‌باز، تمایل دارند تصاویر دارای کپی‌رایت را به جای جایگزین‌های رایگان و باکیفیت انتخاب کنند. این مطالعه تأکید می‌کند که…

۱۰ دقیقه خواندن۲
تولیدکننده انفرادی ویدیو که از هوش مصنوعی برای ساخت تبلیغات خلاقانه استفاده می‌کند.
زندگی با AI

تولیدکنندگان مستقل با ابزارهای تبلیغاتی AI چرخه‌ی تولید ویدیو را کوتاه کردند

یک تولیدکننده محتوا فاش کرد که چگونه ابزارهای تولید تبلیغات با هوش مصنوعی، جریان کار را از ویرایش دستی خسته‌کننده به تست‌های سریع و تکرارشونده تغییر داده است. در این رویکرد، AI…

۶ دقیقه خواندن