پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۸ مقاله منتشر شده

مستند اپل: ویژگی‌های جدید شنیداری با حفظ حریم خصوصی

تراشه‌های جدید اپل: پردازش هوش مصنوعی صوتی در محیط ایزوله

اپل در تراشه‌های جدید خود از یک بخش ایزوله سخت‌افزاری برای پردازش صدا استفاده کرده است تا حتی سیستم‌عامل هم به فایل‌های خام دسترسی نداشته باشد. این معماری اجازه می‌دهد ویژگی‌های…

۲ دقیقه خواندن۱
برنامه‌نویسی اپلیکیشن ترجمه زبان با هوش مصنوعی، تشخیص گفتار، بینایی ماشین و رباتیک
آموزش کاربردی

۳ رکن اصلی در ساخت استک‌های چندوجهی برای ترجمهٔ رباتیک زنده

اپلیکیشن‌های ترجمه در حال تبدیل شدن به گراف‌های استنتاج پیچیده‌ای هستند که بینایی ماشین، بازشناسی گفتار و رباتیک را ادغام می‌کنند. توسعه‌دهندگان اکنون باید برای پاسخ‌های…

۱ دقیقه خواندن
ابزارهای صوتی، بوم تصاویر و شیتس گوگل به برنامه‌های هوش مصنوعی اضافه شد

گوگل ابزارهای صوتی و بوم داده‌ای را به مشترکان Gemini Pro و Ultra آورد

گوگل با ادغام ابزارهای صوتی تعاملی در Workspace و معرفی قابلیت ساخت اپلیکیشن با زبان طبیعی در Sheets، لایه‌ی هوش مصنوعی خود را از یک دستیار جانبی به هسته‌ی عملیاتی تبدیل می‌کند.…

۵ دقیقه خواندن۱
مدل ویدیویی Nightingale برای پایش بیمارستان توسط Cloudphysician رونمایی شد

پردازش محلی چگونه هزینه AI بیمارستانی را ۱۰۰ برابر کمتر می‌کند؟

شرکت Cloudphysician مدل بنیادی Nightingale را برای نظارت شبانه‌روزی بیماران معرفی کرد. این سامانه با پردازش داده‌ها در محیط بیمارستان، هزینه‌های پهنای باند و استنتاج را در مقایسه…

۴ دقیقه خواندن
تست یک ژنراتور انیمه AI در ۵ حالت شکست: تجربه عملی من
آموزش کاربردی

۵ محک عملی برای شناسایی نقاط شکست در مدل‌های تولید تصویر انیمه

انتخاب یک ابزار تولید تصویر انیمه نیازمند چیزی فراتر از تماشای گالری‌های تبلیغاتی است. این راهنما ۵ تست عملی — از ثبات شخصیت تا ویرایش دقیق — را معرفی می‌کند تا مشخص شود آیا یک…

۱۹ دقیقه خواندن۱
خودروی الکتریکی ریوین در حال رانندگی خودران در جاده‌ای شهری

قمار ۱.۲۵ میلیارد دلاری ریویان برای شکست دادن تسلا در اتومبیل‌های بدون راننده

شرکت ریویان با طراحی تراشه اختصاصی و عقد قرارداد ۱.۲۵ میلیارد دلاری با اوبر، قصد دارد از سطح ۲ به سطح ۴ اتونومی جهش کند. این استراتژی بر پایه مدل‌های رانندگی بزرگ و ادغام…

۱۵ دقیقه خواندن
سونو مدل هوش مصنوعی جدیدی با موسیقی دارای مجوز جایگزین کرد در پی دعاوی حق نشر افزایش یافت | تک‌کرانچ

Suno v6 با داده‌های لایسنس‌دار؛ پایان عصر استخراج رایگان در موسیقی AI

شرکت Suno برای کاهش دعاوی حقوقی، مدل‌های نسل ششم خود را با داده‌های قانونی از برچسب‌های موسیقی بزرگ آموزش داد. این به‌روزرسانی شامل ابزارهای ویرایش دقیق و سیستمی طبقه‌بندی‌شده…

۳ دقیقه خواندن۱
هوش مصنوعی صدا: واقعیت در برابر آرزوهای دور از دسترس

«مقیاس به‌تنهایی کافی نیست»؛ تغییر اولویت‌ها در توسعه هوش مصنوعی صوتی

متخصصان صنعت هشدار می‌دهند که افزایش مقیاس مدل‌ها لزوماً منجر به انسانی‌تر شدن عامل‌های صوتی نمی‌شود. در این حوزه، تأخیر (Latency) و مبنی‌سازی (Grounding) جایگزین تعداد پارامترها…

۵ دقیقه خواندن۱
مدل مخفی اوپن‌ای‌ای یک مسئله ریاضی یک‌میلیون‌دلاری را حل کرد.

درون مدل منتشرنشده OpenAI؛ از استدلال ریاضی تا جنجال‌های آکادمیک

یک مدل منتشرنشده از OpenAI با استفاده از ۱۰ هزار عامل هوش مصنوعی، یکی از دشوارترین مسائل ریاضی قرن را در ۸۸ ساعت حل کرد. این موفقیت با اتهامات جدی درباره سرقت مالکیت فکری از…

۷ دقیقه خواندن۲