پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

چهره‌ای مصنوعی با لب‌های هماهنگ‌نشده با صدا، دره‌ی ناخوشایند را نشان می‌دهد.
آموزش کاربردی

فقدان ریز-حرکات علت اصلی شکست آواتارهای هوش مصنوعی در عبور از دره وهم‌آور است

همگام‌سازی دقیق لب‌ها برای واقعی به نظر رسیدن آواتارهای هوش مصنوعی کافی نیست. علت اصلی ایجاد حس ناخوشایند یا «دره وهم‌آور»، نبود ریز-حرکاتی مانند پلک‌زدن و تکان‌های جزئی سر است که…

۵ دقیقه خواندن
عینک هوشمند متا با پردازش محرمانه رایانش ابری، حریم خصوصی کاربر را در هنگام استفاده از هوش مصنوعی تضمین می‌کند.

درون معماری TEE؛ راهکار متا برای پردازش رمزنگاری‌شده در عینک‌های هوشمند

متا از زیرساخت TEE برای پردازش داده‌های عینک‌های هوشمند در ابر استفاده می‌کند تا دسترسی شرکت به اطلاعات کاربران را به‌صورت رمزنگاری‌شده مسدود کند. این معماری امکان ایجاد حافظه…

۵ دقیقه خواندن۱
عینک هوشمند متا به هوش مصنوعی Muse مجهز می‌شود
اخبار کوتاه روزانه

«از جاکلیدی تا عینک»؛ تغییر بستر عملیاتی عامل هوش مصنوعی Muse

متا عامل هوش مصنوعی Muse را در عینک‌های هوشمند خود ادغام کرد تا وظایفی مانند هدایت تمرینات ورزشی و ثبت وعده‌های غذایی را بر عهده بگیرد. این به‌روزرسانی شامل قابلیت‌های بهبود…

۲ دقیقه خواندن
بررسی دستی سرفیس‌های جدید: چرا مدل Pro توجه من را جلب کرد
اخبار کوتاه روزانه

سرفیس پرو ۱۲ با تراشه اسنپ‌دراگون X2 پلاس و بوم هوشمند Ink Canvas

مایکروسافت نسل جدید سرفیس پرو ۱۲ و لپ‌تاپ ۱۳ را با پردازنده‌های ARM کوالکام معرفی کرد. این به‌روزرسانی شامل اپلیکیشن Ink Canvas برای گردش‌کارهای خلاقانه و لوازم جانبی با بازخورد…

۴ دقیقه خواندن
صفحه مقاله LensVLM: گسترش زمینه انتخابی برای نمایش فشرده بصری متن

LensVLM دقت مدل‌های بینایی-زبانی را در فشرده‌سازی ۱۰ برابری حفظ کرد

چارچوب LensVLM با استفاده از مکانیزم گسترش انتخابی، اجازه می‌دهد مدل‌های VLM تصاویر به‌شدت فشرده را بدون افت دقت پردازش کنند. این سیستم با شناسایی نواحی حیاتی و بزرگ‌نمایی آن‌ها،…

۲ دقیقه خواندن۱
کنترل‌های جدید وظایف زمان‌بندی‌شده، ChatGPT را به دستیار شخصی هوشمند نزدیک‌تر می‌کند.
اخبار کوتاه روزانه

«کنترل ابزارهای اداری با صدا»؛ قابلیت جدید ChatGPT Voice برای سازمان‌ها

اوپن‌ای‌آی قابلیت پشتیبانی از پلاگین‌ها را به حالت صوتی ChatGPT اضافه کرد تا کاربران بتوانند ابزارهای اداری خود را با دستورات گفتاری مدیریت کنند. این به‌روزرسانی همچنین قابلیت‌های…

۱ دقیقه خواندن۳
مدل‌های گفتاری جمینی ۳.۸ گوگل در API و AI Studio عرضه شد
اخبار کوتاه روزانه

مدل Gemini 3.8 Flash چگونه استانداردهای مدل‌سازی لهجه را جابه‌جا کرد؟

گوگل مدل‌های جدید Gemini 3.8 Flash و Flash-Lite TTS را برای شبیه‌سازی دقیق صدا و طراحی شخصیت‌های صوتی معرفی کرد. این مدل‌ها با توانایی پشتیبانی از ۱۰۰ زبان، استانداردهای کیفیت صدا…

۵ دقیقه خواندن۱
یوتیوب با هوش مصنوعی امکان ساخت الگوریتم شخصی‌سازی‌شده را فراهم می‌کند
اخبار کوتاه روزانه

یوتیوب کنترل الگوریتم توصیه‌ها را با پرامپت‌های Gemini به کاربر داد

یوتیوب قابلیت «فیدهای سفارشی» را معرفی کرد که به کاربران اجازه می‌دهد با زبان طبیعی، الگوریتم توصیه‌گر خود را طراحی کنند. این ابزار که توسط مدل Gemini قدرت گرفته، امکان ایجاد…

۳ دقیقه خواندن