پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۳۳ مقاله منتشر شده

عینک هوشمند متا با پردازش محرمانه رایانش ابری، حریم خصوصی کاربر را در هنگام استفاده از هوش مصنوعی تضمین می‌کند.

درون معماری TEE؛ راهکار متا برای پردازش رمزنگاری‌شده در عینک‌های هوشمند

متا از زیرساخت TEE برای پردازش داده‌های عینک‌های هوشمند در ابر استفاده می‌کند تا دسترسی شرکت به اطلاعات کاربران را به‌صورت رمزنگاری‌شده مسدود کند. این معماری امکان ایجاد حافظه…

۵ دقیقه خواندن۱
بررسی دستی سرفیس‌های جدید: چرا مدل Pro توجه من را جلب کرد

سرفیس پرو ۱۲ با تراشه اسنپ‌دراگون X2 پلاس و بوم هوشمند Ink Canvas

مایکروسافت نسل جدید سرفیس پرو ۱۲ و لپ‌تاپ ۱۳ را با پردازنده‌های ARM کوالکام معرفی کرد. این به‌روزرسانی شامل اپلیکیشن Ink Canvas برای گردش‌کارهای خلاقانه و لوازم جانبی با بازخورد…

۴ دقیقه خواندن
صفحه مقاله LensVLM: گسترش زمینه انتخابی برای نمایش فشرده بصری متن

LensVLM دقت مدل‌های بینایی-زبانی را در فشرده‌سازی ۱۰ برابری حفظ کرد

چارچوب LensVLM با استفاده از مکانیزم گسترش انتخابی، اجازه می‌دهد مدل‌های VLM تصاویر به‌شدت فشرده را بدون افت دقت پردازش کنند. این سیستم با شناسایی نواحی حیاتی و بزرگ‌نمایی آن‌ها،…

۲ دقیقه خواندن۱
کنترل‌های جدید وظایف زمان‌بندی‌شده، ChatGPT را به دستیار شخصی هوشمند نزدیک‌تر می‌کند.

«کنترل ابزارهای اداری با صدا»؛ قابلیت جدید ChatGPT Voice برای سازمان‌ها

اوپن‌ای‌آی قابلیت پشتیبانی از پلاگین‌ها را به حالت صوتی ChatGPT اضافه کرد تا کاربران بتوانند ابزارهای اداری خود را با دستورات گفتاری مدیریت کنند. این به‌روزرسانی همچنین قابلیت‌های…

۱ دقیقه خواندن۲
مدل‌های گفتاری جمینی ۳.۸ گوگل در API و AI Studio عرضه شد

مدل Gemini 3.8 Flash چگونه استانداردهای مدل‌سازی لهجه را جابه‌جا کرد؟

گوگل مدل‌های جدید Gemini 3.8 Flash و Flash-Lite TTS را برای شبیه‌سازی دقیق صدا و طراحی شخصیت‌های صوتی معرفی کرد. این مدل‌ها با توانایی پشتیبانی از ۱۰۰ زبان، استانداردهای کیفیت صدا…

۵ دقیقه خواندن۱
یوتیوب با هوش مصنوعی امکان ساخت الگوریتم شخصی‌سازی‌شده را فراهم می‌کند

یوتیوب کنترل الگوریتم توصیه‌ها را با پرامپت‌های Gemini به کاربر داد

یوتیوب قابلیت «فیدهای سفارشی» را معرفی کرد که به کاربران اجازه می‌دهد با زبان طبیعی، الگوریتم توصیه‌گر خود را طراحی کنند. این ابزار که توسط مدل Gemini قدرت گرفته، امکان ایجاد…

۳ دقیقه خواندن
علی‌بابا مدل متن‌باز کیوئن ۳.۸ را معرفی کرد؛ ادعا می‌کند پس از فیبل ۵ در رتبه دوم قرار دارد

کاهش قیمت‌های علی‌بابا چه تأثیری بر رقابت مدل‌های صوتی دارد؟

علی‌بابا با معرفی مجموعه مدل‌های Qwen-Audio-3.1، قیمت‌های سرویس‌های صوتی خود را به‌شدت کاهش داد. این اقدام هم‌زمان با برنامه‌ای برای ساخت مدلی با ۱۰ تریلیون پارامتر صورت می‌گیرد.

۱ دقیقه خواندن