پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۷ مقاله منتشر شده

فردریک نیلسون، معاون رئیس‌جمهور آمریکای اکسیس کمیونیکیشنز، در حال مصاحبه با لبخند.

اکسیس کامیونیکیشنز ۹۰٪ پردازش‌های هوش مصنوعی را به لبهٔ شبکه منتقل کرد

شرکت اکسیس با ترکیب تراشه‌های تخصصی و مدل‌های بهینه، پردازش داده‌ها را از ابر به داخل دوربین‌ها منتقل کرده است. این تغییر باعث کاهش شدید تأخیر و هزینه‌های پهنای باند در سیستم‌های…

۱۰ دقیقه خواندن
برایان هارتزبند، رئیس عملیات آمریکا، GMEX Robotics – مجموعه مصاحبه

چرا هوش اجتماعی گلوگاه بعدی توسعهٔ ربات‌های GMEX Robotics است؟

شرکت GMEX Robotics با تغییر استراتژی از یکپارچگی عمودی به مدل «ترمینال + مغز»، بر هوش اجتماعی ربات‌ها تمرکز کرده است. هدف این شرکت انتقال ربات‌ها از محیط‌های ساختاریافتهٔ انبارها…

۸ دقیقه خواندن۱
نور پسین: اشیای کوچک، زندگی‌های نامحتمل پس از مرگ، و سخن پایانی انسان
آموزش کاربردی

Afterlight: مدل مدیریت محتوا برای حذف توهمات در روایت‌های هوش مصنوعی

پروژه Afterlight با ایجاد یک موزه دیجیتال از سال ۲۱۲۶، سیستمی را معرفی می‌کند که در آن هر روایت تولیدشده توسط Gemini باید توسط یک کیوریتور انسانی تأیید شود. این رویکرد نشان می‌دهد…

۶ دقیقه خواندن
لوگوی مایکروسافت در کنار نماد هوش مصنوعی و امواج صوتی، نمایانگر معرفی مدل‌های جدید MAI-Transcribe-2-Streaming و MAI-Voice

مدل MAI-Transcribe-2 چگونه پاسخ‌دهی بلادرنگ هوش مصنوعی را ممکن می‌کند؟

مایکروسافت مجموعه‌ای از مدل‌های صوتی بلادرنگ را برای حذف تأخیر در هوش مصنوعی صوتی عرضه کرد. مدل جدید MAI-Transcribe-2-Streaming به عامل‌های هوشمند اجازه می‌دهد هم‌زمان با صحبت…

۴ دقیقه خواندن۱
عکس: دستی که با مداد ویدیویی را به متن تبدیل می‌کند، نماد مهندسی معکوس هوش مصنوعی
آموزش کاربردی

معماری دو لایهٔ پرامپت هزینهٔ پردازشی ویدیوهای هوش مصنوعی را کاهش داد

یک چارچوب جدید برای مهندسی معکوس ویدیو، تولید لوپ‌های سینمایی پیش‌بینی‌پذیر را بدون نیاز به آزمون و خطاهای هزینه‌بر ممکن می‌کند. این روش با تفکیک پرامپت‌ها به دو بخش «گراف صحنه» و…

۳ دقیقه خواندن