پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

راهنمای Patter SDK برای ساخت عامل تلفنی رزرو رستوران با متغیرهای پویا، محدودیت‌ها، داشبورد تأخیر و ارزیابی‌ها
آموزش کاربردی

درون Patter SDK؛ مدل‌سازی جریان‌های کاری تلفنی پیش از اتصال واقعی

کیت توسعه Patter SDK ابزاری برای شبیه‌سازی، آزمایش و استقرار عامل‌های صوتی هوش مصنوعی با تمرکز بر مدیریت تأخیر و حفاظ‌های ایمنی است. این چارچوب به توسعه‌دهندگان اجازه می‌دهد پیش…

۱۴ دقیقه خواندن۱
تغییر بزرگ آینده CarPlay در iOS 27 که اپل بی‌سر‌و‌صدا پنهان کرده

«تنها هنگام توقف»؛ شرط ایمنی اپل برای مرور ویدیو در خودرو

اپل قصد دارد در iOS 27 امکان مرور و پخش ویدیو را به‌صورت بومی به CarPlay اضافه کند. این قابلیت به‌دلیل مسائل ایمنی تنها هنگام توقف کامل خودرو فعال می‌شود و محدودیت‌های سخت‌افزاری…

۵ دقیقه خواندن۱
شکایت xAI از مردی به دلیل تولید تصاویر جعلی سوءاستفاده جنسی از کودکان با Grok

xAI برای اولین بار علیه کاربر تولیدکننده محتوای غیرقانونی اقامه دعوا کرد

شرکت xAI متعلق به ایلان ماسک برای نخستین بار علیه یکی از کاربران خود به دلیل دور زدن حفاظ‌های ایمنی برای تولید محتوای سوءاستفاده جنسی از کودکان شکایت کرد. این اقدام حقوقی…

۲ دقیقه خواندن
بسته آماده کپی پرامپت انیمه تابستانی برای مبتدیان (بدون سردرد نوشتن پرامپت)
آموزش کاربردی

آیا پک‌های پرامپت نیاز به مهندسی دستورات دستی را از بین می‌برند؟

یک رویکرد کاربردی جدید با استفاده از «پک‌های پرامپت»، نیاز به آزمون و خطای مداوم در نوشتن دستورات دستی برای خلق هنر انیمه را از بین می‌برد. کاربران با استفاده از قالب‌های آماده در…

۲ دقیقه خواندن
اسپیکر هوشمند بدون صفحه‌نمایش اوپن‌ای‌آی که حس زنده بودن می‌دهد

سخت‌افزار جدید OpenAI؛ دستیاری فیزیکی برای جایگزینی نمایشگرها

OpenAI در حال توسعه یک اسپیکر هوشمند بدون صفحه نمایش است که از طریق حرکات مکانیکی و شخصیت پیش‌کننده، حس زنده بودن را منتقل می‌کند. با این حال، دعوای حقوقی اپل بر سر سرقت اسرار…

۳ دقیقه خواندن
مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

آیا تماشای ویدیوهای اینترنتی می‌تواند جایگزین برچسب‌گذاری داده‌ها شود؟

شرکت Pantograph مدلی با ۴ میلیارد پارامتر به نام Pan توسعه داده که بدون نیاز به داده‌های برچسب‌گذاری‌شده، تنها از طریق تماشای ویدیوهای اینترنتی، رفتارهای هدفمند را یاد می‌گیرد.…

۱۵ دقیقه خواندن
بهینه‌سازی استنتاج مدل زبانی بزرگ برای بازشناسی گفتار با تأخیر کم
آموزش کاربردی

قیمت‌گذاری مبتنی بر درخواست در برابر مدل توکنی برای کاهش تأخیر گفتار

بهینه‌سازی بازشناسی گفتار در زمان واقعی نیازمند گذار از مدل‌های توکنی به قیمت‌گذاری مبتنی بر درخواست است. Oxlo.ai با ترکیب مدل‌های کوانتیده و حذف جریمه‌های طول متن، تأخیر استنتاج…

۴ دقیقه خواندن۱
لوگوی شرکت Rime روی زمینه‌ای آبی تیره، با عنوان خبر جذب سرمایه ۲۴ میلیون دلاری برای مدیریت تماس مشتریان

Rime با سرمایه ۲۴ میلیون دلاری جایگزین سیستم‌های تلفنی قدیمی می‌شود

استارتاپ Rime برای حذف سیستم‌های IVR سنتی و جایگزینی آن‌ها با هوش مصنوعی گفتار-به-گفتار ۲۴ میلیون دلار جذب کرد. این شرکت با ایجاد استودیوی ضبط اختصاصی، دقت تلفظ اصطلاحات تخصصی را…

۳ دقیقه خواندن۱