پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

ساخت دستیار صوتی هندی برای دانشجویان رباتیک: یادگیری محدودیت‌های پرامپت‌ها
آموزش کاربردی

شکستِ پرامپت‌ها در اجرای حفاظ‌های امنیتی؛ درس‌هایی از ساخت یک معلم صوتی

توسعه یک عامل صوتی برای دانشجویان رباتیک نشان داد که قوانین حیاتی ایمنی و مسیریابی نباید در پرامپت‌ها نوشته شوند، بلکه باید در کد ابزارها سخت‌افزاری شوند. این پروژه معماری…

۱۳ دقیقه خواندن۳
ربات واقعی در هزاران سناریوی شبیه‌سازی‌شده برای آموزش هوش مصنوعی

«پایان گلوگاه داده»؛ راهکار World Labs برای آموزش سریع‌تر ربات‌ها

شرکت World Labs با معرفی موتور R2S2R، گلوگاه کمبود داده در رباتیک را هدف قرار داده است. این سامانه با تبدیل یک تسک واقعی به هزاران نسخهٔ مجازی، نیاز به جمع‌آوری داده‌های گران‌قیمت…

۴ دقیقه خواندن۱
تست جدید: هوش مصنوعی هنوز در درک بصری ضعیف است

چرا پیشرفته‌ترین مدل‌های هوش مصنوعی در مهارت‌های بصری پایه شکست می‌خورند؟

محک جدید Moonshot AI نشان می‌دهد حتی پیشرفته‌ترین مدل‌های چندوجهی در درک ابتدایی تصاویر ناتوان‌اند. هیچ مدلی نتوانست از مرز ۶۰ درصد صحت در مهارت‌های بصری پایه عبور کند، که ثابت…

۴ دقیقه خواندن۱
تشخیص یک‌کلیکی سازگار با OpenAI برای Node.js در اروپا/آمریکا بدون پشتیبانی تبدیل گفتار به متن
آموزش کاربردی

«به جای کلید واحد از Feature Flags استفاده کنید»؛ هشدار به توسعه‌دهندگان

استفاده از یک کلید API واحد برای محیط‌های سازگار با OpenAI، فعال بودن تمام مودالیته‌ها مانند ASR را در هر منطقه تضمین نمی‌کند. توسعه‌دهندگان برای جلوگیری از شکست در محیط عملیاتی،…

۶ دقیقه خواندن
BolBuddy: از یک عامل صوتی تا همراه یادگیری انگلیسی هندی در ۱۰ روز
آموزش کاربردی

BolBuddy: ساخت عامل صوتی یادگیری زبان در ۱۰ روز با تأخیر زیر ۸۰۰ میلی‌ثانیه

پروژه BolBuddy یک همراه هوش مصنوعی صوتی است که برای کاهش اضطراب صحبت کردن دانشجویان هندی طراحی شده است. این سیستم با ترکیب LiveKit و Groq، محیطی کم‌فشار برای تمرین انگلیسی فراهم…

۱۱ دقیقه خواندن۴