پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۸۶۰ مقاله منتشر شده

معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقش‌آفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

۲ دقیقه خواندن
چگونه اوبر با مدل‌های استدلالی OpenAI فشار ذهنی رانندگان را گرفت
آموزش کاربردی

چگونه اوبر با مدل‌های استدلالی OpenAI فشار ذهنی رانندگان را گرفت

اوبر با پیاده‌سازی یک معماری عامل‌محور بر پایه OpenAI، منوهای پیچیده اپلیکیشن را با راهنمایی‌های صوتی و استدلالی جایگزین کرده است. این سیستم با هدف بهینه‌سازی درآمد رانندگان و…

۳ دقیقه خواندن
فراتر از پیکسل‌ها؛ نقشه‌ی Runway برای تسخیر دنیای فیزیکی

فراتر از پیکسل‌ها؛ نقشه‌ی Runway برای تسخیر دنیای فیزیکی

مدیرعامل Runway معتقد است تولید ویدیو تنها پیش‌درآمدی برای خلق «مدل‌های جهان» است که واقعیت فیزیکی را شبیه‌سازی می‌کنند. این چرخش استراتژیک، هدف شرکت را از ابزارهای سینمایی به سمت…

۲ دقیقه خواندن