پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

ویژگی جدید «Ask Maps» گوگل شاید جذاب‌تر از Pixel بعدی باشد

«حذف فیلترهای دستی»؛ هدف جدید گوگل از ادغام Gemini در نقشه‌ها

گوگل قابلیت Ask Maps را به ۱۳۰ کشور گسترش داد تا کاربران بتوانند از طریق گفتگو، کارهای پیچیده‌ای مثل رزرو هتل و سفارش غذا را انجام دهند. این تغییر، هدف تبدیل نقشه‌ها از یک ابزار…

۳ دقیقه خواندن۳
چت‌جی‌پی‌تی و تصویر: چرا محدودیت تولید عدد ندارد، اما رد درخواست منطقی؟
آموزش کاربردی

محدودیت‌های تولید تصویر ChatGPT بر اساس بار سرور و وصله‌های امنیتی تغییر می‌کند

نسخه ۲.۰ تصاویر ChatGPT حالت «تفکر» را برای مشترکان معرفی کرد، اما سقف تولید تصاویر همچنان پنهان و پویا است. کاربران با محدودیت‌های پیش‌بینی‌ناپذیر و اعوجاج چهره در تصاویر…

۷ دقیقه خواندن۳
لوگوی میسترال و نمودار عملکرد مدل Leanstral 1.5 در بنچمارک‌های ریاضی رسمی

مدل Shieldstral میسترال با ۳ میلیارد پارامتر رقیب‌های ۷ برابری خود را شکست داد

شرکت میسترال مدل Shieldstral را منتشر کرد؛ یک طبقه‌بندی‌کننده ایمنی با وزن‌های باز که به جای دسته‌بندی‌های سخت، از پرسش‌های متنی برای نظارت بر محتوا استفاده می‌کند. این مدل…

۴ دقیقه خواندن۱
لوگوی OpenAI و نماد مغز متصل به شبکه عصبی، نماد پروژه تلپاتی.

ناومی باشکانسکی از OpenAI جدا شد تا رابط‌های «سخن‌ناپذیر» مغز را بسازد

ناومی باشکانسکی، پژوهشگر سابق OpenAI، به استارت‌آپ Conduit پیوست تا مدل‌های تبدیل فکر به متن را توسعه دهد. هدف این شرکت جایگزینی پرامپت‌های متنی با داده‌های عصبی غیرتهاجمی برای…

۹ دقیقه خواندن۱