پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

قیمت‌گذاری API اوپن‌ای‌ای
آموزش کاربردی

OpenAI هزینه استنتاج مدل GPT-5.6 Sol را به ۴ دلار در هر میلیون توکن رساند

اوپن‌ای‌آی با معرفی خانواده مدل‌های GPT-5.6، ساختار قیمت‌گذاری API خود را تغییر داد. این به‌روزرسانی شامل مدل‌های Sol، Terra و Luna است و هزینه‌های جدیدی برای ابزارهای تخصصی مانند…

۳ دقیقه خواندن۲
سرمایه‌گذاری ۶ میلیارد دلاری والور و پوینت۷۲ در جنرال اینتویشن برای توسعه رباتیک مبتنی بر هوش مصنوعی
اخبار کوتاه روزانهگزارش تأییدنشده

«مدل‌های بنیادی در دنیای فیزیکی»؛ استراتژی ۶ میلیارد دلاری General Intuition

شرکت General Intuition در حال جذب سرمایه با ارزش‌گذاری ۶ میلیارد دلاری است تا مدل‌های بنیادی خود را به دنیای فیزیکی منتقل کند. این شرکت از داده‌های عظیم بازی‌های ویدئویی برای…

۲ دقیقه خواندن۲
مترجم گفتاری لحظه‌ای در رستوران: ارتباطی روان‌تر بدون مرز زبانی
آموزش کاربردی

PolyTalk با معماری کم‌تأخیر، سد زبانی رستوران‌ها را می‌شکند

سامانه PolyTalk با پیاده‌سازی یک خط لوله گفتار-به-گفتار میزبانی‌شده، مشکل تأخیر بالا و خطاهای ترجمه در محیط‌های شلوغ رستوران را حل می‌کند. این سیستم به‌جای ترجمه جملات تکه‌تکه، از…

۵ دقیقه خواندن۱
اتوماسیون بیمارستان در حال بهبود ارائه خدمات درمانی است
زندگی با AI

اتوماسیون بیمارستانی با گردش‌کارهای هوش مصنوعی هزینه‌های اداری را کاهش داد

سازمان‌های بهداشتی برای کاهش فرسودگی کادر درمان، وظایف تکراری اداری و برچسب‌گذاری تصاویر پزشکی را به سامانه‌های هوشمند می‌سپارند. این تغییر رویکرد، تمرکز پزشکان را از ثبت داده‌ها…

۴ دقیقه خواندن
کودکان از هوش مصنوعی پیشی می‌گیرند—و ما هنوز نمی‌دانیم چرا

شکاف بهره‌وری داده: چرا کودکان با ۱۰۰۰ برابر دادهٔ کمتر از AI یاد می‌گیرند؟

کودکان با کسری از داده‌های مورد نیاز مدل‌های زبانی بزرگ، تسلط بر زبان را به دست می‌آورند. پژوهشگران اکنون با مدل‌های «مقیاس نوزاد» و دوربین‌های سرپوشی در تلاش‌اند تا مکانیسم…

۱۷ دقیقه خواندن۲
مقایسه Veo 3.1 و Veo 3: مشخصات، صدا، قیمت و نحوه استفاده
آموزش کاربردی

آیا ابزار گسترش صحنه محدودیت 8 ثانیه‌ای کلیپ‌های Veo را می‌شکند؟

نسخه جدید Veo 3.1 گوگل با معرفی قابلیت تصاویر مرجع و همگام‌سازی صوتی، مشکل تغییر چهره شخصیت‌ها در ویدیوهای تولیدی را حل کرده است. اگرچه سقف هر کلیپ همچنان ۸ ثانیه است، اما ابزار…

۷ دقیقه خواندن
ویدیوی معرفی محصول BhaShaVox با دوبله هندی: چرا و چگونه؟
آموزش کاربردی

BhaShaVox با دوبلهٔ هوش مصنوعی مسیر ورود به بازارهای چندزبانه را هموار کرد

پلتفرم BhaShaVox با استفاده از فناوری دوبلهٔ خودکار، راهنمای محصولاتش را به زبان هندی بومی‌سازی کرد تا نرخ جذب کاربر در هند را افزایش دهد. این ابزار با ترکیب شبیه‌سازی صدا و…

۴ دقیقه خواندن
سوریا ناردی، شخصیت اصلی انیمه، با لباس سنتی ژاپنی و چتر قرمز در برابر آسمان غروب.
آموزش کاربردی

درون سازوکار تبدیل جاوااسکریپت به بوم نقاشی توسط هوش مصنوعی

پژوهشگر سوریا ناردی سیستمی را توسعه داده که به‌جای تولید پیکسل، با نوشتن کدهای جاوااسکریپت نقاشی می‌کند. این رویکرد به کاربران اجازه می‌دهد با تغییر خطوط کد، جزئیات اثر هنری را…

۴ دقیقه خواندن