
آیا اتوماسیون محتوا میتواند نرخ درآمد Pocket FM را دو برابر کند؟
پلتفرم صوتی Pocket FM با اتوماسیون بخش اعظم کاتالوگ خود، نرخ درآمد سالانه را به ۵۰۰ میلیون دلار رسانده است. این شرکت با کاهش ۸۰ برابری هزینههای تولید، حجم محتوا و نرخ بازگشت…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۰ مقاله منتشر شده

پلتفرم صوتی Pocket FM با اتوماسیون بخش اعظم کاتالوگ خود، نرخ درآمد سالانه را به ۵۰۰ میلیون دلار رسانده است. این شرکت با کاهش ۸۰ برابری هزینههای تولید، حجم محتوا و نرخ بازگشت…

اوپنایآی با معرفی API مدل GPT-Live-1، قابلیت مکالمه دوطرفه و همزمان را برای توسعهدهندگان فراهم کرد. این مدل با کاهش شدید تأخیر و افزایش دقت در فراخوانی ابزارها، فاصله میان…

شرکت Owkin پلتفرم K Pro را برای تبدیل پیشبینیهای هوش مصنوعی به واقعیتهای پزشکی معرفی کرد. این سامانه با ادغام دادههای چندوجهی بیماران و تستهای آزمایشگاهی، فرآیند کشف دارو را…

مدل بنیادی S1 به رباتها اجازه میدهد تنها با مشاهده یک ویدیو، کارهای پیچیده را بدون نیاز به آموزش مجدد یاد بگیرند. این شرکت با تکیه بر زیرساختهای انویدیا، تنها در ۱۰ ماه پس از…

شرکت Feyn مدل MultiMatte را برای حذف پیشرفته پسزمینه معرفی کرد که با جایگزینی ماسکهای باینری با آلفا مت، جزئیات پیچیده مانند مو را با دقت بالا استخراج میکند. این مدل با تنظیم…

یک متدولوژی جدید برای تست مدلهای تصویری معرفی شده است که بهجای ارزیابیهای بصری کلی، از «تثبیتهای نامتقارن» برای شناسایی خطاهای مدل در دنبال کردن پرامپت استفاده میکند. این روش…

مدل چندوجهی جدید DeepSeek با بهینهسازی حافظه موقت (KV Cache)، هزینههای استقرار عاملهای هوش مصنوعی با بستر متنی بلند را بهشدت کاهش داده است. این مدل در بنچمارکهای کدنویسی با…

پلتفرم Gradio ابزار Workflow1111 را معرفی کرد که محیط محبوب AUTOMATIC1111 را به یک بوم گرافمحور و بدون سرور تبدیل میکند. این سیستم با انتقال محاسبات به ابر، امکان اجرای…

پژوهشگران NYU Langone ابزاری مبتنی بر یادگیری عمیق توسعه دادهاند که با تحلیل تاریخچه ماموگرافیهای سهبعدی، ریسک ابتلا به سرطان سینه را در بازه ۵ ساله پیشبینی میکند. این مدل با…

معماری استریمینگ در سیستمهای تبدیل متن به گفتار (TTS) با حذف فاصلهٔ سکوت بین تولید و پخش، تجربهٔ مکالمه را انسانیتر میکند. این رویکرد با همپوشانی تولید متن توسط مدل زبانی و…

شرکت DeepSeek مدل چندوجهی V4.1-Flash را معرفی کرد که با معماری جدید رمزگذار-رمزگشا و کوانتش FP4، فشار روی حافظه HBM را در پنجرههای متنی یک میلیون توکنی بهشدت کاهش میدهد. این…

بهجای تمرکز بر پیچیدگیهای رباتهای انساننما، توسعه هوش مصنوعی باید روی پلتفرمهای متحرک کوچک مانند سگهای رباتیک متمرکز شود. این دستگاهها بهعنوان «پیرامونهای هوش مصنوعی» عمل…