
GPT-Live: تفکیک «مغز» از «گوش» برای حذف تأخیر در مکالمات صوتی
اوپنایآی با معرفی GPT-Live، معماری صوتی را از حالت نوبتی به دوبلکس کامل تغییر داد. این سیستم با تفکیک لایهٔ تعامل از لایهٔ استدلال، پردازشهای سنگین را به مدل GPT-5.5 میسپرد تا…
موضوع
Models that natively process text+image+audio+video
۸۷۶ مقاله منتشر شده

اوپنایآی با معرفی GPT-Live، معماری صوتی را از حالت نوبتی به دوبلکس کامل تغییر داد. این سیستم با تفکیک لایهٔ تعامل از لایهٔ استدلال، پردازشهای سنگین را به مدل GPT-5.5 میسپرد تا…

استارتآپ فرانسوی Gradium با حمایت انویدیا، ۱۰۰ میلیون دلار جذب کرد تا تأخیرهای آزاردهنده در پاسخهای صوتی هوش مصنوعی را از بین ببرد. این شرکت روی مدلهای صوتی با تأخیر بسیار…

شرکت 1X ربات Neo را با دستهایی دارای ۲۵ درجه آزادی معرفی کرد که تقلیدی دقیق از تاندونهای انسانی است. این ربات با هدف اتوماسیون خانگی طراحی شده، اما فعلاً برای کارهای پیچیده به…

شرکت Image Line ابزار Gopher AI را از یک راهنمای متنی به دستیاری فعال تبدیل کرد که میتواند آهنگسازی و اعمال افکتها را در DAW انجام دهد. این بهروزرسانی شامل بازبینی موتور Flex و…

افزار FableCut با تبدیل کل خط زمانی تدوین را به یک سند JSON، امکان کنترل دقیق و لحظهای ویدیوها را به عاملهای هوشمند میدهد. این سیستم برخلاف مدلهای مولد، اجازه میدهد انسان و…

پلتفرم Character.ai با ورود به بازار میکرودراما، سریالهایی تولید کرده که کاربران میتوانند با شخصیتهای آن گفتگو کنند و مسیر داستان را تغییر دهند. این شرکت قصد دارد از یک مدل…
ابزارهای ساخت آواتار بر اساس سه معماری رندرینگ متفاوت عمل میکنند که مستقیماً بر سرعت، پایداری و مدل قیمتگذاری آنها اثر میگذارد. انتخاب اشتباه ابزار بدون درک این تفاوتها، منجر…

مدل ۹ میلیارد پارامتری Lift با حذف مرحله تبدیل به Markdown، دادههای ساختاریافته را مستقیماً از تصاویر PDF به JSON تبدیل میکند. این مدل در سرعت استنتاج از Gemini Flash 3.5 جلو…

ابزار متنباز SWT با بهرهگیری از چارچوب FunASR، امکان تبدیل گفتار به متن را بهصورت کاملاً آفلاین فراهم میکند. این نرمافزار با انتقال استنتاج به سختافزار کاربر، ریسک نشت…

استارتاپ General Intuition با استفاده از میلیونها ساعت دادههای بازیهای ویدئویی، مدلی بنیادی برای هوش مصنوعی فیزیکی ساخته است. این روش اجازه میدهد رباتها حرکات پیچیده را با…

گوگل ابزار Video Remix را برای مشترکان سرویسهای هوش مصنوعی خود عرضه کرد. این قابلیت با بهرهگیری از مدل Gemini Omni، امکان تغییر سبک، نورپردازی و پسزمینه ویدیوهای ذخیره شده را…

استارتآپ General Intuition با استفاده از دادههای بازیهای ویدئویی، در حال آموزش هوش مصنوعی برای درک حرکت اشیاء در مکان و زمان است. این شرکت با جذب ۳۲۰ میلیون دلار سرمایه، قصد…