
Gradium: کاهش تأخیر ترجمهٔ همزمان گفتار به ۳ ثانیه
شرکت Gradium با معرفی معماری دو-مدلی stt-translate و s2s-translate، تأخیر در ترجمهٔ همزمان گفتار را به ۳ ثانیه کاهش داد. این سامانه با عبور از مدلهای سنتی متنی، دقت و سرعت…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۶ مقاله منتشر شده

شرکت Gradium با معرفی معماری دو-مدلی stt-translate و s2s-translate، تأخیر در ترجمهٔ همزمان گفتار را به ۳ ثانیه کاهش داد. این سامانه با عبور از مدلهای سنتی متنی، دقت و سرعت…

آمازون با معرفی Strands Labs، امکان کنترل سختافزارهای رباتیک را از طریق دستورات سادهی متنی بهجای توابع ریاضی پیچیده فراهم کرد. این چارچوب ترکیبی از مدلهای VLA در لبه برای…

پلتفرمهای Treble Technologies و Hugging Face نخستین محک باز برای بازشناسی گفتار در میدانهای دور (Far-field ASR) را معرفی کردند. این دادهها نشان میدهد مدلهایی که در محیطهای…

گوگل پس از ۶ سال با معرفی اسپیکر هوشمند جدید، دستیار Gemini را در قالب سختافزاری ۹۹ دلاری به خانهها میآورد. این دستگاه کیفیت صدای برتری دارد اما طراحی مینیمال کنترلهای فیزیکی…

فریمورک Haystack با معرفی ساختارهای ماژولار، امکان ساخت عاملهای هوشمند و سیستمهای RAG پیچیده را فراهم میکند. تمرکز این پلتفرم بر استانداردسازی فراخوانی ابزارها و مهندسی…

شرکتها از اتوماسیون سادهی پاسخگویی به سمت تحلیلهای عمیق گفتوگو حرکت میکنند. استخراج قصد و احساسات از هزاران تماس، شناسایی نقاط ضعف محصول و ریسک ریزش مشتریان را در لحظه ممکن…

شرکت Mistral AI مدل OCR 4 را برای درک ساختار اسناد معرفی کرد که در تستهای کور، در ۷۲٪ موارد ترجیح داوران را به دست آورده است. این ابزار با ارائه امتیاز اطمینان برای هر کلمه، دقت…

جستوجوی سنتی بر پایه کلمات کلیدی در مواجهه با تفاوتهای زبانی شکست میخورد. پایگاهدادههای برداری با تبدیل دادهها به مختصات ریاضی، امکان بازیابی اطلاعات بر اساس قصد و معنا را…

مدل وزنباز M3 با پنجره متنی یک میلیون توکنی و قابلیتهای چندوجهی معرفی شد. این مدل با استفاده از معماری توجه پراکنده (MSA)، هزینه محاسباتی استنتاج در متون طولانی را بهشدت کاهش…

گوگل با بهروزرسانی دوربینهای هوشمند خود، امکان شناسایی کاربران را حتی زمانی که پشت به دوربین هستند فراهم کرد. این سیستم اکنون از سیگنالهای غیربیومتریک برای کاهش اعلانهای خطا…

پژوهشگران MIT یک مچبند التراسونیک ساختهاند که حرکات عضلات و تاندونها را به دستورات رباتیک تبدیل میکند. این سیستم با کمک هوش مصنوعی، کنترل دقیق دستهای انساننما و اشیاء مجازی…

شرکت Datalab مدل بینایی lift را با ۹ میلیارد پارامتر معرفی کرد که دادههای ساختاریافته را با دقت بالا از PDFها استخراج میکند. این مدل با استفاده از رمزگشایی محدود به طرحواره،…