
مدل تخصصی DharmaOCR در استخراج متون پرتغالی مدلهای غولپیکر Mistral و
مدل تخصصی DharmaOCR با تمرکز بر زبان پرتغالی برزنبل، در بنچمارکهای استخراج متن از مدلهای چندزبانه و جدیدتری مانند Mistral OCR4 پیشی گرفت. این موفقیت حاصل ترکیب تنظیم دقیق…
موضوع
Models that natively process text+image+audio+video
۱٬۴۲۵ مقاله منتشر شده

مدل تخصصی DharmaOCR با تمرکز بر زبان پرتغالی برزنبل، در بنچمارکهای استخراج متن از مدلهای چندزبانه و جدیدتری مانند Mistral OCR4 پیشی گرفت. این موفقیت حاصل ترکیب تنظیم دقیق…

کیت توسعه Patter SDK ابزاری برای شبیهسازی، آزمایش و استقرار عاملهای صوتی هوش مصنوعی با تمرکز بر مدیریت تأخیر و حفاظهای ایمنی است. این چارچوب به توسعهدهندگان اجازه میدهد پیش…

ابزار متنباز Voicebox با بهرهگیری از مدلهای Whisper و Qwen، گفتار را به متن تبدیل کرده و بر اساس بستر برنامه فعال، فرمت آن را اصلاح میکند. این سیستم با استفاده از Cloudflare…

اپل قصد دارد در iOS 27 امکان مرور و پخش ویدیو را بهصورت بومی به CarPlay اضافه کند. این قابلیت بهدلیل مسائل ایمنی تنها هنگام توقف کامل خودرو فعال میشود و محدودیتهای سختافزاری…

شرکت xAI متعلق به ایلان ماسک برای نخستین بار علیه یکی از کاربران خود به دلیل دور زدن حفاظهای ایمنی برای تولید محتوای سوءاستفاده جنسی از کودکان شکایت کرد. این اقدام حقوقی…

شیائومی مدل Robotics-U0 را با ۳۸ میلیارد پارامتر بهعنوان نخستین معماری ترنسفورمر بازمتن برای یکپارچهسازی وظایف رباتیک معرفی کرد. این مدل تولید صحنه، ویدیو، تصویر و انتقال تجسمی…

پروژه Argus ابزار libargus را برای اجرای مدلهای زبانی و چندوجهی در جاوا ۲۲+ معرفی کرد. این سیستم با دور زدن حافظه Heap، تأخیرهای ناشی از Garbage Collection را کاملاً حذف کرده و…

یک رویکرد کاربردی جدید با استفاده از «پکهای پرامپت»، نیاز به آزمون و خطای مداوم در نوشتن دستورات دستی برای خلق هنر انیمه را از بین میبرد. کاربران با استفاده از قالبهای آماده در…

OpenAI در حال توسعه یک اسپیکر هوشمند بدون صفحه نمایش است که از طریق حرکات مکانیکی و شخصیت پیشکننده، حس زنده بودن را منتقل میکند. با این حال، دعوای حقوقی اپل بر سر سرقت اسرار…

شرکت Pantograph مدلی با ۴ میلیارد پارامتر به نام Pan توسعه داده که بدون نیاز به دادههای برچسبگذاریشده، تنها از طریق تماشای ویدیوهای اینترنتی، رفتارهای هدفمند را یاد میگیرد.…

بهینهسازی بازشناسی گفتار در زمان واقعی نیازمند گذار از مدلهای توکنی به قیمتگذاری مبتنی بر درخواست است. Oxlo.ai با ترکیب مدلهای کوانتیده و حذف جریمههای طول متن، تأخیر استنتاج…

استارتاپ Rime برای حذف سیستمهای IVR سنتی و جایگزینی آنها با هوش مصنوعی گفتار-به-گفتار ۲۴ میلیون دلار جذب کرد. این شرکت با ایجاد استودیوی ضبط اختصاصی، دقت تلفظ اصطلاحات تخصصی را…