
آیا خواندن Logprobs میتواند مدلهای زبانی را به سرعت Jev برساند؟
پژوهشگران راهکاری برای تبدیل مدلهای زبانی عمومی به مدلهای تصمیمگیرنده با سرعت بسیار بالا یافتهاند. این روش بهجای تولید متن، توزیع احتمالات توکنها را میخواند و در مدل…
موضوع
Models that natively process text+image+audio+video
۱٬۴۱۸ مقاله منتشر شده

پژوهشگران راهکاری برای تبدیل مدلهای زبانی عمومی به مدلهای تصمیمگیرنده با سرعت بسیار بالا یافتهاند. این روش بهجای تولید متن، توزیع احتمالات توکنها را میخواند و در مدل…

پژوهشگران استنفورد رباتی انساننما توسعه دادهاند که با ساخت دوقلوهای دیجیتال از محیطهای جدید، کارهای پیچیده خانگی را بدون اسکریپتهای پیشنویس اجرا میکند. این سیستم با ترکیب…

رویکرد جدیدی به نام تقلیل دانش متقاطع (CMKD) به کاوشگرهای سیارهای اجازه میدهد تا با استفاده از دادههای غنی حسگرهای مداری، زمینشناسی پیچیده را حتی بدون داشتن تصاویر برچسبدار…

یک توسعهدهنده مستقل توانست با ترکیب هوش مصنوعی صوتی و عاملهای خودمختار، تمام فرآیندهای نگهداری نرمافزاری و رندرهای سهبعدی استودیوی خود را از روی کاناپه مدیریت کند. این تجربه…

شرکت Sarvam AI مدل Saaras V4 را برای بازشناسی گفتار در ۲۲ زبان هندی و انگلیسی جهانی معرفی کرد. این مدل با استفاده از یک رمزگشای ترکیبی، دقت استخراج متن از فایلهای صوتی با نویز…

زیرساختهای هوش مصنوعی صوتی از ابر به لبه منتقل شدهاند و اکنون شبیهسازی فوقواقعگرایانه صدا روی دستگاههای موبایل در کمتر از یک ثانیه رخ میدهد. این تحول با ادغام قابلیتهای…

پلتفرم Oxlo.ai با جایگزینی مدل توکنمحور با قیمتگذاری ثابت بهازای هر درخواست، هزینه استنتاج مدلهای زبانی را پیشبینیپذیر کرد. این تغییر اجازه میدهد توسعهدهندگان بدون نگرانی…

ابزار جدید Drawgent با اتصال عاملهای هوش مصنوعی مانند Claude Code به تختهسیاههای Excalidraw، امکان ترسیم و ویرایش نمودارهای فنی را بهصورت زنده فراهم میکند. این سیستم اجازه…

مجموعهای از مهارتهای جدید Claude Code با ترکیب موتور Stockfish و تحلیل صوت کاربر، بازیهای شطرنج را به ویدیوهای تحلیلی تبدیل میکند. این سیستم بهجای ارائه صرفِ خطوط موتور،…

توسعهدهندگان با استفاده از تبدیل متن به گفتار و شبیهسازی صدا، توصیفات متنی محصولات را به روایتهای صوتی طبیعی تبدیل میکنند. این رویکرد با ارائه صدای سازگار با هویت برند، نرخ…
شرکت Synthesia با معرفی پلتفرم Sessions، از ویدیوهای ایستا به سمت «عاملهای دیجیتال» حرکت میکند که میتوانند بهجای خواندن متن، بهصورت زنده با مخاطب گفتگو کنند. این فناوری با…

مدلهای بصری مدرن با ترکیب رمزگذارهای چندوجهی و انتشار گوسی، تصاویر و ویدیوها را از دل نویز ریاضی میسازند. این فرآیند از تولید تصاویر دوبعدی به شبیهسازی فضای سه-بعدی زمان-مکان…