
FinSaathi با ترکیب SIP و LiveKit تجربهٔ بانکی صوتی را بازتعریف کرد
دستیار صوتی FinSaathi با ادغام زیرساختهای تلفنی و هوش مصنوعی، فرآیند بررسی صلاحیت طرحهای دولتی در هند را از فرمهای پیچیده به مکالمات طبیعی تبدیل کرده است. این سامانه با قابلیت…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۶ مقاله منتشر شده

دستیار صوتی FinSaathi با ادغام زیرساختهای تلفنی و هوش مصنوعی، فرآیند بررسی صلاحیت طرحهای دولتی در هند را از فرمهای پیچیده به مکالمات طبیعی تبدیل کرده است. این سامانه با قابلیت…

اپلیکیشن PawWise با ترکیب مدل Gemini و ElevenLabs، از طریق تحلیل عکسهای سگها، علائم چاقی و بیماریهای جسمی را شناسایی میکند. این ابزار با ارائه تریاژ فوری، قصد دارد تعداد…

تیم Qwen مدل جدید Qwen3.8-27B را با قابلیت تفکر بومی و تواناییهای عاملمحور گسترده عرضه کرد. این مدل در بنچمارکهای کدنویسی و پژوهشهای تخصصی، عملکرد مدلهای پیشرو را به چالش…

گوگل قابلیت ثبت خودکار جلسات را از تماسهای مجازی به محیطهای فیزیکی گسترش داد. این ویژگی با استفاده از Gemini، خلاصههای ساختاریافته و متن کامل گفتگوها را مستقیماً در گوگل داکس…

علیبابا با انتشار سری Qwen3.8، مدلهای چندوجهی بسیار کارآمد ۲۷ میلیاردی و یک نسخه غولپیکر ۲.۴ تریلیون پارامتری را در دسترس قرار داد. این مدلها با مجوز Apache 2.0 منتشر شدهاند…

یک گردشکار جدید بر پایه «قراردادهای شات» با جایگزینی پرامپتهای مبهم، اتلاف منابع در تولید ویدیوهای هوش مصنوعی را کاهش میدهد. این متد با ایزوله کردن خطاها در کوچکترین واحد…

گوگل به کاربران اجازه میدهد نشانهای بصری (Watermarks) را از تصاویر، ویدیوها و آهنگهای تولیدشده توسط هوش مصنوعی حذف کنند. با این حال، شفافیت از طریق نشانهای نامرئی SynthID و…

یک مؤسس بازارچه مد متوجه شد که میانگینگیری از بردارهای معنایی تصاویر، دقت تطابق دقیق را از بین میبرد. با تغییر استراتژی به استفاده از بردارهای هر نما (Per-view) و سیستم…

گوگل مدل Gemini 3.7 Flash را با تمرکز بر مهندسی نرمافزار و اتوماسیون اسناد معرفی کرد. این مدل با قیمتی بسیار رقابتی، هزینههای استقرار عاملهای هوش مصنوعی را برای استارتاپها به…

یک چارچوب فنی جدید برای استارتاپهای آموزشی، اولویت را از قیمتهای ظاهری به دقت تبدیل متن و تأخیر کاهش داده است تا از خطاهای هزینهبر در مسیریابی تیکتها جلوگیری شود. این رویکرد…

تولید تصاویر صنعتی نیازمند سیستمی ساختاریافته است، نه تکیه بر شانس در پرامپتنویسی. API جدید GPT Image 2 با ارائه چارچوبی برای تثبیت ترکیببندی و رندر متن، امکان تبدیل خروجیهای…

استودیوی Inithouse با تحلیل ۱۰ هزار کاربر ابزار Živá Fotka دریافت که ادغام رنگآمیزی تصاویر قدیمی با متحرکسازی، نرخ تکمیل عملیات را بهشدت افزایش میدهد. این دادهها نشان میدهد…