
سامانه The Letter با گیتهای قطعی توهمات هوش مصنوعی را حذف کرد
ابزار جدیدی به نام The Letter با استفاده از معماری Span Gate، نامههای پیچیده دولتی را به صوت ساده تبدیل میکند. این سیستم هر ادعای تولیدشده توسط هوش مصنوعی را که مستقیماً در متن…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۸ مقاله منتشر شده

ابزار جدیدی به نام The Letter با استفاده از معماری Span Gate، نامههای پیچیده دولتی را به صوت ساده تبدیل میکند. این سیستم هر ادعای تولیدشده توسط هوش مصنوعی را که مستقیماً در متن…

هوش مصنوعی چندوجهی مدرن بهجای آموزش مستقیم مدلهای زبانی برای «دیدن»، از رمزگذارهای بینایی و رابطهای متصلکننده برای ترجمه تصاویر به زبانی استفاده میکند که ترنسفورمرها پیشتر…

یک گردشکار جدید مبتنی بر مرورگر، امکان افزایش وضوح ویدیوهای کمکیفیت به 8K را بدون نیاز به آپلود فایل در سرور فراهم میکند. این ابزار با انتقال پردازش به سختافزار کاربر، حریم…

شرکت متا مدل Muse Voice Transcribe را برای تبدیل بلادرنگ صوت به متن معرفی کرد که با بهینهسازی زمان شنود، تعادلی میان سرعت و دقت ایجاد میکند. این مدل با قیمتی رقابتی، قابلیت…

مدل جدید بینایی-زبانی علیبابا با ۸ میلیارد پارامتر، استخراج دقیق دادههای ساختاریافته از تصاویر را روی یک GPU ممکن میکند. این مدل با پنجره متنی ۲۶۲ هزار توکنی، جایگزینی ارزان و…

پلتفرم GetImg AI با تمرکز بر کاهش هزینهها، مسیری مقرونبهصرفه برای تولید تصاویر حرفهای و هنر مفهومی فراهم کرده است. این ابزار در حالی با غولهای صنعت رقابت میکند که با…

ابزار جدید Stencil My Tattoo با تمرکز بر قابلیت اجرا روی پوست، تصاویر پیچیده هوش مصنوعی را به استنسیلهای خطی تبدیل میکند. این پلتفرم شکاف ارتباطی میان مشتری و تتوآرتیست را با…

گوگل مدل تولید موسیقی Lyria 3.5 را در اپلیکیشن و API جمینای ادغام کرد تا کاربران بتوانند قطعات باکیفیت تا ۳ دقیقه بسازند. این بهروزرسانی قابلیت تبدیل تصویر به موسیقی و کنترلهای…

شرکت ElevenLabs نسخه دوم مدل تولید موسیقی خود را با قابلیت ترمیم (Inpainting) در سطح بخشهای آهنگ منتشر کرد. این ابزار اکنون از طریق API برای تیمهای محصول در دسترس است و مدل…

شرکت رولند با معرفی افزونه Melody Flip، رویکردی متفاوت در تولید موسیقی با هوش مصنوعی پیش گرفت. این ابزار بهجای تولید آهنگهای کامل، بلوکهای سازندهی MIDI را برای تحریک خلاقیت…

گوگل با ادغام عامل Gemini Spark در سرویس گوگل فوتوز، سازماندهی آلبومها و ویرایش تصاویر را خودکار کرد. این بهروزرسانی که فعلاً برای مشترکان سطح بالای آمریکا در دسترس است، تلاشی…

تصاویر غذای تولیدشده توسط هوش مصنوعی اغلب بهدلیل ضعف در درک ساختارهای نازک و فقدان دانش فیزیکی، باعث ایجاد حس تهوع میشوند. این نقصها منجر به پدیدهای میشود که واکنشهای…