
پاداشهای عقلانی: مقیاسبندی تولید بصری با پاداشهای استدلالی
چارچوب RationalRewards مدلهای پاداش چندبُعدی را معرفی میکند که در زمان آموزش و آزمایش، کیفیت تولیدکنندههای تصویر را بهبود میبخشند. این مدل به دقت بالا در پیشبینی ترجیحات دست…
دستهبندی
تولید تصویر و ویدیو، صدای مصنوعی، هنر و موسیقی هوشمند، بازیها و وجه سرگرمکنندهی AI.
۴۳۳ مقاله منتشر شده

چارچوب RationalRewards مدلهای پاداش چندبُعدی را معرفی میکند که در زمان آموزش و آزمایش، کیفیت تولیدکنندههای تصویر را بهبود میبخشند. این مدل به دقت بالا در پیشبینی ترجیحات دست…

گوگل مدل پیشرفته تولید موسیقی لیریا ۳ پرو را منتشر کرد که امکان ساخت قطعات تا ۳ دقیقه با درک عمیقتر از ساختار موسیقایی را فراهم میکند. این مدل در پلتفرمهای مختلف از جمله Vertex…

تیمی از پژوهشگران سیستم **MeloTune** را معرفی کردهاند؛ عاملی موسیقایی که الگوهای برانگیختگی هر شنونده را شناسایی و پیشبینی میکند. این سیستم با دو شبکه زمان پیوسته بستهای روی…

پژوهشگران روشی معرفی کردهاند که از دستهبندهای چندبرچسبی برای هدایت الگوریتمهای تکاملی در فرآیند تولید تصویر استفاده میکند. این رویکرد بهجای بهبود توصیهها از پیش یا تقویت…

تیمی از پژوهشگران روش **توربو-دیدیسیام** را معرفی کردهاند که فشردهسازی تصویر مبتنی بر انتشار را بدون نیاز به دادهی آموزشی، سریعتر و کمهزینهتر میکند. نوآوری اصلی این روش…

گوگل مدل جدید **Veo 3.1 Lite** را به خانواده محصولات ویدیویی خود اضافه کرد. این مدل با قیمتی کمتر از نیمی از Veo 3.1 Fast عرضه میشود اما سرعت پردازش یکسانی ارائه میدهد.…

چالش LoViF 2026 با هدف پیشبرد تکنیکهای حذف شرایط جوی از ویدیوها راهاندازی شد. مجموعه داده WRV شامل ۱۸ ویدیو و ۱٬۲۱۶ فریم جفتشده برای این چالش معرفی شده است. از میان ۳۷…

پژوهشگران روشی نوین برای بازسازی تصاویر با وضوح بالا ارائه دادهاند که با استفاده از یک چارچوب نظری مبتنی بر تخمین درستنمایی بیشینه، نویز بهینه میانی را برای فرآیند انتشار معکوس…

ادوبی دستیار هوش مصنوعی Firefly را که قبلاً Project Moonlight نام داشت، به صورت بتای عمومی عرضه کرد. این ابزار به کاربران امکان میدهد با زبان طبیعی در اپلیکیشنهایی مانند فتوشاپ…

محققان «الگوریتم خنده» را معرفی کردند؛ چارچوبی چندعامله که کامنتهای طنز مناسب را برای ویدیوهای کوتاه تولید میکند و با نرخ ترجیح انسانی ۸۰ تا ۸۴ درصد از روشهای پایه پیشی گرفته…

پژوهشگران روشی نوآورانه برای شناسایی محتوای مصنوعی (دیپفیک) با بهرهگیری از تبدیل کروولت، مکانیزم توجه در سطح وجوه و ماسکهای فضایی مقیاسآگاه ارائه کردهاند. این رویکرد توانسته…

یک تیم پژوهشی چارچوب ARGen را معرفی کرده است؛ یک روش مولد دومرحلهای که با کمبود داده و توزیع نامتوازن حالات چهره در تشخیص پویای احساسات مبارزه میکند. این چارچوب با ترکیب تزریق…