
چگونه Qwen-Image-2.0 مراحل استنتاج را از ۴۰ به ۴ گام کاهش داد؟
مدل Qwen-Image-2.0 شرکت علیبابا با دوبرابر کردن فشردهسازی VAE و تقطیر استنتاج، تعداد گامهای تولید تصویر را از ۴۰ به ۴ کاهش داده است. این مدل با استفاده از بلوکهای SwiGLU و یک…
موضوع
Models that natively process text+image+audio+video
۱٬۴۱۸ مقاله منتشر شده

مدل Qwen-Image-2.0 شرکت علیبابا با دوبرابر کردن فشردهسازی VAE و تقطیر استنتاج، تعداد گامهای تولید تصویر را از ۴۰ به ۴ کاهش داده است. این مدل با استفاده از بلوکهای SwiGLU و یک…

مدل HERMES++ با ادغام درک سهبعدی صحنه و پیشبینی مسیر در یک شبکه واحد، دقت پیشبینی هندسهی جاده را بهطور چشمگیری افزایش داده است. این مدل برخلاف ابزارهای تخصصی پیشین، اجازه…

استارتاپ Origin Lab با جذب ۸ میلیون دلار سرمایه، بازاری را برای فروش دادههای شبیهسازیشدهی بازیهای ویدئویی به آزمایشگاههای هوش مصنوعی ایجاد میکند. این دادهها برای آموزش…

توسعهگران همراهان هوش مصنوعی با جایگزینی APIهای تکمدلی با درگاههای یکپارچه، هزینههای استنتاج را تا ۴۰٪ کاهش دادهاند. این رویکرد اجازه میدهد شخصیتهای دیجیتال از وابستگی به…

شرکت Luma رابط برنامهنویسی (API) مدل Uni-1.1 را منتشر کرد تا با کیفیت و قیمت OpenAI رقابت کند. این مدل امکان تولید تصاویر با رزولوشن بالا و ویرایش پیشرفته را برای توسعهدهندگان…

انویدیا با معرفی طرح VSS، جستجو و خلاصهسازی ویدئوها را به عاملهای هوش مصنوعی سپرد. این فناوری اجازه میدهد آرشیوهای عظیم ویدئویی بهجای هشارهای ساده، با زبان طبیعی مورد بازجویی…

گوگل با ادغام Gemini در نشانگر ماوس، نیاز به تایپ دستی دستورات را حذف کرده است. این سیستم با درک بافت بصری صفحه، تعامل با هر المان را به یک اشاره ساده تبدیل میکند.

پژوهشگران چارچوب M³Att را معرفی کردند که با استفاده از محرکهای بصری و اطلاعات گمراهکننده، سیستمهای RAG پزشکی را هدف قرار میدهد. این حمله مدلها را فریب میدهد تا تشخیصهای…

پژوهشگران با توسعه یک مدل بنیادی برای هلند، ثابت کردند که بافتار زمانی میتواند جایگزین حجم عظیم دادهها شود. این مدل با استفاده از ۱.۲ میلیون تصویر، عملکردی رقابتی در بنچمارکهای…

چارچوب MicroWorld با استفاده از گرافهای ویژگی چندوجهی، دقت مدل Qwen3-VL را در استدلالهای میکروسکوپی ۱۳٪ بیشتر از GPT-5 کرد. این دستاورد ثابت میکند بازیابی دانش ساختاریافته…

چارچوب ViSRA با حذف نیاز به آموزشهای هزینهبر، استدلال فضایی سهبعدی را در مدلهای چندوجهی ارتقا میدهد. این سیستم با تکیه بر مدلهای خبره، در وظایف پیشبینینشده تا ۲۸.۹٪ بهتر…

چارچوب PoDAR با جداسازی توان سیگنال از محتوای معنایی در فضاهای نهان صوتی، سرعت همگرایی مدلهای زاینده را دو برابر میکند. این رویکرد در مدل F5-TTS منجر به بهبود چشمگیر شباهت…