
درون معماری RLFSeg: پایان عصر نویز در بخشبندی تصاویر
چارچوب RLFSeg با جایگزینی فرآیندهای نویزی مدلهای انتشار با «جریان اصلاحشده»، دقت بخشبندی تصاویر را متحول کرده است. این رویکرد با ایجاد نقشهبرداری مستقیم از تصویر به ماسک، سرعت…
دستهبندی
تولید تصویر و ویدیو، صدای مصنوعی، هنر و موسیقی هوشمند، بازیها و وجه سرگرمکنندهی AI.
۶۸۷ مقاله منتشر شده

چارچوب RLFSeg با جایگزینی فرآیندهای نویزی مدلهای انتشار با «جریان اصلاحشده»، دقت بخشبندی تصاویر را متحول کرده است. این رویکرد با ایجاد نقشهبرداری مستقیم از تصویر به ماسک، سرعت…

پژوهشگران روشی کارآمد برای تولید تصاویر ماهوارهای با کیفیت بالا ابداع کردهاند که همراستاسازی تصاویر مصنوعی با نقشههای هندسی را بهبود میبخشد. این دستاورد، کمبود دادههای حیاتی…

معرفی بنچمارک DiffCap-Bench نشان داد که مدلهای تجاری در درک تفاوتهای بصری، فرسنگها از مدلهای متنباز جلوترند. این یافته ثابت میکند که صرفاً بزرگتر کردن مدلها، مشکل استدلال…

چارچوب EBOD با ادغام SAM3 و DINOv3، خطاهای تکراری در تشخیص اشیاء را بدون نیاز به آموزش مجدد مدل حذف میکند. این رویکرد هزینههای محاسباتی سنگین را کنار گذاشته و یادگیری از…

یک مطالعه جدید نشان میدهد مقاومت مدلهای بینایی در برابر حملات خصمانه ناشی از فیلترهای فرکانسی نیست، بلکه ریشه در هندسهی بازنمایی شبیه به انسان دارد. این کشف، مسیر مقابله با…

پژوهشگران با معرفی متد HAAD، شناسایی جعلهای عمیق را از تحلیل الگوهای بصری به تحلیل پایداری فیزیکی منتقل کردند. این رویکرد با شناسایی «ناپایداریهای انرژی» در تصاویر مصنوعی، نیاز…

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقشآفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

نقشههای جریان با جایگزینی پیشبینی سرعتهای محلی با انتگرالگیری از مسیر، مدلهای انتشار را متحول میکنند. این رویکرد اجازه میدهد تصاویر و ویدیوهای باکیفیت تنها در ۱ تا ۸ گام…

متا برای شناسایی کاربران زیر ۱۳ سال، از هوش مصنوعی برای تحلیل ساختار استخوانی و قد در عکسها استفاده میکند. این اقدام تهاجمی در پاسخ به جریمه ۳۷۵ میلیون دلاری شرکت در زمینه ایمنی…

آکادمی اسکار هرگونه اثر یا بازیگری تولید شده توسط هوش مصنوعی را از چرخه جوایز حذف کرد. طبق قوانین جدید، اثبات نویسندگی و اجرای انسانی برای شرکت در رقابتها اجباری است.

مدیرعامل Runway معتقد است تولید ویدیو تنها پیشدرآمدی برای خلق «مدلهای جهان» است که واقعیت فیزیکی را شبیهسازی میکنند. این چرخش استراتژیک، هدف شرکت را از ابزارهای سینمایی به سمت…

تیم Deep-unlearning با معرفی smol-audio، دسترسی به تنظیم دقیق مدلهای پیشرفتهی صوتی را از طریق نوتبوکهای آمادهی Colab ممکن کرد. این ابزار با بهرهگیری از اکوسیستم Hugging…