
سرعت در برابر دقت؛ استراتژی دوتایی GPT-image-2.5 برای ویرایش تصویر
مایکروسافت مدل GPT-image-2.5 را با دو زیرمجموعه Flare و Sunburst معرفی کرد تا مشکل تغییرات ناخواسته در ویرایشهای متوالی تصویر را حل کند. این سیستم به توسعهدهندگان .NET اجازه…
موضوع
Models that natively process text+image+audio+video
۱٬۳۳۳ مقاله منتشر شده

مایکروسافت مدل GPT-image-2.5 را با دو زیرمجموعه Flare و Sunburst معرفی کرد تا مشکل تغییرات ناخواسته در ویرایشهای متوالی تصویر را حل کند. این سیستم به توسعهدهندگان .NET اجازه…

مدل جدید OpenAI در شناسایی اشتباهات فیزیکی هنگام سرهم کردن وسایل خانه جهشی بزرگ داشته است. این دستاورد نشاندهنده پیشرفت جدی در استدلال بصری برای وظایف پیچیده دنیای واقعی است.

AugLy چارچوبی جامع برای ایجاد اختلالات عمدی در دادههای تصویری، متنی و صوتی است تا نقاط ضعف مدلهای هوش مصنوعی شناسایی شود. این ابزار با شبیهسازی نویزهای دنیای واقعی، به…

یک پیادهسازی جدید با استفاده از احتمالات توکن (logprobs)، مدلهای بینایی را به طبقهبندیکنندههای سریع تبدیل میکند. این روش با محدود کردن خروجی به یک توکن، امکان استخراج…

رابط برنامهنویسی Seedance امکان تولید ویدیوهای کوتاه با ترکیب متن، تصویر و صدا را از طریق یک نقطه اتصال واحد فراهم میکند. این ابزار با کنترل دقیق روی فریمهای آغازین و پایانی،…

ابزارهای شبیهسازی صدا به کالاهایی ارزان تبدیل شدهاند که با ۳ ثانیه فایل صوتی و هزینهای کمتر از ۵۰۰ دلار، هر صدایی را بازسازی میکنند. این کاهش شدید هزینه، سیستمهای احراز هویت…

قابلیت جدید Wardrobe در گوگل عکسها برای ساخت کمد لباس دیجیتال عرضه شد، اما تستهای اولیه نشان از شکست در تشخیص اشیا و تولید تصاویر سورئال دارد. این ابزار بخش بزرگی از لباسهای…

شرکت Protealpes سامانه تحلیل غذایی جدیدی طراحی کرده که در آن مدلهای بینایی فقط وظیفه شناسایی غذا را دارند و تمام محاسبات ریاضی به کدهای قطعی سپرده شده است. این معماری مانع از…

یک توسعهدهنده با استفاده از عاملهای هوش مصنوعی، یک سامانه پیچیده تحلیل ورزش جهتیابی را بدون کدنویسی یا بازبینی دستی ساخت. این پروژه نشان میدهد که مهارت کلیدی در توسعه…

محکهای بصری سال ۲۰۲۶ نشان میدهند GPT-Image-2.5 Flare در دقت متنی و Grok Imagine 2.0 در سرعت پیشتاز هستند. شرکت SuperFast AI با یکپارچهسازی این مدلها در خط لولهی 4K، هزینههای…

متا برای کاهش مقاومت اجتماعی و نگرانیهای حریم خصوصی، مدل جدید عینکهای هوشمند خود را بدون دوربین عرضه کرد. در حالی که نسل سوم عینکها بر قابلیتهای چندوجهی تأکید دارد، نسخه Audio…

توصیفات متنی تولیدشده توسط هوش مصنوعی در حال جایگزینی هشدارهای کلی «تشخیص حرکت» در دوربینهای امنیتی هستند. این تغییر به کاربران اجازه میدهد بدون انتظار برای بارگذاری ویدیو،…