
چرا «نمیدانم» ارزشمندترین پاسخی است که یک VLM میتواند بدهد
محققان با معرفی چارچوب Visual-Idk، مدلهای بینایی-زبانی را قادر ساختند تا مرزهای دانش خود را بشناسند و از توهمات پرهیز کنند. این متدولوژی نرخ صداقت مدلها را از ۵۷.۹٪ به ۶۷.۳٪…
دستهبندی
تولید تصویر و ویدیو، صدای مصنوعی، هنر و موسیقی هوشمند، بازیها و وجه سرگرمکنندهی AI.
۴۳۳ مقاله منتشر شده

محققان با معرفی چارچوب Visual-Idk، مدلهای بینایی-زبانی را قادر ساختند تا مرزهای دانش خود را بشناسند و از توهمات پرهیز کنند. این متدولوژی نرخ صداقت مدلها را از ۵۷.۹٪ به ۶۷.۳٪…

پژوهشگران با معرفی چارچوب ACPO، مشکل «انحراف ادراکی» در مدلهای انتشار را حل کردند. این سیستم با استفاده از تنظیمات مبتنی بر لنگر، کیفیت بصری تصاویر را بدون ایجاد ناپایداری در…

مدل MedSynapse-V با جایگزینی توکنبندی گسسته با سیستم حافظه پنهان، توانسته است «شهود بالینی» را در تشخیصهای پزشکی شبیهسازی کند. این چارچوب در دقت تشخیص، عملکردی بهمراتب برتر از…

پلتفرم DepthPilot با اولویت دادن به دقت کالبدی بهجای زیبایی بصری، استانداردهای تولید ویدیوهای کلونوسکوپی را تغییر داد. این سیستم با استفاده از محدودیتهای عمق، ویدیوهایی تولید…

چارچوب MetaSR با استفاده از ترنسفورمرهای انتشار، هزینه انتقال دادههای تصویری را نصف کرده و همزمان کیفیت را افزایش میدهد. این فناوری با جایگزینی متادیتای ثابت با استراتژیهای…

پژوهشگران چارچوب SeeCo را معرفی کردند؛ سیستمی که بدون نیاز به آموزش مجدد و هزینهبر، خطاهای معنایی مدلهای سنجش از دور را در لحظه استنتاج اصلاح میکند. این ابزار با استفاده از…

مدل Grok Imagine در پلتفرم Flaq AI با تغییر رویکرد از «هنر تکسویه» به «زیرساخت API-محور»، استانداردهای تولید تصویر را برای محیطهای عملیاتی تغییر داده است. این ابزار با تمرکز بر…

گوگل اپلیکیشن بومی **جمینای** (Gemini) را برای رایانههای مک منتشر کرد. کاربران با میانبر Option + Space از هر نقطهای در سیستم به دستیار هوش مصنوعی دسترسی دارند. این حرکت گوگل را…

تیمی از پژوهشگران روش **پرامپتاکو** (PromptEcho) را معرفی کردهاند که سیگنالهای پاداش را مستقیماً از مدلهای یخزده بینایی-زبان استخراج میکند. این رویکرد بدون نیاز به…

گوگل مدلهای **لیریا ۳** (Lyria 3) را برای توسعهدهندگان عرضه کرد. این خانواده دو نسخه دارد: نسخه Pro برای آهنگهای تا سه دقیقه و نسخه Clip برای کلیپهای ۳۰ ثانیهای. سیستم از…

محققان ART-VITON را توسعه دادند؛ چارچوبی مبتنی بر انتشار هدایتشده با معیارهای اندازهگیری که با حفظ هویت افراد و پسزمینه، مشکل مصنوعات ناخواسته را در پروتز مجازی لباس برطرف…

پژوهشگران چارچوبی به نام DiT-ST توسعه دادهاند که کپشنهای پیچیده را به واحدهای معنایی سلسلهمراتبی تجزیه میکند. این رویکرد درک مدلهای منتشر را در تولید تصویر از روی متن بهبود…