
PixAI در برابر Niji Journey؛ تقابل کنترل هویت با یکپارچگی بصری
در حالی که Niji Journey در خلق تکتصویرهای اتمسفریک پیشتازی میکند، PixAI با ارائه گردشکارهای تخصصی آموزش LoRA و ابزارهای مرجع، کنترل دقیقی بر تکرار شخصیتهای اورجینال فراهم کرده…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۳ مقاله منتشر شده

در حالی که Niji Journey در خلق تکتصویرهای اتمسفریک پیشتازی میکند، PixAI با ارائه گردشکارهای تخصصی آموزش LoRA و ابزارهای مرجع، کنترل دقیقی بر تکرار شخصیتهای اورجینال فراهم کرده…

سامانه جدید گوگل دیپمایند به رباتهای انساننما اجازه میدهد تا دستورات پیچیده را با هماهنگی کامل تمام بدن اجرا کنند. این بهروزرسانی علاوه بر افزایش مهارت در کارهای ظریف، امکان…

گوگل دیپمایند سامانه Gemini Robotics 2 را معرفی کرد که با ترکیب مدلهای بینایی-زبانی و کنترلی، رباتها را قادر به انجام کارهای پیچیده فیزیکی میکند. این سیستم گامی به سوی تحقق…

پلتفرم AGI Ranker با بهروزرسانی سیستم امتیازدهی خود، ادعاهای متورم «سقف انسانی» را حذف کرد و باعث افت نمرات تقریباً تمام مدلهای پیشرو شد. این تغییر رویکرد، تمرکز پلتفرم را از…

پژوهشهای جدید نشان میدهد مدلهای زبانی بهدلیل فقدان «استنتاج ابداعی»، قادر به خلق چارچوبهای نظری جدید نیستند. تنها مدلهای جهانی (World Models) که بر پایه تجربه فیزیکی بنا…

حذف واترمارک در هوش مصنوعی فرآیندی دو مرحلهای شامل قطعهبندی برای یافتن اثر و ترمیم تصویر برای بازسازی پیکسلها است. مدل LaMa با استفاده از پیچیدگیهای فوریه، مشکل دید کلی در…

گوگل مدل تولید تصویر Nano Banana را به گوگل ارث اضافه کرد تا کاربران محیطها را بازطراحی کنند. اما آزمایشها نشان میدهد این ابزار دادههای واقعی نقشه را نادیده میگیرد و صرفاً یک…

بخش Shift از استارتاپ Microagi با ارائه خدمات رایگان خانگی، دادههای ویدئویی اولشخص متخصصان را برای آموزش رباتهای انساننما جمعآوری میکند. این اقدام برای پر کردن شکاف عظیم…

یک گردشکار جدید در ویرایش تصاویر، با ترکیب تشخیص خودکار و ماسکگذاری دقیق کاربر، «عدم قطعیت هوش مصنوعی» را به حداقل میرساند. این سامانه بهجای بازسازی کامل تصویر، بر ترمیم…

یک توسعهدهنده مستقل سیستمی متنباز ساخته است که بهجای ارسال اعداد به مدلهای زبانی، از تحلیل بصری نمودارهای 4K و اعتبارسنجی ریاضی استفاده میکند. این پروژه نشان میدهد که یک خط…

سرویس طنز LLM2HUMAN ادعا میکند با دریافت ۲۰ دلار، مدلهای زبانی را به انسانهای فیزیکی تبدیل میکند. این پروژه با نگاهی انتقادی، شکاف میان هوش دیجیتال و دشواریهای ملموس زندگی…
کیفیت بالای صدا نمیتواند نقص آواتارهای هوش مصنوعی را بپوشاند اگر تأخیر سیستم باعث سکوتهای طولانی شود. توسعهدهندگان باید بهجای تمرکز بر انتخاب ارائهدهنده TTS، اولویت خود را بر…