پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۳ مقاله منتشر شده

ربات هوشمند جمینی ۲ با کنترل کل بدن، حرکات انسان‌وار انجام می‌دهد.

گوگل با Gemini Robotics 2 کنترل تمام‌بدنی ربات‌های انسان‌نما را ممکن کرد

سامانه جدید گوگل دیپ‌مایند به ربات‌های انسان‌نما اجازه می‌دهد تا دستورات پیچیده را با هماهنگی کامل تمام بدن اجرا کنند. این به‌روزرسانی علاوه بر افزایش مهارت در کارهای ظریف، امکان…

۶ دقیقه خواندن۲
ربات مجهز به هوش مصنوعی گوگل در حال تعامل با دنیای واقعی

«گامی به سوی AGI فیزیکی»؛ رویکرد جدید گوگل برای ربات‌های پیچیده

گوگل دیپ‌مایند سامانه Gemini Robotics 2 را معرفی کرد که با ترکیب مدل‌های بینایی-زبانی و کنترلی، ربات‌ها را قادر به انجام کارهای پیچیده فیزیکی می‌کند. این سیستم گامی به سوی تحقق…

۳ دقیقه خواندن
مدل‌های زبانی نمی‌توانند انقلاب‌های علمی ایجاد کنند، اما مدل‌های جهانی شاید بتوانند.

ناکامی مدل‌های زبانی در ابداع نظریات علمی به‌دلیل نبود مدل‌های جهانی

پژوهش‌های جدید نشان می‌دهد مدل‌های زبانی به‌دلیل فقدان «استنتاج ابداعی»، قادر به خلق چارچوب‌های نظری جدید نیستند. تنها مدل‌های جهانی (World Models) که بر پایه تجربه فیزیکی بنا…

۴ دقیقه خواندن۲
راهنمای توسعه‌دهندگان برای حذف واترمارک با هوش مصنوعی و بازسازی تصاویر
آموزش کاربردی

مدل LaMa با تبدیل تصاویر به فرکانس، واترمارک‌های پیچیده را ترمیم می‌کند

حذف واترمارک در هوش مصنوعی فرآیندی دو مرحله‌ای شامل قطعه‌بندی برای یافتن اثر و ترمیم تصویر برای بازسازی پیکسل‌ها است. مدل LaMa با استفاده از پیچیدگی‌های فوریه، مشکل دید کلی در…

۹ دقیقه خواندن۱
گوگل ارث نانو موز اضافه کرد و من فوراً فیلادلفیا را با زامبی‌ها و دلقک‌های شیطانی تصور کردم

«فقط یک لایه بصری»؛ نقد عملکرد مدل Nano Banana در نقشه‌های گوگل

گوگل مدل تولید تصویر Nano Banana را به گوگل ارث اضافه کرد تا کاربران محیط‌ها را بازطراحی کنند. اما آزمایش‌ها نشان می‌دهد این ابزار داده‌های واقعی نقشه را نادیده می‌گیرد و صرفاً یک…

۸ دقیقه خواندن۱
غذای رایگان از سرآشپز خصوصی گرفتم که همه‌چیز را برای آموزش ربات‌ها فیلمبرداری کرد.

استراتژی Shift برای خرید تخصص انسانی در قالب داده‌های بصری

بخش Shift از استارتاپ Microagi با ارائه خدمات رایگان خانگی، داده‌های ویدئویی اول‌شخص متخصصان را برای آموزش ربات‌های انسان‌نما جمع‌آوری می‌کند. این اقدام برای پر کردن شکاف عظیم…

۵ دقیقه خواندن۲
ربات معامله‌گر هوشمند مبتنی بر مدل زبانی بزرگ (LLM) در حال تحلیل بازار و اجرای معاملات خودکار
آموزش کاربردی

موتور معاملاتی LLM_trader: جایگزینی داده‌های عددی با استنتاج تصویری

یک توسعه‌دهنده مستقل سیستمی متن‌باز ساخته است که به‌جای ارسال اعداد به مدل‌های زبانی، از تحلیل بصری نمودارهای 4K و اعتبارسنجی ریاضی استفاده می‌کند. این پروژه نشان می‌دهد که یک خط…

۷ دقیقه خواندن۲
کلینیک LLM2HUMAN | اقامتگاه رسمی ★

خدمات LLM2HUMAN؛ طنز عریان از تبدیل وزن‌های هوش مصنوعی به گوشت و پوست

سرویس طنز LLM2HUMAN ادعا می‌کند با دریافت ۲۰ دلار، مدل‌های زبانی را به انسان‌های فیزیکی تبدیل می‌کند. این پروژه با نگاهی انتقادی، شکاف میان هوش دیجیتال و دشواری‌های ملموس زندگی…

۴ دقیقه خواندن
تأخیر، مشکل واقعی تجربه کاربری در آواتارهای هوش مصنوعی است، نه صدا
آموزش کاربردی

تحلیل UX: تأخیر در استریمینگ مانع اثرگذاری کیفیت صدای آواتارهاست

کیفیت بالای صدا نمی‌تواند نقص آواتارهای هوش مصنوعی را بپوشاند اگر تأخیر سیستم باعث سکوت‌های طولانی شود. توسعه‌دهندگان باید به‌جای تمرکز بر انتخاب ارائه‌دهنده TTS، اولویت خود را بر…

۲ دقیقه خواندن۲