پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

هوش مصنوعی GPT-6 Astra می‌تواند دقیقاً بگوید کجای مونتاژ قفسه ایکیا را اشتباه انجام دادید
اخبار کوتاه روزانه

OpenAI: شناسایی ۸۰ درصدی نقص‌های فیزیکی در دنیای واقعی توسط Astra

مدل جدید OpenAI در شناسایی اشتباهات فیزیکی هنگام سرهم کردن وسایل خانه جهشی بزرگ داشته است. این دستاورد نشان‌دهنده پیشرفت جدی در استدلال بصری برای وظایف پیچیده دنیای واقعی است.

۱ دقیقه خواندن
معیار سرتاسری افزایش داده چندوجهی و پایداری خصمانه با AugLy برای تصویر، متن، صوت و PyTorch
آموزش کاربردی

کتابخانه AugLy استواری مدل‌های چندوجهی را با داده‌های خصمانه می‌سنجد

AugLy چارچوبی جامع برای ایجاد اختلالات عمدی در داده‌های تصویری، متنی و صوتی است تا نقاط ضعف مدل‌های هوش مصنوعی شناسایی شود. این ابزار با شبیه‌سازی نویزهای دنیای واقعی، به…

۱۶ دقیقه خواندن۲
پوشش‌دهنده‌ای شبیه Jev برای مدل‌های زبانی بزرگ، شامل مدل‌های بینایی
آموزش کاربردی

استخراج احتمالات توکن؛ تبدیل مدل‌های بینایی به حسگرهای بلادرنگ

یک پیاده‌سازی جدید با استفاده از احتمالات توکن (logprobs)، مدل‌های بینایی را به طبقه‌بندی‌کننده‌های سریع تبدیل می‌کند. این روش با محدود کردن خروجی به یک توکن، امکان استخراج…

۷ دقیقه خواندن۲
راهنمای عملی ساخت ویدیوهای کوتاه با API سیدنس
آموزش کاربردی

«تضمین اصالت بصری»؛ قابلیت جدید برای جریان‌های کاری Seedance

رابط برنامه‌نویسی Seedance امکان تولید ویدیوهای کوتاه با ترکیب متن، تصویر و صدا را از طریق یک نقطه اتصال واحد فراهم می‌کند. این ابزار با کنترل دقیق روی فریم‌های آغازین و پایانی،…

۴ دقیقه خواندن۲
ابزار جدید هوش مصنوعی گوگل دستم را شکست و لباس دزد دریایی پوشاند - و بعد بدتر شد
زندگی با AI

چرا ابزار جدید گوگل عکس‌ها در تشخیص لباس‌ها دچار توهم می‌شود؟

قابلیت جدید Wardrobe در گوگل عکس‌ها برای ساخت کمد لباس دیجیتال عرضه شد، اما تست‌های اولیه نشان از شکست در تشخیص اشیا و تولید تصاویر سورئال دارد. این ابزار بخش بزرگی از لباس‌های…

۴ دقیقه خواندن۲
عامل هوش مصنوعی من تمام کد تحلیل‌گر مسابقات جهت‌یابی را نوشت. بخش سخت بعد از کار کردن آن شروع شد.
آموزش کاربردی

«تغییر مهارت از پیاده‌سازی به تدوین نیازمندی‌ها» در توسعهٔ نرم‌افزار

یک توسعه‌دهنده با استفاده از عامل‌های هوش مصنوعی، یک سامانه پیچیده تحلیل ورزش جهت‌یابی را بدون کدنویسی یا بازبینی دستی ساخت. این پروژه نشان می‌دهد که مهارت کلیدی در توسعه…

۸ دقیقه خواندن۲
عینک هوشمند ری-بن متا: انتخاب بین نسل سوم یا نسخه صوتی با وجود نگرانی‌های حریم خصوصی
زندگی با AI

درون استراتژی جدید متا برای تبدیل عینک‌های هوشمند به اکسسوری پذیرفته‌شده

متا برای کاهش مقاومت اجتماعی و نگرانی‌های حریم خصوصی، مدل جدید عینک‌های هوشمند خود را بدون دوربین عرضه کرد. در حالی که نسل سوم عینک‌ها بر قابلیت‌های چندوجهی تأکید دارد، نسخه Audio…

۶ دقیقه خواندن۴