پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۶ مقاله منتشر شده

جهان‌گوی: زبان بیاموز با کشف جهان‌ها و گفتگو با بومیان | Product Hunt

Speakworld یادگیری زبان را با دنیای بازی‌های هوش مصنوعی جایگزین کرد

پلتفرم Speakworld با جایگزینی تمرینات تکراری با محیط‌های مجازی تعاملی، یادگیری زبان‌های هندی، ژاپنی و اسپانیایی را به یک تجربه بازی‌گونه تبدیل کرده است. کاربران در این سامانه از…

۱ دقیقه خواندن
تصویری از محصول با برچسب نادرست و نمودار مقایسه‌ای شباهت متن و تصویر در مدل‌های CLIP و BLIP
آموزش کاربردی

پژوهش جدید: شکست CLIP و BLIP در تشخیص تفاوت‌های جزئی محصولات

آزمایش‌های جدید نشان می‌دهد مدل‌های هوش مصنوعی چندوجهی در شناسایی تفاوت‌های کوچک بین برندها و سایز محصولات شکست می‌خورند. این نقص در دقت، کنترل کیفیت خودکار در تجارت الکترونیک را…

۷ دقیقه خواندن
عینک هوشمند سامسونگ از این زاویه دیده می‌شود

عینک‌های هوشمند سامسونگ با عمر باتری ۹ ساعته و ادغام Gemini

سامسونگ با همکاری گوگل، جنتل مونستر و واربی پارکر، عینک‌های هوشمند سطح بالایی را معرفی کرد که با عمر باتری ۹ ساعته، تجربه استفاده از هوش مصنوعی را به دنیای واقعی می‌آورند. این…

۲ دقیقه خواندن
شخصیت در حال راه رفتن، با چندین زاویه و حالت بدن مختلف در یک برگ پوز، تولید شده با هوش مصنوعی.
آموزش کاربردی

«تثبیت جزئیات»؛ راهکار جدید برای تولید تصاویر پیوسته از یک شخصیت

یک گردش‌کار جدید در هوش مصنوعی امکان تولید ورقه‌های چند-فیگوری (Pose Sheets) را از طریق یک تصویر مرجع فراهم می‌کند. این روش با ترکیب پرامپت‌های ساختاریافته و تثبیت جزئیات، مشکل…

۳ دقیقه خواندن۲
نمای درون مدل اینکلینگ: هوش مصنوعی تریلیون‌پارامتری که فقط ۴۱ میلیارد پارامتر را بیدار نگه می‌دارد

مدل Inkling: فعال‌سازی ۴٪ پارامترها برای مدیریت ظرفیت یک تریلیون

مدل Inkling با بهره‌گیری از معماری پراکنده (Sparse)، ظرفیت عظیم ۹۷۵ میلیارد پارامتری خود را مدیریت می‌کند اما در هر لحظه تنها بخشی کوچک از شبکه را فعال می‌کند. این رویکرد اجازه…

۱ دقیقه خواندن۱