پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۲ مقاله منتشر شده

لوگوی آزمایشگاه آندون و عنوان Drone-Bench

شکست ۱۰۰ درصدی مدل‌های پیشرو در مأموریت‌های نظارتی Drone-Bench

محک جدید Drone-Bench نشان می‌دهد مدل‌های هوش مصنوعی پیشرو در حال حاضر قادر به اجرای زنجیره‌ای از وظایف برای نظارت خودمختار نیستند. اگرچه این مدل‌ها در تک‌وظیفه‌ها موفق‌اند، اما در…

۸ دقیقه خواندن
ربات چت هوش مصنوعی متا شبیه دستیار شخصی‌تر می‌شود

«گذار از سرگرمی به بهره‌وری»؛ استراتژی جدید متا برای ارتقای چت‌بات خود

متا با معرفی مدل Muse Spark 1.1، چت‌بات خود را از یک ابزار سرگرمی به دستیاری برای مدیریت زمان و انجام خودکار تکالیف تبدیل کرد. این به‌روزرسانی برای رقابت مستقیم با گوگل و OpenAI…

۲ دقیقه خواندن۱
متا پلتفرم فروشگاهی را از طریق فیسبوک مارکت‌پلیس راه‌اندازی کرد

متا با اپلیکیشن Seller بازار فیس‌بوک را به ویترین حرفه‌ای تبدیل کرد

متا اپلیکیشن اختصاصی Seller را برای تغییر ماهیت Marketplace از یک تابلوی محله‌ای به یک فروشگاه تخصصی معرفی کرد. این ابزار با بهره‌گیری از هوش مصنوعی، فرآیند ثبت کالا را خودکار…

۲ دقیقه خواندن
جایگزین Tensor.Art برای انیمه: هزینه پنهان تنظیمات پیش‌فرض
آموزش کاربردی

تضاد در کنترل؛ چرا پیک‌س‌آی در حفظ هویت شخصیت‌های انیمه‌ای برنده است

مقایسه‌ای جامع بین PixAI و Tensor.Art نشان می‌دهد که پیچیدگی بیش از حد و تنظیمات پیش‌فرض پنهان، دقت مدل را کاهش می‌دهد. در حالی که PixAI با رویکردی ساده بر حفظ تداوم شخصیت‌ها…

۶ دقیقه خواندن۱
تبدیل ایده‌ها به تصویر: مزیت افراژن
آموزش کاربردی

Afrigen چگونه هزینه تولید محتوای ویدئویی را برای هنرمندان آفریقایی حذف می‌کند؟

پلتفرم Afrigen تولید ویدیوهای باکیفیت از متن را برای هنرمندان آفریقایی ممکن کرده است. این ابزار با حذف نیاز به تجهیزات گران‌قیمت، سد ورود به دنیای داستان‌سرایی دیجیتال را می‌شکند.

۲ دقیقه خواندن
ساخت خط لوله OCR با Baidu Unlimited-OCR برای تصاویر با کیفیت بالا و PDF چندصفحه‌ای
آموزش کاربردی

«بدون نیاز به تحلیل چیدمان»؛ رویکرد جدید بایدو برای پردازش اسناد

بایدو با معرفی Unlimited-OCR، فرآیند استخراج متن و جدول از اسناد پیچیده را به یک تک‌مرحله تبدیل کرد. این مدل بینایی-زبانی با ۳ میلیارد پارامتر، نیاز به مراحل مجزای تشخیص چیدمان را…

۷ دقیقه خواندن۱
تغییر زاویه دوربین بدون از دست دادن پس‌زمینه
آموزش کاربردی

درون مکانیزم تبدیل تصویر به ویدئو برای اصلاح دید سه‌بعدی

مدل‌های تبدیل متن به تصویر به‌دلیل نبود حافظه فضایی سه‌بعدی، در تغییر زاویه دوربین دچار خطا می‌شوند. راهکار جایگزین، استفاده از مدل‌های ویدئویی برای ایجاد گذارهای منطقی میان دو…

۴ دقیقه خواندن
ساخت دوقلوهای دیجیتال قابل تماشا برای ۶۴ بازی جام جهانی
آموزش کاربردی

درون سازوکار تبدیل پخش‌های ورزشی به محیط‌های تعاملی سه‌بعدی

راجر دیکی با استفاده از داده‌های ردیابی PFF، یک پخش‌کننده ویدئویی سه‌بعدی ساخت که بازی‌های جام جهانی را به محیط‌های تعاملی تبدیل می‌کند. این پروژه نشان می‌دهد چگونه ترکیب مختصات…

۵ دقیقه خواندن
حالت صوتی کلود با مدل‌های قدرتمندتر به‌روزرسانی شد | تک‌کرانچ

کلود حالا با مدل‌های Opus و Sonnet صحبت می‌کند و برنامه‌ها را مدیریت می‌کند

آنتروپیک قابلیت‌های صوتی کلود را به مدل‌های قدرتمند Opus و Sonnet گسترش داد. این به‌روزرسانی امکان اجرای دستورات صوتی در اپلیکیشن‌هایی نظیر Gmail و Slack را فراهم می‌کند.

۲ دقیقه خواندن۱