پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۸ مقاله منتشر شده

ترنسفورمرهای چندوجهی: چگونه مدل‌های زبانی بزرگ یاد می‌گیرند ببینند
آموزش کاربردی

درون معماری ترنسفورمرهای چندوجهی؛ تبدیل پیکسل‌ها به توکن‌های زبانی

هوش مصنوعی چندوجهی مدرن به‌جای آموزش مستقیم مدل‌های زبانی برای «دیدن»، از رمزگذارهای بینایی و رابط‌های متصل‌کننده برای ترجمه تصاویر به زبانی استفاده می‌کند که ترنسفورمرها پیش‌تر…

۱۸ دقیقه خواندن۲
گردش کار عملی برای بهبود ویدیوهای کم‌کیفیت در مرورگر
آموزش کاربردی

آیا پردازش محلی در مرورگر جایگزین آپلود ویدیو در سرور می‌شود؟

یک گردش‌کار جدید مبتنی بر مرورگر، امکان افزایش وضوح ویدیوهای کم‌کیفیت به 8K را بدون نیاز به آپلود فایل در سرور فراهم می‌کند. این ابزار با انتقال پردازش به سخت‌افزار کاربر، حریم…

۲ دقیقه خواندن
مدل بینایی-زبانی ۸ میلیارد پارامتری Qwen3-VL: خواندن رسیدها — روز ۱۶/۳۰
آموزش کاربردی

مدل‌های بینایی ۸ میلیاردی در برابر سامانه‌های پیچیدهٔ استخراج سند

مدل جدید بینایی-زبانی علی‌بابا با ۸ میلیارد پارامتر، استخراج دقیق داده‌های ساختاریافته از تصاویر را روی یک GPU ممکن می‌کند. این مدل با پنجره متنی ۲۶۲ هزار توکنی، جایگزینی ارزان و…

۷ دقیقه خواندن۱
تبدیل طرح‌های مرجع تاتو به شابلون‌های قابل چاپ با هوش مصنوعی
آموزش کاربردی

«اولویت ساختار بر زیبایی»؛ رویکرد Stencil My Tattoo برای تبدیل طرح‌های AI

ابزار جدید Stencil My Tattoo با تمرکز بر قابلیت اجرا روی پوست، تصاویر پیچیده هوش مصنوعی را به استنسیل‌های خطی تبدیل می‌کند. این پلتفرم شکاف ارتباطی میان مشتری و تتوآرتیست را با…

۳ دقیقه خواندن۱
موزیک‌ساز هوش مصنوعی لیریا ۳.۵ گوگل به اپلیکیشن جمینای و API اضافه شد

«کنترل‌های ساختاری حرفه‌ای»؛ ویژگی جدید Lyria 3.5 برای توسعه‌دهندگان

گوگل مدل تولید موسیقی Lyria 3.5 را در اپلیکیشن و API جمینای ادغام کرد تا کاربران بتوانند قطعات باکیفیت تا ۳ دقیقه بسازند. این به‌روزرسانی قابلیت تبدیل تصویر به موسیقی و کنترل‌های…

۴ دقیقه خواندن
شکایت ناشران بزرگ از گوگل بابت آموزش هوش مصنوعی

عامل Gemini Spark مدیریت کتابخانه‌های گوگل فوتوز را بر عهده گرفت

گوگل با ادغام عامل Gemini Spark در سرویس گوگل فوتوز، سازماندهی آلبوم‌ها و ویرایش تصاویر را خودکار کرد. این به‌روزرسانی که فعلاً برای مشترکان سطح بالای آمریکا در دسترس است، تلاشی…

۳ دقیقه خواندن
غذای تولیدشده با هوش مصنوعی: ظاهر مصنوعی و رنگ‌های بیش از حد اشباع‌شده
سرگرمی و خلاقیت

شکست مدل‌های انتشار در بازسازی منطق بصری غذا و تحریک حس تهوع

تصاویر غذای تولیدشده توسط هوش مصنوعی اغلب به‌دلیل ضعف در درک ساختارهای نازک و فقدان دانش فیزیکی، باعث ایجاد حس تهوع می‌شوند. این نقص‌ها منجر به پدیده‌ای می‌شود که واکنش‌های…

۶ دقیقه خواندن