پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۴۵ مقاله منتشر شده

پایگاه داده قابل جستجوی آتلانتیک از موسیقی‌های استفاده‌شده برای آموزش هوش مصنوعی

درون استراتژی گوگل و Stability AI برای دور زدن قوانین پلتفرم‌ها

یک پایگاه‌داده عمومی فاش کرد که میلیون‌ها اثر موسیقی، از جمله آثار لیدی گاگا و رادیوهد، بدون مجوز برای آموزش مدل‌های هوش مصنوعی استفاده شده‌اند. این داده‌ها نشان می‌دهند شرکت‌هایی…

۲ دقیقه خواندن
داستان شخصی از چگونگی ایجاد فرصت‌های برابر توسط هوش مصنوعی
زندگی با AI

همه‌فن‌رانی با هوش مصنوعی در برابر تخصص تک‌بعدی در تولید محتوا

یک تولیدکننده محتوا با استفاده از ابزارهای هوش مصنوعی زاینده، حجم کاری یک استودیوی کامل را در چند ساعت به تنهایی انجام داد. این پروژه نشان می‌دهد که مزیت رقابتی از تخصص‌های عمیق…

۲ دقیقه خواندن
تبدیل فایل CSV به گزارش خبری تعاملی تأییدشده با هفت عامل هوش مصنوعی

سامانه Data2Story صحت ۹۳ درصدی ادعاهای داده‌محور را تضمین کرد

سیستم جدید Data2Story با بهره‌گیری از یک «تحریریه مجازی» متشکل از ۷ عامل هوش مصنوعی، مجموعه‌داده‌های خام CSV را به مقالات وب تعاملی تبدیل می‌کند. این ابزار با ایجاد یک پنل بازرسی،…

۵ دقیقه خواندن۳
عامل بدون آموزش انویدیا که کد را به‌عنوان رابط عملیاتی برای استدلال مکانی به کار می‌برد

رابط کد-محور در برابر فراخوانی صلب ابزار در مدل‌های بینایی-زبانی

انویدیا چارچوب SpatialClaw را معرفی کرد که به‌جای فراخوانی‌های صلب ابزار، از کد پایتون به‌عنوان رابط اقدام استفاده می‌کند. این رویکرد باعث شد مدل‌های بینایی-زبانی بدون نیاز به…

۵ دقیقه خواندن
سه ابزار هوشمند iOS 27 برای نجات عکس‌های خراب‌شده
آموزش کاربردیگزارش تأییدنشده

۳ قابلیت جدید iOS ۲۷ برای بازسازی تصاویر با هوش مصنوعی

اپل در به‌روزرسانی iOS 27 سه قابلیت ویرایشی ساختاری را به برنامه Photos اضافه کرده است. این ابزارها با استفاده از هوش مصنوعی زاینده، امکان تغییر زاویه دید، گسترش حاشیه تصاویر و…

۳ دقیقه خواندن۱
لوگوی دیپ‌سیک ویژن روی پس‌زمینه‌ای آبی تیره با نماد چشم و مدارهای الکترونیکی.

DeepSeek: تبدیل مستقیم فرمت‌های بصری پیچیده به داده‌های متنی

دیپ‌سیک با معرفی قابلیت Vision، امکان جست‌وجو و استخراج متن و داده‌ها را مستقیماً از تصاویر و ویدیوها فراهم کرد. این ابزار هدفش حذف تایپ دستی داده‌ها از فرمت‌های پیچیده بصری است.

۴ دقیقه خواندن۳
مقایسه ابزارهای هوش مصنوعی تبدیل متن به ویدیو — رندرریل استودیو، ژوئن ۲۰۲۶
آموزش کاربردی

مدل‌های لورا مرز میان ویدیوهای آماتور و حرفه‌ای AI را جابه‌جا کردند

استودیوی Rendereel تأکید می‌کند که خروجی‌های باکیفیت در ویدیوهای هوش مصنوعی دیگر با ابزارهای عمومی ممکن نیست. برای عبور از سقف کیفی آماتورها، استفاده از مدل‌های لورا (LoRA) برای…

۲ دقیقه خواندن
ماشینی که از آن خواسته شده سکوت را نقاشی کند، در حال خلق اثری انتزاعی است.

هنر هوش مصنوعی؛ آرشیوی از میانگین خاطرات و غم‌های جمعی بشر

بررسی این دیدگاه که تولید تصویر توسط هوش مصنوعی، نه یک خلق original، بلکه بازترکیبی از تجربیات جمعی انسان است. نویسنده استدلال می‌کند که خروجی‌های مدل‌ها در واقع بازتابی از…

۲ دقیقه خواندن
ابزارهای پایش LLM نسبت به لایه صدا نابینا هستند. این ۶ مورد را بررسی کردم.
آموزش کاربردی

کامی‌ب‌های کاذب؛ شکاف میان ابزارهای نظارتی و واقعیتِ عامل‌های صوتی

ابزارهای استاندارد نظارت بر مدل‌های زبانی، بخش بزرگی از تأخیرهای لایه‌ی صوتی را نادیده می‌گیرند. توسعه‌دهندگان برای رفع این مشکل باید از ابزارهای مبتنی بر OpenTelemetry استفاده…

۳ دقیقه خواندن۱
اسنپ تیم ویدیوی هوش مصنوعی خود را به دلیل هزینه‌ها به شرکت جدید داتمو جدا کرد.

گزارش مدیریتی: تفکیک Dotmo راهکار اسنپ برای کنترل مخارج توسعه

شرکت اسنپ برای مدیریت هزینه‌های بالای تحقیق و توسعه، تیم ویدیوهای هوش مصنوعی خود را به شرکت مستقل Dotmo تبدیل کرد. اسنپ همچنان از طریق مالکیت سهام و سرمایه‌گذاری مدیر فنی خود، نفع…

۳ دقیقه خواندن