پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

کریس الکسیوک از انویدیا درباره نموترون، پردازنده‌های گرافیکی و هوش مصنوعی عاملی صحبت می‌کند

انویدیا مدل‌های Nemotron 3 را بر اساس ظرفیت سخت‌افزاری GPU طراحی کرد

انویدیا با معرفی خانواده مدل‌های Nemotron 3، معماری هوش مصنوعی را از قوانین انتزاعی مقیاس‌پذیری به سمت بهینه‌سازی مستقیم برای سخت‌افزار برد. این مدل‌ها با هدف کاهش هزینه استنتاج…

۷ دقیقه خواندن۴
APIهای تصویر بازاریابی ایمن‌دربرابر‌تلاش‌مجدد: رزولوشن پوستر، تبلیغات شبکه‌های اجتماعی، سبک و بزرگنمایی
آموزش کاربردی

استفاده از کلیدهای Idempotency برای حذف هزینه‌های تکراری در خط لوله‌های تصویر

پیاده‌سازی APIهای تبدیل متن به تصویر در برنامه‌های چندکاربره اغلب به دلیل قطع اتصال شبکه، منجر به پرداخت هزینه‌های مضاعف می‌شود. معماری جدیدی بر پایه کلیدهای یکتایی و دفتر کل…

۹ دقیقه خواندن۳
چک‌لیست عملی برای ارزیابی مدل‌های تبدیل تصویر به ویدیو
آموزش کاربردی

۵ معیار کلیدی برای سنجش کیفیت تولید در مدل‌های تبدیل تصویر به ویدیو

یک گردش‌کار جدید برای مدل‌های تبدیل تصویر به ویدیو، تمرکز را از نتایج تصادفی به یک سامانه ارزیابی کنترل‌شده تغییر می‌دهد. سازندگان اکنون می‌توانند با ردیابی پنج معیار انسجام،…

۳ دقیقه خواندن۱
معماری سیستم RAG صوتی جلسات با استفاده از Fast Transcription و Foundry IQ در Microsoft Foundry
آموزش کاربردی

مایکروسافت با Foundry IQ فایل‌های صوتی جلسات را به پایگاه دانش تبدیل کرد

مایکروسافت با ترکیب سیستم‌های تبدیل سریع گفتار به متن و Foundry IQ، امکان تبدیل ضبط‌های صوتی جلسات به پایگاه‌های دانش قابل جست‌وجو را فراهم کرد. این زیرساخت به عامل‌های هوش مصنوعی…

۱۸ دقیقه خواندن
برنامه جمینی با بیش از یک میلیارد کاربر ماهانه، سریع‌ترین محصول رشد گوگل شد.

چرا تغییر رویکرد به تعاملات صوتی رشد Gemini را شتاب بخشید؟

اپلیکیشن Gemini گوگل با جذب یک میلیارد کاربر ماهانه، رکورد سریع‌ترین رشد محصول در تاریخ این شرکت را شکست. این جهش مدیون تغییر رویکرد به تعاملات صوتی و عرضه قابلیت‌های عامل‌محور…

۴ دقیقه خواندن۲
بررسی Poppy AI: تولید محتوا از هر منبعی بدون شروع از صفر
آموزش کاربردی

آیا بوم‌های بصری جایگزین چت‌بات‌های متنی در پردازش منابع می‌شوند؟

پلتفرم Poppy AI با معرفی یک بوم بصری، امکان اتصال مستقیم منابعی مانند ویدیوهای یوتیوب و فایل‌های PDF را برای تولید محتوا فراهم کرد. این رویکرد نیاز به توضیح مکرر زمینه (Context)…

۵ دقیقه خواندن۱
تصویر شماره ۹۱۱: تقطیر مدل‌های انتشار و چندوجهی
آموزش کاربردی

فشرده‌سازی مسیر در برابر تقلید پاسخ در دیستیل کردن مدل‌ها

دیستیل کردن مدل‌های انتشار برخلاف مدل‌های متنی، به جای تقلید از یک پاسخ نهایی، بر فشرده‌سازی کل مسیر تبدیل نویز به تصویر تمرکز دارد. این تغییر رویکرد، آموزش هوش مصنوعی را از تقلید…

۱ دقیقه خواندن۳