پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۶ مقاله منتشر شده

مردی در حال صحبت کردن با گوشی هوشمند، با حالت ناامیدی و سردرگمی.

گفتار در برابر تایپ؛ افت شدید کیفیت LLM در وظایف پیچیده

پژوهشی جدید نشان می‌دهد لایه‌های «پاک‌سازی» متن در مسیر تبدیل گفتار به نوشتار، با حذف جزئیات ساختاری، عملکرد مدل‌های هوش مصنوعی را به‌شدت تخریب می‌کنند. این افت کیفیت در وظایف…

۸ دقیقه خواندن۳
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex
آموزش کاربردی

تبدیل مدل‌های زبانی به طبقه‌بندی‌کننده سیاست برای نظارت بر محتوای فین‌تک

یک معماری جدید در فین‌تک‌ها، مدل‌های زبانی را به‌جای سیستم‌های اجرایی، به عنوان طبقه‌بندی‌کننده ساختاریافته سیاست‌ها به کار می‌گیرد. این روش با قرار دادن یک JSON Schema بین مدل و…

۸ دقیقه خواندن
کریس الکسیوک از انویدیا درباره نموترون، پردازنده‌های گرافیکی و هوش مصنوعی عاملی صحبت می‌کند

انویدیا مدل‌های Nemotron 3 را بر اساس ظرفیت سخت‌افزاری GPU طراحی کرد

انویدیا با معرفی خانواده مدل‌های Nemotron 3، معماری هوش مصنوعی را از قوانین انتزاعی مقیاس‌پذیری به سمت بهینه‌سازی مستقیم برای سخت‌افزار برد. این مدل‌ها با هدف کاهش هزینه استنتاج…

۷ دقیقه خواندن۴
APIهای تصویر بازاریابی ایمن‌دربرابر‌تلاش‌مجدد: رزولوشن پوستر، تبلیغات شبکه‌های اجتماعی، سبک و بزرگنمایی
آموزش کاربردی

استفاده از کلیدهای Idempotency برای حذف هزینه‌های تکراری در خط لوله‌های تصویر

پیاده‌سازی APIهای تبدیل متن به تصویر در برنامه‌های چندکاربره اغلب به دلیل قطع اتصال شبکه، منجر به پرداخت هزینه‌های مضاعف می‌شود. معماری جدیدی بر پایه کلیدهای یکتایی و دفتر کل…

۹ دقیقه خواندن۳
چک‌لیست عملی برای ارزیابی مدل‌های تبدیل تصویر به ویدیو
آموزش کاربردی

۵ معیار کلیدی برای سنجش کیفیت تولید در مدل‌های تبدیل تصویر به ویدیو

یک گردش‌کار جدید برای مدل‌های تبدیل تصویر به ویدیو، تمرکز را از نتایج تصادفی به یک سامانه ارزیابی کنترل‌شده تغییر می‌دهد. سازندگان اکنون می‌توانند با ردیابی پنج معیار انسجام،…

۳ دقیقه خواندن
معماری سیستم RAG صوتی جلسات با استفاده از Fast Transcription و Foundry IQ در Microsoft Foundry
آموزش کاربردی

مایکروسافت با Foundry IQ فایل‌های صوتی جلسات را به پایگاه دانش تبدیل کرد

مایکروسافت با ترکیب سیستم‌های تبدیل سریع گفتار به متن و Foundry IQ، امکان تبدیل ضبط‌های صوتی جلسات به پایگاه‌های دانش قابل جست‌وجو را فراهم کرد. این زیرساخت به عامل‌های هوش مصنوعی…

۱۸ دقیقه خواندن
برنامه جمینی با بیش از یک میلیارد کاربر ماهانه، سریع‌ترین محصول رشد گوگل شد.

چرا تغییر رویکرد به تعاملات صوتی رشد Gemini را شتاب بخشید؟

اپلیکیشن Gemini گوگل با جذب یک میلیارد کاربر ماهانه، رکورد سریع‌ترین رشد محصول در تاریخ این شرکت را شکست. این جهش مدیون تغییر رویکرد به تعاملات صوتی و عرضه قابلیت‌های عامل‌محور…

۴ دقیقه خواندن۲
بررسی Poppy AI: تولید محتوا از هر منبعی بدون شروع از صفر
آموزش کاربردی

آیا بوم‌های بصری جایگزین چت‌بات‌های متنی در پردازش منابع می‌شوند؟

پلتفرم Poppy AI با معرفی یک بوم بصری، امکان اتصال مستقیم منابعی مانند ویدیوهای یوتیوب و فایل‌های PDF را برای تولید محتوا فراهم کرد. این رویکرد نیاز به توضیح مکرر زمینه (Context)…

۵ دقیقه خواندن۱