پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۳۵۵ مقاله منتشر شده

نمودار SVG قورباغه با فک برجسته هابسبورگ، بنچ‌مارک بهینه‌سازی گرافیک برداری.

«قورباغه‌های سلطنتی»؛ اثرات ناخواسته در خروجی‌های بصری هوش مصنوعی

یک محک جدید به نام FROGS_ نشان می‌دهد که مدل‌های هوش مصنوعی در مواجهه با پرامپت‌های ساده، دچار «بیش‌ویرایشگری» می‌شوند. این مدل‌ها به‌جای رسم یک قورباغه ساده، ویژگی‌های پزشکی و…

۷ دقیقه خواندن۲
دستگاه پاسخگوی هوشمند ساخت خودتان: راهنمای ساخت دستیار صوتی مبتنی بر هوش مصنوعی
آموزش کاربردی

ترکیب Twilio و Deepgram امکان ساخت دستیار تلفنی بدون سخت‌افزار را فراهم کرد

یک پیاده‌سازی فنی جدید به توسعه‌دهندگان اجازه می‌دهد با حذف زیرساخت‌های سخت‌افزاری پیچیده، دستیارهای تلفنی تمام‌خودکار بسازند. این سیستم با ایجاد یک پل صوتی دوطرفه، مدیریت پذیرش…

۴ دقیقه خواندن۷
آندره کارپاتی در حال سخنرانی در رویدادی مربوط به هوش مصنوعی و یادگیری ماشین

Opus 5 محیط‌های سه بعدی پیچیده را از یک پاراگراف متن خلق کرد

آندرج کارپاتی توانایی مدل Opus 5 در تبدیل متن به محیط‌های سه بعدی تعاملی و رویه‌ای را به نمایش گذاشت. این آزمایش نشان‌دهنده گذار به سوی جهان‌سازی «در لحظه» است، هرچند نبود بازخورد…

۲ دقیقه خواندن
مردی در حال بررسی صفحه قیمت‌گذاری APIهای تبدیل گفتار به متن با چهره‌ای در حال فکر کردن
آموزش کاربردی

آیا قابلیت‌های تشخیص نوبت گفتگو جایگزین دقت پایه در STT می‌شوند؟

بنچمارک ژوئیه ۲۰۲۶ نشان می‌دهد Melia-1 از Speechmatics در دقت و مدیریت تغییر زبان پیشتازی می‌کند. برای توسعه‌دهندگان، اولویت از دقت پایه به قابلیت‌هایی نظیر پرامپتینگ کلمات کلیدی…

۴ دقیقه خواندن
هنرمندان برای پذیرش هوش مصنوعی پول کافی می‌گیرند؟

پلتفرم Pippa برای هر بار استفاده از سبک هنرمندان به آن‌ها دستمزد می‌دهد

استارت‌آپ Pippa با معرفی مدلی برای پرداخت حق‌الامتیاز به هنرمندان، قصد دارد عصر استخراج غیرقانونی داده‌ها را به پایان برساند. در این پلتفرم، هر بار که کاربری ویدیویی با سبک یک…

۲ دقیقه خواندن۱
شماره ۷۷ خبرنامه FutureX · Physical AI Daily — ۰۳ اوت

مدل DreamDojo انویدیا با ۴۴ هزار ساعت ویدیو، حس مشترک فیزیکی را به ربات‌ها آموخت

انویدیا و شیائومی با استفاده از مجموعه‌داده‌های عظیم ویدیوهای انسانی، گلوگاه «برچسب‌گذاری عملیات» در هوش مصنوعی تجسم‌یافته را می‌شکنند. هم‌زمان، ظهور تک‌شاخ‌های انسانی در اروپا…

۱۹ دقیقه خواندن۳
کلaude Opus 5 هوش مصنوعی را از بلوک‌های رنگی به نمونه‌های سه‌بعدی با فیزیک و موسیقی ارتقا داد

Claude Opus 5 در برابر GPT-5.6 در تولید بازی‌های سه‌بعدی رویه‌ای

مدل جدید آنتروپیک قادر است بازی‌های سه‌بعدی و شبیه‌سازهای فیزیکی قابل اجرا را تنها با یک پرامپت و از طریق کدنویسی رویه‌ای تولید کند. برخلاف مدل‌های ویدئویی، این مدل خروجی‌های قابل…

۴ دقیقه خواندن
هزینه تولید محتوای هوش مصنوعی را قبل از اجرای کد بدانید
آموزش کاربردی

«پایان غافلگیری مالی»؛ هدف جدید Pixapi برای توسعه‌دهندگان مدل‌های تولیدی

پلتفرم Pixapi با معرفی پاسخ‌های Pre-flight، تخمین دقیق هزینه را پیش از اجرای عملیات تولید تصویر یا ویدیو ارائه می‌دهد. این قابلیت به توسعه‌دهندگان اجازه می‌دهد تا بودجه استنتاج را…

۲ دقیقه خواندن۱
میمون‌های وحشی در حال تعامل اجتماعی در زیستگاه طبیعی خود
آموزش کاربردی

سیستم CapuchinAI دقت شناسایی میمون‌های وحشی را به ۹۷٪ رساند

پژوهشگران دانشگاه اموری یک پلتفرم ارزان‌قیمت مبتنی بر هوش مصنوعی ساختند تا تست‌های شناختی میمون‌های کاپوچین را در طبیعت به‌صورت خودکار اجرا کنند. این سامانه با ترکیب تشخیص چهره و…

۷ دقیقه خواندن