پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۵ مقاله منتشر شده

مقایسه سطوح رایگان گوگل: Cloud TTS در برابر Translate در برابر Flow
آموزش کاربردی

گوگل کلود: دسترسی رایگان به ابزارهای زیرساختی گسترده‌تر از مدل‌های مولد است

بررسی لایه‌های رایگان گوگل کلود نشان می‌دهد دسترسی به ابزارهای زیرساختی بسیار سخاوتمندانه‌تر از مدل‌های مولد است. در حالی که APIهای ترجمه و تبدیل متن به گفتار سقف‌های بالایی…

۲ دقیقه خواندن۵
گزارش رسانه‌ای: رونویسی صدا ۴۰۴/۵۰۱: تفسیر available=false در Node.js
آموزش کاربردی

درون الگوی جدید نظارت بر محتوا برای بهینه‌سازی جریان‌های Node.js

یک الگوی معماری جدید برای نظارت بر محتوا، بازشناسی گفتار را از طبقه‌بندی مدل‌های چت جدا می‌کند تا از تولید پاسخ‌های ساختگی جلوگیری شود. این روش با بررسی وضعیت مدل در کاتالوگ پیش…

۵ دقیقه خواندن۱
نمونه‌ای از تبدیل تصویر به مدل سه‌بعدی با Meshy 7، نشان‌دهنده هم‌راستایی دقیق‌تر با ورودی تصویری.

محک جدید Meshy: جایگزینی مقایسهٔ هندسی با سلیقهٔ انسانی در مدل‌های 3D

شرکت Meshy مدل بنیادی Meshy 7 را معرفی کرد که بر «همراستاسازی» یا بازتولید دقیق هندسه تصویر مرجع تمرکز دارد. این عرضه با یک محک (Benchmark) جدید همراه است که به‌جای تکیه بر سلیقه…

۵ دقیقه خواندن
سندبار، سازنده حلقه استریم: آینده پوشیدنی‌های هوش مصنوعی صدا است

آیا انگشتر Stream می‌تواند جایگزین ابزارهای سنتی یادداشت‌برداری شود؟

شرکت Sandbar با جذب ۳۶ میلیون دلار، قصد دارد با معرفی انگشتر Stream، جایگزینی برای سخت‌افزارهای یادداشت‌برداری فعلی ایجاد کند. تمرکز این محصول بر ثبت سریع ایده‌های لحظه‌ای با…

۲ دقیقه خواندن۱
ساخت عامل تلفنی: SIP، WebRTC و مسیر صدا
آموزش کاربردی

بهینه‌سازی مسیر صوتی؛ راهکار کاهش تأخیر در عامل‌های صوتی هوش مصنوعی

ساخت یک عامل صوتی پاسخگو نیازمند بهینه‌سازی ده‌ها گام نامرئی در شبکه و نرم‌افزار است. با هم‌پوشانی فرآیندهای بازشناسی گفتار، مدل زبانی و تبدیل متن به گفتار، می‌توان از تأخیرهای…

۱۰ دقیقه خواندن۲
بررسی Runable AI: یک ابزار هوش مصنوعی برای جایگزینی همه ابزارها
آموزش کاربردی

آیا Runable AI می‌تواند جایگزین چندین اشتراک ابزارهای خلاقانه شود؟

پلتفرم Runable AI با هدف حذف «خستگی از اپلیکیشن‌ها»، فرآیندهای پژوهش، طراحی و تولید محتوا را در یک گردش‌کار عامل‌محور ادغام کرده است. کاربران به‌جای جابه‌جایی بین ابزارهای تخصصی،…

۱۴ دقیقه خواندن
مردی در حال صحبت کردن با گوشی هوشمند، با حالت ناامیدی و سردرگمی.

گفتار در برابر تایپ؛ افت شدید کیفیت LLM در وظایف پیچیده

پژوهشی جدید نشان می‌دهد لایه‌های «پاک‌سازی» متن در مسیر تبدیل گفتار به نوشتار، با حذف جزئیات ساختاری، عملکرد مدل‌های هوش مصنوعی را به‌شدت تخریب می‌کنند. این افت کیفیت در وظایف…

۸ دقیقه خواندن۴
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex
آموزش کاربردی

تبدیل مدل‌های زبانی به طبقه‌بندی‌کننده سیاست برای نظارت بر محتوای فین‌تک

یک معماری جدید در فین‌تک‌ها، مدل‌های زبانی را به‌جای سیستم‌های اجرایی، به عنوان طبقه‌بندی‌کننده ساختاریافته سیاست‌ها به کار می‌گیرد. این روش با قرار دادن یک JSON Schema بین مدل و…

۸ دقیقه خواندن