پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۳ مقاله منتشر شده

آی‌بی‌ام: مدل Granite Speech 5.0، ۳.۵ ساعت گفتار را در یک ثانیه رونویسی می‌کند

مدل Granite Speech 5.0 آی‌بی‌ام ۳.۵ ساعت صوت را در یک ثانیه تبدیل به متن می‌کند

آی‌بی‌ام دو مدل فشرده برای بازشناسی گفتار منتشر کرد که سرعت پردازش آن‌ها ۱۲ هزار برابر بیشتر از زمان واقعی است. این مدل‌ها با حذف کامل لایه زبانی، توان عملیاتی عظیمی را برای…

۴ دقیقه خواندن
تکنولوژی تشخیص چهره در سال ۲۰۲۶: ارزیابی دقت و چالش‌های پیش رو
آموزش کاربردی

دقت ۹۵ درصدی در محیط کنترل‌شده در برابر چالش‌های نورپردازی واقعی

تکنولوژی بازشناسی چهره در محیط‌های کنترل‌شده تا اوت ۲۰۲۶ به دقت ۹۵٪ رسیده است. با این حال، عملکرد این سیستم‌ها در دنیای واقعی همچنان تحت تأثیر متغیرهایی چون نورپردازی و سوگیری‌های…

۴ دقیقه خواندن۱
دوربین‌های مداربسته با هوش مصنوعی فراتر از تشخیص حرکت عمل می‌کنند
آموزش کاربردی

تحلیل ویدئویی هوشمند در برابر تشخیص سادهٔ حرکت در سیستم‌های IP

امنیت صنعتی از تشخیص سادهٔ حرکت به سمت طبقه‌بندی اشیا با هوش مصنوعی حرکت می‌کند. با افزودن یک لایه نرم‌افزاری به دوربین‌های IP موجود، اپراتورها می‌توانند بدون تعویض سخت‌افزار،…

۷ دقیقه خواندن۱
مدل متن‌باز جدید SuperQwen3.8-27b-abliterated: هوش مصنوعی بدون محدودیت محتوایی
آموزش کاربردی

مدل SuperQwen3.8 با پنجرهٔ متنی یک میلیون توکنی و ساختار بدون سانسور منتشر شد

مدل متن‌باز SuperQwen3.8-27b-abliterated با قابلیت پردازش یک میلیون توکن و حذف محدودیت‌های سانسور عرضه شده است. این مدل با استفاده از روش تنظیم دسته‌جمعی عامل‌ها، مشکلاتی نظیر…

۱ دقیقه خواندن۱
تصویر: ادغام درک محتوای ویدیویی و صوتی در پلتفرم مایکروسافت فاندری IQ
آموزش کاربردی

مایکروسافت ویدیوهای سازمان‌ها را به داده‌های ساختاریافته برای عامل‌های AI تبدیل

مایکروسافت با ادغام Azure Content Understanding در Foundry IQ، امکان استناد دقیق عامل‌های هوش مصنوعی به ثانیه‌ها و فریم‌های تصویری ویدیوها را فراهم کرد. این قابلیت با تبدیل…

۱۲ دقیقه خواندن۱
کدکس کلود+ عامل صنعتگر: مهارت‌های CLI برای تبدیل ایده طراحی به ژنراتور اسباب‌بازی سه‌بعدی هوشمند
آموزش کاربردی

عامل Craftsman ایده‌های متنی را به اسباب‌بازی‌های قابل چاپ سه‌بعدی تبدیل می‌کند

یک گردش‌کار عامل‌محور جدید با ترکیب مدل‌های زبانی محلی و APIهای تخصصی تولید سه‌بعدی، پرامپت‌های متنی را به مدل‌های آماده تولید تبدیل می‌کند. این سیستم با تولید صفحات چندنمایی و…

۴ دقیقه خواندن۲
تولید تصویر با هوش مصنوعی SaaS در ۲۰۲۶: الگوهای پرامپت قابل حمل، نسبت تصویر و محدودیت‌های ایمنی
آموزش کاربردی

جلوگیری از وابستگی به ارائه‌دهندگان AI با معماری آداپتور در Node.js

یک چارچوب معماری جدید برای تولید تصویر با هوش مصنوعی، بر استفاده از آداپتورهای مستقل و پیش‌تنظیم‌های سخت‌گیرانه تأکید می‌کند تا از قفل‌شدگی سازنده (Vendor Lock-in) جلوگیری شود.…

۷ دقیقه خواندن
قیمت‌گذاری API اوپن‌ای‌ای
آموزش کاربردی

OpenAI هزینه استنتاج مدل GPT-5.6 Sol را به ۴ دلار در هر میلیون توکن رساند

اوپن‌ای‌آی با معرفی خانواده مدل‌های GPT-5.6، ساختار قیمت‌گذاری API خود را تغییر داد. این به‌روزرسانی شامل مدل‌های Sol، Terra و Luna است و هزینه‌های جدیدی برای ابزارهای تخصصی مانند…

۳ دقیقه خواندن۲