پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۲۶ مقاله منتشر شده

رونویسی با برچسب زمانی: ساخت آرشیو ویدیویی قابل جستجو
آموزش کاربردی

«دسترسی مستقیم به ثانیه‌های کلیدی»؛ راهکار جدید بازیابی داده در ویدئو

بسیاری از سازمان‌ها با مشکل بازیابی داده از ویدئوهای طولانی دست‌وپنجه نرم می‌کنند. تبدیل متن به داده‌های ناوبری با استفاده از برچسب‌های زمانی، امکان دسترسی مستقیم به ثانیه‌های…

۸ دقیقه خواندن۱
آینده مدل‌های زبانی بزرگ در خودروهای خودران: روندها و فرصت‌ها
آموزش کاربردی

تحلیل معماری جدید: جایگزینی خط‌لوله‌های ایستا با سامانه‌های شناختی

معماری خودروهای خودران از سیستم‌های ادغام سنسور ایستا به سمت سامانه‌های شناختی مبتنی بر مدل‌های زبانی بزرگ حرکت می‌کند. این تغییر مسیر، توانایی تفسیر قوانین پیچیده ترافیکی و تولید…

۲ دقیقه خواندن
شایعه ادغام Anthropic و Physical Intelligence در توییتر هوش مصنوعی | تک‌کرانچ

Anthropic در برابر OpenAI؛ رقابت بر سر تسخیر سخت‌افزار برای ابرهوش مصنوعی

گزارش‌ها حاکی از آن است که Anthropic برای دستیابی به «هوش مصنوعی تجسم‌یافته»، مذاکراتی را برای خرید استارتاپ رباتیک Physical Intelligence پیش برده است. این اقدام نشان‌دهنده رقابت…

۴ دقیقه خواندن
سیستم نگهداری پیش‌بینانه مبتنی بر مدل زبانی بزرگ در حال پایش تجهیزات صنعتی
آموزش کاربردی

Oxlo.ai: کاهش چشمگیر هزینه مدل‌های پنجره‌بلند با قیمت‌گذاری درخواستی

سامانه‌های نگهداری پیش‌بینانه به دلیل حجم بالای داده‌های حسگرها با هزینه‌های گزاف توکن مواجه‌اند. Oxlo.ai با جایگزینی پرداخت توکنی با هزینه ثابت به‌ازای هر درخواست، استقرار…

۴ دقیقه خواندن۲
باز کردن قفل توانایی مدل‌های زبانی بزرگ برای تقسیم‌بندی تصویر
آموزش کاربردی

Oxlo.ai قطعه‌بندی تصویر را با تبدیل زبان طبیعی به مختصات مکانی خودکار کرد

پلتفرم Oxlo.ai با استفاده از مدل‌های زبانی بزرگ به عنوان موتور استدلال، دستورات متنی را به مختصات دقیق برای قطعه‌بندی تصویر تبدیل می‌کند. این سامانه با مدل قیمت‌گذاری مبتنی بر…

۱ دقیقه خواندن۳
طراحی سیستم یوتیوب برای زیرساخت داده رباتیک
آموزش کاربردی

«تبدیل اپیزود به استریم»؛ استراتژی Pareto برای مدیریت داده‌های پیچیده

پلتفرم Pareto با الهام از معماری سیستم‌های ویدئویی مقیاس‌بزرگ، زیرساختی چندوجهی برای مدیریت داده‌های پیچیده رباتیک ایجاد کرده است. این سامانه با تبدیل اپیزودهای آموزشی ربات به…

۷ دقیقه خواندن
آنتروپیک برنامه‌های کشف دارو برای بیماری‌های غیرسودآور داروسازی بزرگ راه‌اندازی کرد

Claude Cowork مهارت‌های دسکتاپ را از طریق ضبط صفحه نمایش می‌آموزد

قابلیت جدید Claude Cowork به کاربران اجازه می‌دهد با ضبط صفحه و توضیح صوتی، گردش‌های کاری پیچیده را به مهارت‌های قابل تکرار برای هوش مصنوعی تبدیل کنند. این به‌روزرسانی نیاز به…

۱ دقیقه خواندن۱
تنظیم اسپاتیفای که موسیقی را مثل میکس دی‌جی احساسی‌تر می‌کند
آموزش کاربردی

«ساده‌سازی مفاهیم دی‌جی»؛ هدف Spotify از عرضه قابلیت Mix برای کاربران

اسپاتیفای قابلیت Mix را برای مشترکان پرمیوم عرضه کرد تا بتوانند انتقال‌های هوشمند و دائمی بین آهنگ‌های لیست‌های خود ایجاد کنند. این ابزار مفاهیم تخصصی دی‌جی مانند تطبیق BPM و…

۴ دقیقه خواندن۱
تصویر: نمونه‌ای از تولید اینفوگرافیک کامل و متن خوانا با مدل کیوئن-ایمیج ۳.۰ علی‌بابا

مدل Qwen-Image-3.0 چگونه مرز میان تصویر و سند ساختاریافته را شکست؟

مدل جدید علی‌بابا قادر است اینفوگرافیک‌های متراکم با متون خوانای ۱۰ پیکسلی و فرمول‌های پیچیده ریاضی را در یک بار تولید کند. این مدل از تولید تصاویر صرفاً زیبایی‌شناختی به سمت خلق…

۴ دقیقه خواندن۲