
رشتههای مجازی JDK تأخیر API صوتی OpenAI را کاهش داد
توسعهدهندگان با جایگزینی جریانهای پیچیده واکنشگرا با رشتههای مجازی JDK، عاملهای صوتی با تأخیر بسیار کم میسازند. این روش ادغام API Realtime شرکت OpenAI را از طریق کدهای…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۷ مقاله منتشر شده

توسعهدهندگان با جایگزینی جریانهای پیچیده واکنشگرا با رشتههای مجازی JDK، عاملهای صوتی با تأخیر بسیار کم میسازند. این روش ادغام API Realtime شرکت OpenAI را از طریق کدهای…

تکنیک «رمزگشایی خط لولهای» در موتور Photon با حذف دورههای بیکاری GPU، توان عملیاتی مدلهای VLM را بهویژه در سختافزارهای سطح بالا مانند B200 تا ۳۵٪ افزایش داده است.

گوگل قابلیت تولید تصویر بر اساس دادههای شخصی حساب کاربری را برای تمامی کاربران واجد شرایط در آمریکا رایگان کرد. این ویژگی که پیشتر محدود به اشتراکهای پولی بود، حالا با تکیه بر…

خلبانان پهپاد با شکافی عمیق میان ضبط تصاویر 4K و تولید تدوین نهایی مواجهاند. ابزارهای جدید از سیستمهای خودکارساز بر پایه هوش مصنوعی تا سوئیتهای تخصصی اصلاح رنگ، برای رفع…

شرکت DJI مدل Osmo Pocket 4P را با دامنه دینامیکی ۱۷ استاپ و سیستم لنز دوگانه معرفی کرد. این دوربین حرفهای با هدف جذب سازندگانی که به کیفیت بصری استانداردهای سینمایی نیاز دارند،…

استارتآپ سوئیسی Flexion Robotics با استفاده از یادگیری تقویتی و محیطهای شبیهسازی، رباتهای انساننما را از دموهای ساده فراتر برده است. این سیستم به رباتها اجازه میدهد وظایف…

برای تولید ویدیوهای موسیقی با کیفیت حرفهای، باید از توصیفات کلی به ساختاری شامل سبک، موتیف، رنگ و ضربآهنگ تغییر مسیر داد. این متد حدسزنی مدل را حذف و انسجام بصری بین صحنهها را…

یک بیمار با استفاده از مدل Opus 4.8 و ابزار Claude Code، دادههای MRI خود را تحلیل کرد که منجر به رد تشخیص پزشک مبنی بر پارگی درجه ۳ تاندون شد. این اتفاق بیمار را در وضعیتی میان…

استودیوی Inithouse با عرضه Alive Photo، مدلی از ابزارهای هوش مصنوعی بدون نیاز به حساب کاربری و ذخیرهسازی داده را معرفی کرد. این سیستم با استفاده از معماری بدون سرور، تمام…

یک پروژه کاربردی جدید نشان میدهد چگونه میتوان با استفاده از PyTorch و مدل پیشآموز ResNet-50، سامانهای برای تشخیص هویت نقاشان ساخت. این روش با بهرهگیری از یادگیری انتقالی،…

یک راهنمای فنی جدید روش تبدیل توصیفات متنی به فایلهای MIDI قابل پخش را از طریق تولید نمادگذاری ABC توسط مدلهای زبانی نشان میدهد. این گردشکار با استفاده از Oxlo.ai برای استنتاج…

سنتز گفتار از پردازش سیگنال به سمت مدلسازی خودبازگشتی زبانی حرکت کرده و با صوت به عنوان توکنهای گسسته برخورد میکند. این تغییر، شبیهسازی صفر-نمونه و لحن پویا را ممکن کرده، اما…