
«تفسیر متنیِ گرافها»؛ رویکرد جدید AMD و Qwen برای ردیابی تقلب
استفاده از مدلهای بینایی-زبانی امکان شناسایی الگوهای پیچیده mixers را بهجای تحلیل دادههای خام، از طریق تحلیل بصری گرافهای تراکنش فراهم میکند. با تنظیم دقیق Qwen2-VL روی…
موضوع
Models that natively process text+image+audio+video
۱٬۳۴۸ مقاله منتشر شده

استفاده از مدلهای بینایی-زبانی امکان شناسایی الگوهای پیچیده mixers را بهجای تحلیل دادههای خام، از طریق تحلیل بصری گرافهای تراکنش فراهم میکند. با تنظیم دقیق Qwen2-VL روی…

شرکت PrismML مدل Bonsai 27B را معرفی کرد؛ نخستین مدل در این مقیاس که بهدلیل استفاده از وزنهای ۱-بیتی و ترنری، روی گوشیهای هوشمند اجرا میشود. این مدل قابلیتهای استدلالی…

گوگل در صورت نبود نتایج واقعی، تصاویر را با هوش مصنوعی تولید میکند و صفحه اصلی Google Images را به گالری شخصیسازی شده تبدیل کرده است. این تغییرات نشاندهنده چرخش گوگل از یک…

گوگل قابلیت تولید تصویر با هوش مصنوعی را مستقیماً در بخش AI Overviews قرار داد. کاربران اکنون میتوانند بدون خروج از نتایج جستوجو، با مدل Nano Banana تصاویر سفارشی بسازند.

اسپاتیفای دستیار جدیدی معرفی کرده که به کاربران اجازه میدهد از طریق گفتگوهای صوتی یا متنی، موسیقی خود را مدیریت کنند و تاریخچه شنیداریشان را تحلیل نمایند. این قابلیت در حال حاضر…

کمپانی OpenAI سری مدلهای GPT-5.6 را با قابلیت Computer Use برای کنترل مستقیم رابط کاربری و سه سطح مختلف تفکر روانه بازار کرد. این بهروزرسانی شامل ادغام اپلیکیشنهای macOS و…

اسپاتیفای قابلیت Talk to Spotify را برای کاربران پرمیوم در آمریکا، ایرلند و سوئد عرضه کرد. این ابزار اجازه میدهد کاربران از طریق صوت یا متن، فهرستها را مدیریت کرده و درباره…

یک معماری عاملمحور جدید با جداسازی محاسبات دادهای از استدلال مدلهای زبانی، تحلیل تبلیغات را از گزارشهای ساده به بریفهای خلاقانه تبدیل میکند. این سامانه با شناسایی دقیق…

ویرایشگر کد Zed اکنون از سرور FFmpeg Micro MCP پشتیبانی میکند تا توسعهدهندگان بتوانند با پرامپتهای هوش مصنوعی ویدیوها را تبدیل و پردازش کنند. این قابلیت نیاز به دستورات دستی در…

نقشههای داخلی سنتی به دلیل تحمیل بار ذهنی برای تبدیل تصویر دوبعدی به حرکت سهبعدی شکست میخورند. رایانش مکانی با ادغام مسیریابی زمینهای و بلادرنگ در محیط فیزیکی، این شکاف شناختی…

شرکت Mistral AI مدل Robostral Navigate را معرفی کرد؛ یک مدل ۸ میلیارد پارامتری که رباتها را قادر میسازد تنها با یک دوربین معمولی و بدون نیاز به حسگرهای گرانقیمت، در محیطهای…

گوگل قابلیت Immersive Navigation را برای اندروید اتو فعال کرد تا نقشههای دوبعدی را با محیطهای سهبعدی ساختهشده توسط هوش مصنوعی جایگزین کند. این بهروزرسانی با تحلیل تصاویر…