پرش به محتوای اصلی

موضوع

چندوجهی

Models that natively process text+image+audio+video

۱٬۴۱۸ مقاله منتشر شده

۸ میلیون دلار سرمایه برای تبدیل محیط‌های بازی به داده‌های آموزشی مدل‌های جهانی

۸ میلیون دلار سرمایه برای تبدیل محیط‌های بازی به داده‌های آموزشی مدل‌های جهانی

استارتاپ Origin Lab با جذب ۸ میلیون دلار سرمایه، بازاری را برای فروش داده‌های شبیه‌سازی‌شده‌ی بازی‌های ویدئویی به آزمایشگاه‌های هوش مصنوعی ایجاد می‌کند. این داده‌ها برای آموزش…

۲ دقیقه خواندن
چگونه درگاه‌های مدل یکپارچه هزینه ساخت همراهان هوش مصنوعی را ۴۰٪ کاهش می‌دهند؟
آموزش کاربردی

چگونه درگاه‌های مدل یکپارچه هزینه ساخت همراهان هوش مصنوعی را ۴۰٪ کاهش می‌دهند؟

توسعه‌گران همراهان هوش مصنوعی با جایگزینی APIهای تک‌مدلی با درگاه‌های یکپارچه، هزینه‌های استنتاج را تا ۴۰٪ کاهش داده‌اند. این رویکرد اجازه می‌دهد شخصیت‌های دیجیتال از وابستگی به…

۲ دقیقه خواندن
چگونه NVIDIA جستجوی ویدئویی را از سیستم‌های هشدار به عامل‌های هوشمند تبدیل کرد؟
آموزش کاربردی

چگونه NVIDIA جستجوی ویدئویی را از سیستم‌های هشدار به عامل‌های هوشمند تبدیل کرد؟

انویدیا با معرفی طرح VSS، جستجو و خلاصه‌سازی ویدئوها را به عامل‌های هوش مصنوعی سپرد. این فناوری اجازه می‌دهد آرشیوهای عظیم ویدئویی به‌جای هشارهای ساده، با زبان طبیعی مورد بازجویی…

۳ دقیقه خواندن۱
چرا مکانیسم‌های خوداصلاحی مدل‌های زبانی در برابر حملات M³Att شکست می‌خورند؟

چرا مکانیسم‌های خوداصلاحی مدل‌های زبانی در برابر حملات M³Att شکست می‌خورند؟

پژوهشگران چارچوب M³Att را معرفی کردند که با استفاده از محرک‌های بصری و اطلاعات گمراه‌کننده، سیستم‌های RAG پزشکی را هدف قرار می‌دهد. این حمله مدل‌ها را فریب می‌دهد تا تشخیص‌های…

۲ دقیقه خواندن۱
داده‌های منطقه‌ای هلند: دستیابی به عملکرد جهانی با ۱.۲ میلیون تصویر ماهواره‌ای

داده‌های منطقه‌ای هلند: دستیابی به عملکرد جهانی با ۱.۲ میلیون تصویر ماهواره‌ای

پژوهشگران با توسعه یک مدل بنیادی برای هلند، ثابت کردند که بافتار زمانی می‌تواند جایگزین حجم عظیم داده‌ها شود. این مدل با استفاده از ۱.۲ میلیون تصویر، عملکردی رقابتی در بنچمارک‌های…

۲ دقیقه خواندن۲
چرا تزریق دانش گراف‌محور در میکروسکوپی از تنظیم دقیق مدل‌های زبانی کارآمدتر است؟

چرا تزریق دانش گراف‌محور در میکروسکوپی از تنظیم دقیق مدل‌های زبانی کارآمدتر است؟

چارچوب MicroWorld با استفاده از گراف‌های ویژگی چندوجهی، دقت مدل Qwen3-VL را در استدلال‌های میکروسکوپی ۱۳٪ بیشتر از GPT-5 کرد. این دستاورد ثابت می‌کند بازیابی دانش ساختاریافته…

۲ دقیقه خواندن۱
ViSRA: افزایش ۲۸.۹ درصدی دقت استدلال فضایی در مدل‌های زبانی بدون آموزش مجدد

ViSRA: افزایش ۲۸.۹ درصدی دقت استدلال فضایی در مدل‌های زبانی بدون آموزش مجدد

چارچوب ViSRA با حذف نیاز به آموزش‌های هزینه‌بر، استدلال فضایی سه‌بعدی را در مدل‌های چندوجهی ارتقا می‌دهد. این سیستم با تکیه بر مدل‌های خبره، در وظایف پیش‌بینی‌نشده تا ۲۸.۹٪ بهتر…

۲ دقیقه خواندن۲
چگونه PoDAR با جداسازی توان سیگنال، سرعت همگرایی مدل‌های صوتی را دو برابر کرد؟

چگونه PoDAR با جداسازی توان سیگنال، سرعت همگرایی مدل‌های صوتی را دو برابر کرد؟

چارچوب PoDAR با جداسازی توان سیگنال از محتوای معنایی در فضاهای نهان صوتی، سرعت همگرایی مدل‌های زاینده را دو برابر می‌کند. این رویکرد در مدل F5-TTS منجر به بهبود چشمگیر شباهت…

۲ دقیقه خواندن۱