
مدلهای جهانی Veeda AI چگونه سرعت یادگیری رباتها را افزایش میدهند؟
سانجا فیدلر، نایبرئیس سابق انویدیا، با جذب ۹۰ میلیون دلار سرمایه استارتاپ Veeda AI را برای ساخت مدلهای جهانی (World Models) راهاندازی کرد. هدف این شرکت ایجاد محیطهای…
موضوع
Models that natively process text+image+audio+video
۱٬۳۵۶ مقاله منتشر شده

سانجا فیدلر، نایبرئیس سابق انویدیا، با جذب ۹۰ میلیون دلار سرمایه استارتاپ Veeda AI را برای ساخت مدلهای جهانی (World Models) راهاندازی کرد. هدف این شرکت ایجاد محیطهای…

یک توسعهدهنده با استفاده از مدلهای تبدیل متن به گفتار و تصویر گوگل، یک سیستم تولید داستان شخصیسازیشده برای دستگاه Lunii ساخت. این پروژه محتوای تولیدی هوش مصنوعی را مستقیماً به…

یک استراتژی جدید برای توسعهدهندگان Node.js، نظارت بر محتوا را از طریق طرحهای سختگیرانه JSON و لایههای سازگارساز یکپارچه میکند. این روش اجازه میدهد بدون بازنویسی خط لوله…

بهروزرسانی نسخه ۶.۰ کتابخانه Sentence Transformers با معرفی MultiVectorEncoder، بازیابی مدلهای ColBERT را ممکن کرد. این رویکرد با حفظ جزئیات در سطح توکن، دقت بازیابی را در…

قابلیت جدید Pet Memory در اکوسیستم گوگل تلاش میکند حیوانات خانگی را از طریق دوربینهای Nest شناسایی کند، اما آزمایشهای واقعی نشان میدهد مدل در تفکیک حیوانات از یک گونه شکست…

آنتروپیک با معرفی ابزار Read در Claude Code، یک کانال اجباری برای ادراک محیطی ایجاد کرده است که هرگونه ویرایش کد را مشروط به خواندن واقعی فایل میکند. این سازوکار با حذف…

شرکت Cartesia مدل Sonic-3.6 را معرفی کرد که با جایگزینی ترنسفورمرها با مدلهای فضای حالت (SSM)، تأخیر استنتاج را به زیر ۹۰ میلیثانیه رسانده است. این مدل در حال حاضر رتبه اول هر…

لو رفتن یک ویدیو در بتای macOS Tahoe نشان میدهد اپل در حال توسعه ایرپادهایی با دوربین داخلی است. این گجتها با استفاده از «هوش بصری»، به سیری اجازه میدهند محیط اطراف کاربر را…

مدل جدید و وزنباز Qwen 3.8 27B از علیبابا، با کسب بالاترین امتیاز هوشمندی در میان ۱۳۵ مدل هماندازه، سقف جدیدی برای کارایی مدلهای میانمقیاس تعریف کرد. این مدل با پنجره متنی…

نسل جدید مدلهای تولید ویدیو با حذف نقصهای بصری، ابزارهای سنتی تشخیص جعل عمیق را ناکارآمد کردهاند. این تغییر، مهندسان امنیت را مجبور میکند تا از تحلیل پیکسلها به سمت تأییدیه…

گوگل با معرفی فراخوانی توابع بهصورت ناهمگام در Gemini Live API، اجازه میدهد عاملهای صوتی هنگام اجرای ابزارهای پسزمینه به صحبت ادامه دهند. این بهروزرسانی تأخیرهای API را…

شرکت MiniMax مدل MiniMax-Music3 را منتشر کرد که قادر است آهنگهای کامل پنجدقیقهای با کیفیت بالا از روی متن و شرح ساختار تولید کند. این مدل با معماری Hybrid-LM، تعادلی میان…