
چرا TRiP برای ساخت موتور ترنسفورمر، پایتون را به کل کنار گذاشت؟
یک توسعهدهنده طی ۱۸ ماه، موتور کامل ترنسفورمر را از صفر با زبان C بازنویسی کرد. TRiP امکان آموزش و استنتاج مدلهایی مثل Llama 2 را بدون نیاز به پایتون یا فریمورکهای سنگین فراهم…
موضوع
Models that natively process text+image+audio+video
۱٬۳۳۳ مقاله منتشر شده

یک توسعهدهنده طی ۱۸ ماه، موتور کامل ترنسفورمر را از صفر با زبان C بازنویسی کرد. TRiP امکان آموزش و استنتاج مدلهایی مثل Llama 2 را بدون نیاز به پایتون یا فریمورکهای سنگین فراهم…

مدل X-WAM با معرفی روش نمونهبرداری نویز نامتقارن، توانسته است سنتز ۴ بعدی با کیفیت بالا را با اجرای لحظهای دستورات رباتیک ترکیب کند. این پیشرفت به معنای پایان دوران توقف رباتها…

پژوهشگران ابزاری برای شناسایی همبستگیهای کاذب در مجموعهدادههای صوتی معرفی کردهاند که باعث تورم مصنوعی معیارهای موفقیت میشود. این ابزار مانع از آن میشود که مدلهای AI به جای…

ابزار جدید ATLAS با ترکیب دادههای بصری و سیگنالهای داخلی ربات، خطای مرزی در تقطیع عملیات را ۵ برابر کاهش داد. این پیشرفت، مسیر یادگیری وظایف پیچیده و طولانیمدت را برای رباتها…

معرفی چارچوب EnterpriseDocBench نشان میدهد سیستمهای تحلیل اسناد علیرغم دقت بالا، در ارائه پاسخهای جامع شکست میخورند. این مطالعه همچنین برتری بازیابی ترکیبی بر بردارهای معنایی…

پژوهشگران مجموعهداده عظیم و چندوجهی CheXthought را معرفی کردند که مسیر تفکر و نقاط تمرکز رادیولوژیستها را ثبت کرده است. این ابزار با آموزش مدلها برای «دیدن» مانند انسان، توهمات…

مدل جدید Star-Fusion با تغییر رویکرد از رگرسیون به طبقهبندی گسسته، مشکل «گمشدن در فضا» را حل کرده است. این معماری چندوجهی با دقت ۹۳.۴ درصد و تأخیر بسیار کم، استقرار ماهوارههای…

پژوهشگران راهکاری برای استفاده از دادههای متنی خالص جهت ارتقای مدلهای تشخیص گفتار یافتهاند. این مطالعه نشان میدهد پیکربندیهای ساده، مانند مدلهای مدتزمان تصادفی، اغلب از خط…

پژوهشگران راهکاری برای کاهش تأخیر در مدلهای چندوجهی (VLM) ابداع کردهاند که ارتباط بین دستگاههای لبه و ابر را بهینه میکند. این سیستم با استفاده از Meta AutoEncoder، دادههای…

محققان با معرفی چارچوب Visual-Idk، مدلهای بینایی-زبانی را قادر ساختند تا مرزهای دانش خود را بشناسند و از توهمات پرهیز کنند. این متدولوژی نرخ صداقت مدلها را از ۵۷.۹٪ به ۶۷.۳٪…

پژوهشی جدید نشان میدهد مدلهای ترجمه سنتی در حفظ چیدمان بصری متون، از مدلهای زبانی بزرگ پیشی میگیرند. این نتیجهی غیرمنتظره، نیاز صنعت طراحی به معماریهای ترکیبی را بیش از پیش…

پژوهشگران چارچوب TimeMM را معرفی کردند که با استفاده از فیلترینگ طیفی شرطیشده با زمان، تغییرات سریع سلیقه کاربران را مدل میکند. این سیستم با تعادل پویا میان دادههای بصری و…