
Reasoning Arena: غلبه بر مشکل پاداشهای تخت در آموزش مدلهای استدلالی
چارچوب Reasoning Arena با جایگزینی سیگنالهای باینری با تورنمنتهای مقایسهای، دقت مدلها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۶۹ مقاله منتشر شده

چارچوب Reasoning Arena با جایگزینی سیگنالهای باینری با تورنمنتهای مقایسهای، دقت مدلها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

پژوهشگران مجموعه داده PhysScene را معرفی کردند؛ نخستین گراف صحنه تخصصی برای محیطهای آزمایشگاهی فیزیک. هدف این پروژه تغییر تمرکز مدلها از روابط مکانی ساده به وابستگیهای عملکردی…

پژوهشگران نوع جدیدی از حملات به نام «تزریق پرامپت مغزی» را شناسایی کردهاند که از طریق اختلال در سیگنالهای عصبی، عاملهای BCI-LLM را به کنترل درمیآورد. این مطالعه ثابت میکند که…

پژوهشگران با معرفی PyGeoX و مکانیزم پاداش SAR، نرخ موفقیت مدلهای زبانی در حل مسائل پیچیده هندسی را ۲.۳ برابر کردند. این روش با جلوگیری از «پوشش گرادیانهای پرت»، مانع از توهم مدل…

پژوهشگران با توسعه MetaSeq، طراحی متامتریالهای آکوستیک را به یک مسئله توالی-به-توالی تبدیل کردهاند. این سیستم با جایگزینی نمایشهای پیکسلی با یک زبان توالیمحورِ مبتنی بر فیزیک،…

پژوهشگران چارچوبی به نام BSTabDiff را برای تولید دادههای جدولی مصنوعی در حوزههایی که تعداد ویژگیها بسیار بیشتر از نمونههاست، توسعه دادهاند. این سیستم با استفاده از…

پژوهشگران روشی برای همپوشانی (Overlap) محاسبات و ارتباطات در محیطهای چند-GPU ابداع کردهاند که زمان اجرای کل را تا ۲۵.۵٪ کاهش میدهد. این دستاورد بدون تغییر در کتابخانههای…

یک رویکرد جدید در تشخیص اشیاء کمنمونه (FSOD) با اصلاح عدمتوازن بین پیشنهادهای کلاسهای پایه و جدید، دقت مدلها را ۱ تا ۶ درصد افزایش داده است. این روش بدون ایجاد تأخیر در زمان…

پژوهشگران دریافتند که مدلهای بنیادی EEG حتی پس از عبور از بازرسیهای امنیتی، همچنان ویژگیهای طیفی حساس را فاش میکنند. این مطالعه با معرفی یک چارچوب بازرسی مشترک، ناکارآمدی…

پژوهشگران چارچوب EgoTactile را معرفی کردند که میتواند فشار گیرش دست را تنها از طریق ویدیوهای اولشخص تخمین بزند. این سیستم با استفاده از مدلهای انتشار، نیاز به سختافزارهای لمسی…

ترجمهٔ مستقیم بنچمارکهای ایمنی انگلیسی برای شناسایی آسیبپذیریهای مدلهای زبانی در محیطهای آسیایی ناکارآمد است. مطالعهای جدید ثابت میکند که رِد-تیمینگ متناسب با فرهنگهای…

پژوهشگران با ترکیب یادگیری تقویتشدهی SAC و یک برنامه آموزشی خودگردان (SPDL)، سیستمی برای آموزش موتورسیکلتهای مسابقهای خودران توسعه دادهاند. این رویکرد نیاز به طراحی دستی…