
بازیابی کامل اسناد صحت پاسخهای کدنویسی هوش مصنوعی را ۸ برابر کرد
یک آزمایش کنترلشده روی کدهای واقعی نشان میدهد که ارسال کل سند بهجای تکههای کوچک، دقت مدلهای زبانی را در پرسوجوهای برنامهنویسی ۸۰۰٪ افزایش میدهد. این یافته ثابت میکند…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

یک آزمایش کنترلشده روی کدهای واقعی نشان میدهد که ارسال کل سند بهجای تکههای کوچک، دقت مدلهای زبانی را در پرسوجوهای برنامهنویسی ۸۰۰٪ افزایش میدهد. این یافته ثابت میکند…

ابزار جدید Cascade با اجبار مدلها به ساخت انیمیشنهای خالص CSS و حذف کامل جاوااسکریپت، یک محک سختگیرانه برای سنجش توانایی واقعی کدنویسی ایجاد کرده است. این سامانه مقایسههای…

ادغام دادههای متیلاسیون DNA با SNPها و دادههای چند-اومیک، پژوهشگران را از شناسایی تکژنها به مدلسازی کل سیستمهای زیستی میرساند. هوش مصنوعی با اولویتبندی دادههای ابعادی…

یک بنچمارک مینیمال به نام p28-zero-diff معرفی شده است که توانایی مدلهای هوش مصنوعی در حل سادهترین اثباتهای ریاضی را میسنجد. این ابزار به جای چالشهای سخت، به عنوان یک «تست…

تحلیلی جدید نشان میدهد نویزهای سیستمی مانند گرم شدن سختافزار و زمانبندی سیستمعامل، نوسانات شدیدی در هزینههای استنتاج ایجاد میکنند. این یافته ثابت میکند مقایسههای سادهی…

AugLy چارچوبی جامع برای ایجاد اختلالات عمدی در دادههای تصویری، متنی و صوتی است تا نقاط ضعف مدلهای هوش مصنوعی شناسایی شود. این ابزار با شبیهسازی نویزهای دنیای واقعی، به…

پژوهشهای سری AIRA در متا نشان میدهد که عملکرد عاملهای هوشمند بیش از آنکه به مدل وابسته باشد، به محیط تمرین و سیاستهای جستوجو بستگی دارد. این رویکرد منجر به کسب رتبه هشتم در…

یک آزمایش روی عاملهای هوش مصنوعی نشان میدهد که سیستمهای دوتایی (قبول/رد) باعث ایجاد «تأییدهای کاذب» میشوند. افزودن وضعیت سوم یعنی «نامشخص»، شکستهای پنهان در تطبیق الگوها و…

شرکت TypeSafe AI مدل Jev را برای کالیبره کردن امتیازات اطمینان معرفی کرد تا ادعای مدل با دقت واقعی در دنیای واقعی مطابقت داشته باشد. با وجود ادعای سرعت بسیار بالا، تحلیلها نشان…

سیستمهای هوش مصنوعی صنعتی با پارادوکس «دادههای انبوه اما برچسبهای اندک» برای خطاهای نادر دستوپنجه نرم میکنند. چارچوب جدیدی با اولویتبندی زمان خبرگان از طریق یادگیری فعال،…

یک تست کور روی کاتالوگ خطاهای هوش مصنوعی نشان داد که استفاده از زبان «تشخیصی» بهجای زبان «شکایت»، دسترسی کاربران به پاسخها را مختل میکند. راهکار این مشکل، ایجاد یک لایه واسط…

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…