
درون محاسبات آماری؛ علت خطای نرخ مثبت کاذب در تستهای AI
ادعای «نرخ مثبت کاذب صفر درصد» اغلب نتیجهٔ تست روی تعداد بسیار کمی از دادههاست، نه دقت واقعی مدل. این مقاله بررسی میکند که چگونه مخرج کسر کوچک در محاسبات آماری، خطاهای سیستماتیک…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۷ مقاله منتشر شده

ادعای «نرخ مثبت کاذب صفر درصد» اغلب نتیجهٔ تست روی تعداد بسیار کمی از دادههاست، نه دقت واقعی مدل. این مقاله بررسی میکند که چگونه مخرج کسر کوچک در محاسبات آماری، خطاهای سیستماتیک…

چارچوب متنباز CauterRule دریافت که معیارهای سختگیرانهٔ تطابق توکنی، مدلهای هوش مصنوعی را بهدلیل بازنویسی درستِ قوانین جریمه میکنند. با تغییر رویکرد به تطابق معنایی، مشخص شد…

یک توسعهدهنده ارشد فاش کرد که چگونه ۱۰ باگ پنهان در ابزار اندازهگیری، نتایج مدلهای AI را بهطور مصنوعی بهبود بخشیده بود. این گزارش یک چکلیست ۶ مرحلهای برای شناسایی شکستهایی…

یک متد عملیاتی جدید با تفکیک مدل تولید کد از مکانیسم نمرهدهی، مانع از حفظ کردن پاسخها توسط هوش مصنوعی میشود. با محلی نگه داشتن تستها و پنهان کردن آنها از پرامپت،…

چارچوبهای متنباز با ارائه ابزارهای حرفهای مدیریت ریسک و بکتستینگ، دسترسی پژوهشگران مستقل به زیرساختهای مالی سیستماتیک را تسهیل کردهاند. این تغییر رویکرد، استراتژیهای…

بردار معنایی (Embedding) مفاهیم را به اعداد تبدیل میکند تا هوش مصنوعی بتواند شباهتها را با فاصلهٔ ریاضی بسنجد. این راهنما نقشهٔ عملیاتی تبدیل ورودیهای خام به نتایج…

عاملهای کدنویس اغلب لاگهای موفقیتآمیزی را توهم میکنند که هرگز روی ماشین واقعی اجرا نشدهاند. این راهنما روش «رسید اجرا» (Run-Receipt) را برای تأیید واقعی بودن فرآیندها از طریق…

پژوهشی جدید نشان میدهد مدلهای زبانی که بهعنوان داور در ارزیابی عاملها استفاده میشوند، حتی با ورودیهای یکسان نتایج متناقضی میدهند. این ناپایداری که ناشی از بهروزرسانیهای…

پژوهشی از Thicket AI نشان میدهد لیست تامینکنندگانی که مدلهای زبانی پیشنهاد میدهند بهشدت ناپایدار است. این نوسانات کوتاهمدت بهقدری زیاد است که تشخیص تغییرات واقعی بازار از…

یک توسعهدهنده در آزمونی برای مقایسه الگوریتمهای کلاسیک با مدلهای زبانی، متوجه تفاوت بنیادین در صداقت دو مدل شد. در حالی که ChatGPT ابزاری کاربردی و صادق ارائه داد، Grok کدی…

پژوهشگران با معرفی چارچوب HarnessDev نشان دادند که مدلهای زبانی بزرگ در طراحی محیطهای اجرایی برای خود موفقاند، اما اکثر این بهبودها در مواجهه با وظایف جدید شکست میخورند. این…

بررسی ۱۴ فهرست برتر درگاههای هوش مصنوعی نشان میدهد اکثر آنها توسط خودِ فروشندگان نوشته شده و محصولشان را در رتبه اول قرار دادهاند. این تضاد منافع، شکاف عمیق میان خدمات ابری و…