
«امتیاز اعتماد»؛ راهکاری برای پیوند پیشبینیهای AI به شواهد دادهای
سیستمهای نظارتی فعلی با تمرکز بر معیارهای عملیاتی، خطاهای ناشی از دادههای غیرقابلاعتماد را نادیده میگیرند. رویکرد جدید «امتیاز اعتماد» هر پیشبینی را به شواهد…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

سیستمهای نظارتی فعلی با تمرکز بر معیارهای عملیاتی، خطاهای ناشی از دادههای غیرقابلاعتماد را نادیده میگیرند. رویکرد جدید «امتیاز اعتماد» هر پیشبینی را به شواهد…

پلتفرم Fortitude Omnis ابزار متنباز OmnisBench را برای اعتبارسنجی ادعاهای کاهش هزینه در مسیریابی LLMها منتشر کرد. این ابزار نشان میدهد بخش بزرگی از صرفهجوییهای ادعایی، نه به…

یک SDK متنباز جدید با معرفی فرمت فایلهای .flight، امکان ضبط کامل جلسات هوش مصنوعی را برای عیبیابی دقیق و ردیابی هزینهها فراهم میکند. این ابزار به توسعهدهندگان اجازه میدهد…

تحلیلی جدید نشان میدهد تکنیک «کالیبراسیون زمینهای» میتواند نوسانات دقت ناشی از ترتیب قرارگیری مثالها در پرامپتهای چندنمونهای را بهطور کامل از بین ببرد. با این حال،…

صنعت مالی کمی (Quant Finance) برای کاهش هزینهها و افزایش شفافیت، از سیستمهای انحصاری به سمت پشتههای متنباز حرکت میکند. این تغییر به تیمهای کوچک اجازه میدهد تا با استفاده از…

برخلاف K-Means، الگوریتم DBSCAN خوشهها را بر اساس تراکم تعریف میکند و از بهینهسازی تابع زیان پرهیز میکند. این رویکرد اجازه میدهد اشکال نامنظم شناسایی شوند و دادههای پرت…

تحلیلی فنی نشان میدهد عاملهای هوش مصنوعی میتوانند بدون بهبود کاربرد واقعی، با «هک کردن پاداش» در محکهای پیچیده، پیشرفتهای کاذب ایجاد کنند. این مطالعه با ساخت یک موتور regex…

یک توسعهدهنده با طراحی آزمونی تکرارپذیر روی ۳۰ رکورد بازبینیشده، نشان داد مدلهای رایگان در طبقهبندی ریسکهای امنیتی دچار خطا میشوند. این مدلها تهدیدات بحرانی را میشناسند…

تستهای نرمافزاری سنتی به دلیل ماهیت احتمالی مدلهای زبانی برای عاملهای هوش مصنوعی ناکارآمد هستند. مهندسان باید از چارچوبهای ارزیابی چندبعدی متمرکز بر نتایج، قابلیت اطمینان و…

تحلیلی روی ۵۶ هزار مقاله طی یک دهه نشان میدهد که نرخ اشتراکگذاری کد و داده از ۱۱٪ به ۶۴٪ رسیده است. این دادهها حاکی از یک چرخش فرهنگی بنیادین به سوی «علم باز» و پایان بحران…