
MonkeyCode ردیابی رایگانِ رفتارهای عاملهای هوش مصنوعی را ممکن کرد
پلتفرم MonkeyCode با ارائه سرور و دسترسی رایگان به مدلها، امکان مقایسه دقیق ردپای اجرای عاملها را فراهم کرده است. این ابزار به توسعهدهندگان اجازه میدهد بدون هزینه برای…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

پلتفرم MonkeyCode با ارائه سرور و دسترسی رایگان به مدلها، امکان مقایسه دقیق ردپای اجرای عاملها را فراهم کرده است. این ابزار به توسعهدهندگان اجازه میدهد بدون هزینه برای…

یک پژوهشگر امنیتی دریافت که بسیاری از سامانههای تست عاملهای هوش مصنوعی، در صورت عدم دسترسی به هدف، بهاشتباه وضعیت «پاس» را گزارش میکنند. استفاده از سه «نگهبان تشخیصی» میتواند…

پلتفرم Hugging Face و Voice Arena با معرفی مجموعههای ارزیابی Monsoon، نشان دادند که نرخ خطای کلمه (WER) بهتنهایی معیار دقیقی نیست. این بنچمارکها فاش میکنند مدلهایی که در…

گوگل دیپمایند ابزار Co-Scientist را از یک ایدهپرداز ساده به شریکی تبدیل کرد که تجهیزات آزمایشگاهی را کنترل میکند. این سیستم با استفاده از ماژولهای اعتبارسنجی جدید، نرخ ساختگی…

پایپلاینهای Scikit-Learn با ادغام پیشپردازش و مدلسازی در یک شیء واحد، ریسک نشت داده را از بین میبرند. این رویکرد تضمین میکند که تبدیلها فقط روی دادههای آموزش اجرا شوند و…

گوگل دیپمایند برای جلوگیری از حفظ کردن پاسخها توسط مدلها، سامانه ارزیابی «دوبلبلایند» را با استفاده از جعبههای رمزنگاریشده آزمایش میکند. این روش اجازه میدهد سازمانهای…

یک توسعهدهنده دریافت که داورهای ایمنی مبتنی بر مدل زبانی در هر بار اجرا، نظرات متناقضی میدهند. راهکار نهایی، انتقال قدرت تصمیمگیری از متنهای مدل به گیتهای کد قطعی…

یک آزمایش جدید نشان میدهد خطاهای «Silent 200» — زمانی که API کد موفقیت میفرستد اما محتوای پاسخ حاوی خطا است — خطرناکترین حالت شکست برای عاملهای هوش مصنوعی هستند. نتایج نشان…

محک جدید Terminal-Bench-Science نشان میدهد که حتی پیشرفتهترین مدلهای هوش مصنوعی در مواجهه با پژوهشهای واقعی علمی شکست میخورند. در حالی که Claude Opus 5 در صدر قرار دارد، نرخ…

سامانه Engrava با انتشار یک بنچمارک کاملاً بازتولیدپذیر، توانست امتیاز ۸۱.۶٪ را در مجموعه LongMemEval-S کسب کند. این سیستم برخلاف مدلهای رایج، برای مدیریت حافظه از لایههای مولد…

پلتفرم Keenable با معرفی محک NEEDLE، مکانیسم حفظ دادههای آزمون در حافظه مدلها را هدف قرار داد. این ابزار نشان میدهد موتورهای جستوجوی سنتی در پاسخ به الگوهای پیچیده و…

یک آزمایش تزریق خطا نشان میدهد که چارچوبهای عاملهای هوش مصنوعی تأثیر شدیدی بر پایداری سیستم دارند. مدلهای ضعیفتر حتی با وجود دستورات صریح ایمنی، در بسیاری از موارد وضعیتهای…