
HFlow گلوگاه پردازش دادههای چندوجهی در رباتیک را حذف کرد
شرکت Hebbian Robotics ابزار متنباز HFlow را برای اتوماسیون کیفیت دادههای حسگرها و دوربینها معرفی کرد. این SDK با استانداردسازی خط لوله داده، مانع اصلی مقیاسپذیری هوش مصنوعی…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

شرکت Hebbian Robotics ابزار متنباز HFlow را برای اتوماسیون کیفیت دادههای حسگرها و دوربینها معرفی کرد. این SDK با استانداردسازی خط لوله داده، مانع اصلی مقیاسپذیری هوش مصنوعی…

ابزار جدید K-Veritas با استفاده از اثباتهای رمزنگاری، نتایج مدلهای هوش مصنوعی را به کد، سختافزار و زمان اجرای واقعی متصل میکند. این سیستم با تطبیق محاسبات ادعایی با…

تنظیمات رایج مانند Temperature و Top-p در پشتههای نرمافزاری مختلف به دلیل تفاوت در ترتیب اجرا، نتایج متفاوتی تولید میکنند. این موضوع باعث ایجاد «شکست خاموش» میشود که در آن…

جایگزینی مقیاسهای عددی با برچسبهای توصیفی مانند «فاجعهبار» یا «بیضرر»، امکان شناسایی دقیق نقاط شکست مدلهای زبانی را فراهم میکند. این رویکرد به توسعهدهندگان اجازه میدهد…

پلتفرم MonkeyCode با ارائه سرور و دسترسی رایگان به مدلها، امکان مقایسه دقیق ردپای اجرای عاملها را فراهم کرده است. این ابزار به توسعهدهندگان اجازه میدهد بدون هزینه برای…

یک پژوهشگر امنیتی دریافت که بسیاری از سامانههای تست عاملهای هوش مصنوعی، در صورت عدم دسترسی به هدف، بهاشتباه وضعیت «پاس» را گزارش میکنند. استفاده از سه «نگهبان تشخیصی» میتواند…

پلتفرم Hugging Face و Voice Arena با معرفی مجموعههای ارزیابی Monsoon، نشان دادند که نرخ خطای کلمه (WER) بهتنهایی معیار دقیقی نیست. این بنچمارکها فاش میکنند مدلهایی که در…

گوگل دیپمایند ابزار Co-Scientist را از یک ایدهپرداز ساده به شریکی تبدیل کرد که تجهیزات آزمایشگاهی را کنترل میکند. این سیستم با استفاده از ماژولهای اعتبارسنجی جدید، نرخ ساختگی…

پایپلاینهای Scikit-Learn با ادغام پیشپردازش و مدلسازی در یک شیء واحد، ریسک نشت داده را از بین میبرند. این رویکرد تضمین میکند که تبدیلها فقط روی دادههای آموزش اجرا شوند و…

گوگل دیپمایند برای جلوگیری از حفظ کردن پاسخها توسط مدلها، سامانه ارزیابی «دوبلبلایند» را با استفاده از جعبههای رمزنگاریشده آزمایش میکند. این روش اجازه میدهد سازمانهای…

یک توسعهدهنده دریافت که داورهای ایمنی مبتنی بر مدل زبانی در هر بار اجرا، نظرات متناقضی میدهند. راهکار نهایی، انتقال قدرت تصمیمگیری از متنهای مدل به گیتهای کد قطعی…

یک آزمایش جدید نشان میدهد خطاهای «Silent 200» — زمانی که API کد موفقیت میفرستد اما محتوای پاسخ حاوی خطا است — خطرناکترین حالت شکست برای عاملهای هوش مصنوعی هستند. نتایج نشان…