
تحلیل فارنزیک: ۹۷.۸٪ دادههای SWE-bench پیشتر عمومی شده بودند
یک تحلیل فارنزیک نشان میدهد تقریباً تمام فایلهای آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، بهصورت عمومی در گیتهاب در دسترس بودهاند. این یعنی مدلهای پیشرو احتمالاً…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

یک تحلیل فارنزیک نشان میدهد تقریباً تمام فایلهای آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، بهصورت عمومی در گیتهاب در دسترس بودهاند. این یعنی مدلهای پیشرو احتمالاً…

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنالهای متناقض در ارزیابیهای مدلهای زبانی معرفی کردند. این ابزار نشان میدهد بسیاری از محکهای «ایمنی» در واقع توان استدلال کلی را…

آزمونهای مدل Tsubaki.3 نشان میدهد که با افزایش تعداد پنلها در یک تصویر، جزئیات ظریف شخصیتها حذف میشوند. این یافتهها ثابت میکند که مدلهای تبدیل متن به تصویر با محدودیت…

شرکت Hugging Face کتابخانه @huggingface/kernels را شامل ۲۰۷ کرنل بهینهشده برای WebGPU منتشر کرد تا سرعت اجرای مدلهای هوش مصنوعی در مرورگر را بهشدت افزایش دهد. این سیستم با…

تفکیک سختگیرانه دادههای آموزش، اعتبارسنجی و آزمون تنها راه تضمین تعمیمپذیری مدلهای هوش مصنوعی است. بدون این مرزها، «نشت داده» باعث ایجاد موفقیتهای کاذب در آزمایشگاه میشود که…

ابزار متنباز aimock با جایگزینی پاسخهای واقعی مدلهای زبانی با فایلهای JSON، هزینههای توکن و ناپایداری API را حذف میکند. این زیرساخت به توسعهدهندگان اجازه میدهد…

ساخت مجموعه دادههای ارزیابی باکیفیت برای عاملهای هوش مصنوعی نیازمند تحلیل شکستهای واقعی انسانی است، نه تولید انبوه دادههای مصنوعی. یک مجموعه کوچک و مورد توافق از ۲۰ نمونه،…

بازبینی بصری تصاویر تولیدشده توسط هوش مصنوعی برای نرمافزارهای تجاری کافی نیست. این راهنما یک خط لوله ماشینخوان را معرفی میکند که با استفاده از OCR و تأکیدات سختگیرانه، صحت متن…

شرکت Hebbian Robotics ابزار متنباز HFlow را برای اتوماسیون کیفیت دادههای حسگرها و دوربینها معرفی کرد. این SDK با استانداردسازی خط لوله داده، مانع اصلی مقیاسپذیری هوش مصنوعی…

ابزار جدید K-Veritas با استفاده از اثباتهای رمزنگاری، نتایج مدلهای هوش مصنوعی را به کد، سختافزار و زمان اجرای واقعی متصل میکند. این سیستم با تطبیق محاسبات ادعایی با…

تنظیمات رایج مانند Temperature و Top-p در پشتههای نرمافزاری مختلف به دلیل تفاوت در ترتیب اجرا، نتایج متفاوتی تولید میکنند. این موضوع باعث ایجاد «شکست خاموش» میشود که در آن…

جایگزینی مقیاسهای عددی با برچسبهای توصیفی مانند «فاجعهبار» یا «بیضرر»، امکان شناسایی دقیق نقاط شکست مدلهای زبانی را فراهم میکند. این رویکرد به توسعهدهندگان اجازه میدهد…