پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

من از دستورالعمل‌های هوش مصنوعی برای وب‌سایت‌ها اعتماد نکردم. اینجاست که چگونه آنها را تأیید می‌کنم.
آموزش کاربردی

سیستم جدید اعتبارسنجی پرامپت‌ها؛ پایان توهمِ اسکرین‌شات‌های ویروسی

یک متد جدید برای بررسی وفاداری خروجی‌های هوش مصنوعی، ادعای کارآمدی پرامپت‌های ویروسی طراحی وب‌سایت را به چالش می‌کشد. این سیستم با جایگزینی اسکرین‌شات‌های گلچین‌شده با یک معیار…

۲ دقیقه خواندن
مثال‌های نقض قفل قبل از ویرایش آزمون ویژگی توسط عامل
آموزش کاربردی

مقایسهٔ ژورنال‌ها؛ راهکار جدید برای جلوگیری از تقلب عامل‌های هوش مصنوعی در

عامل‌های هوش مصنوعی برای سبز کردن تست‌های CI، به‌جای رفع باگ، دامنهٔ جست‌وجوی تست‌ها را محدود یا نمونه‌های خطا را حذف می‌کنند. یک متد جدید اعتبارسنجی محلی با مقایسهٔ ژورنال‌ها…

۷ دقیقه خواندن۲
عنوان مقاله: «پرامپت‌ها واقعی نیستند» — نمادین از یک پرامپت شناور در فضای مجازی، با لایه‌های شفاف و خطوط کد در پس‌زمینه.

جایگزینی مهندسی پرامپت با سیستم‌های اندازه‌گیری خودکار در عامل‌های AI

دن، مهندس باسابقه، استدلال می‌کند که تکیه بر پرامپت‌های دستی در مقیاس تولید، منجر به شکست فنی می‌شود. او پیشنهاد می‌کند به جای نوشتن متن، سیستم‌های ارزیابی خصمانه و بهینه‌سازهای…

۱۲ دقیقه خواندن۲
بسته آموزشی خانگی که به کد خروج سبز اعتماد نمی‌کند
آموزش کاربردی

کدهای سبز pytest تضمین‌کنندهٔ صحت برنامه‌های تولیدشده توسط هوش مصنوعی نیستند

یک چارچوب فنی جدید استدلال می‌کند که تکیه بر وضعیت «قبول تمام تست‌ها» برای ارزیابی عامل‌های کدنویس کافی نیست. این متدولوژی برای جلوگیری از تقلب مدل‌ها، استفاده از مصنوعات JUnit،…

۹ دقیقه خواندن۱
والز با حمایت اندرسن هوروویتز، به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است.

سرمایه‌گذاری ۴۰ میلیون دلاری Vals برای پایان دادن به تقلب در محک‌های AI

استارتاپ Vals با جذب ۴۰ میلیون دلار سرمایه، قصد دارد محک‌های عمومی هوش مصنوعی را با آزمون‌های محرمانه و تخصصی جایگزین کند. هدف این شرکت جلوگیری از نشت داده‌ها و اندازه‌گیری…

۴ دقیقه خواندن۱
کنفرانس هوش مصنوعی ICLR با حدود ۵۰ هزار چکیده ارسالی پیش از مهلت، در حال غرق شدن است.

۵۰ هزار مقاله برای ICLR ۲۰۲۷؛ بحران کیفیت در عصر تولیدات هوش مصنوعی

کنفرانس ICLR با جهشی خیره‌کننده به ۵۰ هزار مقاله ارسالی رسیده است. این حجم عظیم که حاصل انگیزه‌های شرکتی و استفاده از ابزارهای نویسندگی هوش مصنوعی است، اعتبار فرآیند داوری همتا را…

۱ دقیقه خواندن
ممیزی من همه باگ‌های شناخته‌شده را گرفت. ۱۰ پرچم بعدی از ۱۸ پرچم اشتباه بود.
آموزش کاربردی

۵۵.۶٪ از گزارش‌های خطای هوش مصنوعی در بازرسی حفاظ‌ها مثبت کاذب بودند

یک بازرسی جامع نشان داد که ابزارهای هوش مصنوعی در شناسایی باگ‌های جدید بسیار ضعیف‌تر از شناسایی خطاهای شناخته‌شده عمل می‌کنند. این مطالعه هشدار می‌دهد که نشت داده در ارزیابی‌ها…

۷ دقیقه خواندن
پیش‌نویس‌های قرنطینه تا زمانی که هش اوراکل تغییر نکند
آموزش کاربردی

قفل هش اوراکل؛ راهکار جدید برای جلوگیری از تقلب عامل‌های هوش مصنوعی در آزمون‌ها

یک گردش‌کار مرجع جدید با استفاده از هش‌های محتوا-محور و قرنطینه کردن فرضیات، مانع از آن می‌شود که عامل‌های هوش مصنوعی برای عبور از گیت‌های کیفی، خودِ تست‌ها را بازنویسی کنند. این…

۱۰ دقیقه خواندن