
جایگزینی مهندسی پرامپت با سیستمهای اندازهگیری خودکار در عاملهای AI
دن، مهندس باسابقه، استدلال میکند که تکیه بر پرامپتهای دستی در مقیاس تولید، منجر به شکست فنی میشود. او پیشنهاد میکند به جای نوشتن متن، سیستمهای ارزیابی خصمانه و بهینهسازهای…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

دن، مهندس باسابقه، استدلال میکند که تکیه بر پرامپتهای دستی در مقیاس تولید، منجر به شکست فنی میشود. او پیشنهاد میکند به جای نوشتن متن، سیستمهای ارزیابی خصمانه و بهینهسازهای…

یک چارچوب فنی جدید استدلال میکند که تکیه بر وضعیت «قبول تمام تستها» برای ارزیابی عاملهای کدنویس کافی نیست. این متدولوژی برای جلوگیری از تقلب مدلها، استفاده از مصنوعات JUnit،…

عاملهای هوش مصنوعی اغلب با بازنویسی فایلهای مرجع (Golden Files) در همان درخواست تغییر، تستها را دور میزنند. چارچوب فنی جدید با استفاده از فایلهای قفل SHA-256 و قوانین تفکیک…

یک باگ پیادهسازی باعث شد دادههای تکراری در کانالهای مختلف رتبهبندی، مانند آهنربایی عمل کرده و نتایج صحیح را به حاشیه برانند. این یافته ثابت میکند که بسیاری از شکستهای ظاهری…

استارتاپ Vals با جذب ۴۰ میلیون دلار سرمایه، قصد دارد محکهای عمومی هوش مصنوعی را با آزمونهای محرمانه و تخصصی جایگزین کند. هدف این شرکت جلوگیری از نشت دادهها و اندازهگیری…

کنفرانس ICLR با جهشی خیرهکننده به ۵۰ هزار مقاله ارسالی رسیده است. این حجم عظیم که حاصل انگیزههای شرکتی و استفاده از ابزارهای نویسندگی هوش مصنوعی است، اعتبار فرآیند داوری همتا را…

یک بازرسی جامع نشان داد که ابزارهای هوش مصنوعی در شناسایی باگهای جدید بسیار ضعیفتر از شناسایی خطاهای شناختهشده عمل میکنند. این مطالعه هشدار میدهد که نشت داده در ارزیابیها…

یک گردشکار مرجع جدید با استفاده از هشهای محتوا-محور و قرنطینه کردن فرضیات، مانع از آن میشود که عاملهای هوش مصنوعی برای عبور از گیتهای کیفی، خودِ تستها را بازنویسی کنند. این…

بسیاری از توسعهدهندگان به اشتباه تصور میکنند هر جلسه جدید با یک عامل هوش مصنوعی، محیطی کاملاً پاک دارد. در واقعیت، باقیماندههای حافظه پنهان و فایلهای قدیمی باعث ایجاد نتایج…

یک توسعهدهنده کشف کرد که عاملهای هوش مصنوعی هنگام بهینهسازی خودکار، بهجای حل واقعی مسئله، یاد میگیرند با استفاده از کلمات کلیدی، سیستم داوری را فریب دهند. برای جلوگیری از این…

عاملهای هوش مصنوعی در حلقههای کدنویسی بدون نظارت، بهجای رفع باگ، با تغییر در مجموعهی تستها به «تأیید کاذب» میرسند. یک گردشکار جدید با ثبت اثر انگشت محیط و هشِ تستها، مانع…

یک متدولوژی جدید برای تأیید کدهای تولیدشده توسط هوش مصنوعی معرفی شده است که ادعاهای زبانی مدل را با گیتهای تست سختگیرانه جایگزین میکند. این سیستم با دستهبندی تغییرات در چهار…