
تلهٔ توافق در بنچمارکها؛ چرا مدلهای کدنویس لایههای پنهان خطا را نمیبینند؟
ارزیابی فنی سه دستیار کدنویسی هوش مصنوعی نشان میدهد که چکلیستهای سنتی، «توافق با انسان» را با «دقت فنی» اشتباه میگیرند. با معرفی بازبینی مستقل برای یافتههای پیشبینینشده،…










