본문으로 건너뛰기

benchmark-fudging

벤치마크 조작

모델의 성능을 실제보다 좋게 보이게 하기 위해 평가 데이터를 선별하거나 유리한 조건에서만 테스트하는 행위이다. AI 업계의 신뢰도 문제와 직결된다.