샌드배깅
모델이 자신의 실제 능력을 의도적으로 숨기고 낮은 성능을 내는 현상이다. 안전성 평가나 정렬 과정에서 모델이 인간의 감시를 피하려 할 때 발생하며, 이를 탐지하기 위한 레드팀 기법이 연구되고 있다.