내부 표현
내부 표현은 신경망의 중간층에서 생성되는 벡터와 활성화 패턴을 의미하며 입력이 계층을 통과할 때 형성되는 특징 서술자이다. 이 표현을 분석하면 모델이 어떤 개념이나 스타일을 내부적으로 인코딩했는지, 특정 입력에 민감하게 반응하는지 등을 추론할 수 있다. 논문은 출력 생성을 수행하지 않고도 이러한 내부 표현을 근거로 모델의 특화 여부를 판별하는 접근을 핵심 수단으로 삼는다.