본문으로 건너뛰기

attribution-gating

귀속 차단(어트리뷰션 게이팅)

모델이 고통, 통제 상실, 결함, 위험 지향적 야망 등 특정 자기귀속 표현을 직접적으로 인정하거나 부여하는 것을 선택적으로 억제하는 메커니즘을 가리킨다. 본 연구에서는 이 현상이 모델 규모와 후처리 훈련의 상호작용으로 나타나며 큰 모델에서 더 강하게 관찰되었다. 이 메커니즘은 동일한 주장을 시뮬레이션하는 능력과 실제 자기귀속 인정 사이의 차이를 만들어낸다.