용어 해설
- 기계론적 해석 가능성(Mechanistic Interpretability)
- — 모델의 출력이나 성능을 설명하는 데 그치지 않고, 내부의 Attention Head·뉴런·활성화·회로가 특정 행동을 어떻게 계산하는지 추적하는 연구 방법이다. 상관관계가 아닌 개입 실험으로 해당 구성 요소의 인과적 역할을 확인한다.
- 인과 개입(Causal Intervention)
- — 모델 내부 구성 요소를 제거하거나 다른 값으로 바꾼 뒤 출력 변화를 측정하는 방법이다. 특정 Head나 Feature가 행동에 필요한지 또는 충분한지 판별하며, 단순한 활성화 상관관계보다 강한 근거를 제공한다.
- 잠재 학습(Subliminal Learning)
- — 교사 모델이 생성한 데이터에 특정 선호나 행동이 명시적으로 드러나지 않아도 학생 모델이 그 특성을 습득하는 현상이다. Mechanist는 안전한 텍스트나 반대 의미의 이미지로 필터링한 데이터에서도 교사 모델의 위험 행동과 선호가 전달되는지 검사한다.
- 희소 오토인코더(Sparse Autoencoder)
- — 모델의 밀집 활성화를 소수의 해석 가능한 Feature 조합으로 분해하는 학습 구조다. 이 논문에서는 Evo2-7B의 내부 Feature 중 α-helix 구조와 연결된 Feature를 찾고, 생성 과정에서 해당 Feature를 증폭하는 데 사용한다.
- 신념 Head(Belief Head)
- — 언어 모델이 객관적 세계 지식, 자신의 신념, 다른 사람에게 귀속한 신념을 처리할 때 선택적으로 사용하는 Attention Head다. Pythia-1B에서 Attributed Belief에는 L4.H1이, Personal Belief에는 L9.H1·L7.H5·L12.H1이 중요한 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







