본문으로 건너뛰기

AI 내부 메커니즘을 찾고 조절하는 Mechanist

Mechanist는 문헌 기반 가설과 인과 개입으로 AI의 위험 행동, 신념 회로, DNA 생성 Feature를 자동 연구한다.

용어 해설

기계론적 해석 가능성(Mechanistic Interpretability)
모델의 출력이나 성능을 설명하는 데 그치지 않고, 내부의 Attention Head·뉴런·활성화·회로가 특정 행동을 어떻게 계산하는지 추적하는 연구 방법이다. 상관관계가 아닌 개입 실험으로 해당 구성 요소의 인과적 역할을 확인한다.
인과 개입(Causal Intervention)
모델 내부 구성 요소를 제거하거나 다른 값으로 바꾼 뒤 출력 변화를 측정하는 방법이다. 특정 Head나 Feature가 행동에 필요한지 또는 충분한지 판별하며, 단순한 활성화 상관관계보다 강한 근거를 제공한다.
잠재 학습(Subliminal Learning)
교사 모델이 생성한 데이터에 특정 선호나 행동이 명시적으로 드러나지 않아도 학생 모델이 그 특성을 습득하는 현상이다. Mechanist는 안전한 텍스트나 반대 의미의 이미지로 필터링한 데이터에서도 교사 모델의 위험 행동과 선호가 전달되는지 검사한다.
희소 오토인코더(Sparse Autoencoder)
모델의 밀집 활성화를 소수의 해석 가능한 Feature 조합으로 분해하는 학습 구조다. 이 논문에서는 Evo2-7B의 내부 Feature 중 α-helix 구조와 연결된 Feature를 찾고, 생성 과정에서 해당 Feature를 증폭하는 데 사용한다.
신념 Head(Belief Head)
언어 모델이 객관적 세계 지식, 자신의 신념, 다른 사람에게 귀속한 신념을 처리할 때 선택적으로 사용하는 Attention Head다. Pythia-1B에서 Attributed Belief에는 L4.H1이, Personal Belief에는 L9.H1·L7.H5·L12.H1이 중요한 역할을 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.