본문으로 건너뛰기
HF Daily Papers조회 1

실리콘 속의 친구와 할머니: 언어 모델 내 엔티티 셀의 위치 특정

언어 모델이 방대한 지식을 어떻게 저장하고 꺼내 쓰는지에 대한 근본적인 메커니즘을 규명했다. 특정 엔티티에만 반응하는 '엔티티 셀'을 찾아내어 이를 억제하거나 활성화함으로써 모델의 지식을 정밀하게 제어할 수 있는 새로운 경로를 제시한다.

용어 해설

기계적 해석 가능성(Mechanistic Interpretability)
딥러닝 모델의 내부 가중치와 활성화 패턴을 분석하여 모델이 특정 작업을 수행하는 구체적인 알고리즘적 원리를 역공학적으로 이해하려는 연구 분야이다. 모델을 블랙박스로 두지 않고 개별 뉴런이나 회로 단위의 기능을 규명하는 것이 핵심이다.
MLP 뉴런(MLP Neuron)
Transformer 아키텍처의 Feed-Forward Network(FFN) 계층 내부에 존재하는 개별 연산 단위이다. 특정 입력 패턴을 감지하는 벡터(Key)와 그에 대응하는 출력 벡터(Value)의 쌍으로 작동하며, 모델 내에서 지식을 저장하고 인출하는 메모리 역할을 수행한다.
인과적 개입(Causal Intervention)
모델의 특정 내부 변수(활성값 등)를 강제로 수정하여 출력 결과의 변화를 관찰함으로써, 해당 변수와 모델 동작 사이의 직접적인 인과 관계를 증명하는 실험 기법이다. 단순한 상관관계를 넘어 특정 뉴런이 특정 지식 인출에 필수적인지 확인하는 데 사용된다.
할머니 세포(Grandmother Cell)
신경과학에서 제안된 가설로, 특정 인물이나 개념(예: 자신의 할머니)을 인식할 때만 반응하는 단 하나의 전용 뉴런이 존재한다는 이론이다. 인공지능 분야에서는 모델 내부에 특정 엔티티에만 반응하는 희소한 뉴런이 존재하는지를 탐구하는 비유로 사용된다.

코드 예제

python
def compute_stability_score(activations, epsilon=1e-6):
    # activations: (K, L, J) tensor of standardized activations
    mean_act = activations.mean(dim=0)
    std_act = activations.std(dim=0)
    
    # S_lj = (E[z])^2 / (Std[z] + epsilon)
    stability_score = (mean_act ** 2) / (std_act + epsilon)
    return stability_score

엔티티에 대한 여러 프롬프트에서 뉴런 활성화의 안정성을 계산하여 엔티티 셀 후보를 찾는 로직

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 01.수집 2026. 04. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.