왜 중요한가
Transformer의 hidden state를 읽고 해석하기 위한 학습 기반 도구의 비용을 낮출 수 있음을 보여준다. 표준 basis만으로도 의미를 읽을 수 있으며, 언어/비전/오디오 등 다양한 모달리티에서 공통의 읽기 패턴이 관찰된다. 이는 해석 가능성 연구의 새로운 방향을 제시하고, 시스템적 안전성 모니터링에 실용적인 영향을 준다.
핵심 기여
Per-dim sign patterns as independent binary registers
각 차원은 부호(+1/-1)로 의미를 담고, 크기(|value|)로 확신도를 나타내는 독립적인 이진 레지스터로 기능하며, 부호 패턴의 부분집합이 특정 의미를 형성해 학습 없이 읽을 수 있다.
Zero-training feature discovery
타입-레벨 캐시를 통해 단일 토큰 입력만으로 175개 카테고리의 특징을 무훈련으로 발견할 수 있으며, unsupervised 설정에서도 1500개 특징을 100% 수율로 발견한다.
Prototype-based category detection across modalities
타입 레벨 프로토타입을 구성해 언어, 비전, 오디오에서 175개 카테고리를 검출하며, 컨텍스트에서도 유형 아이덴티티를 안정적으로 읽어낸다.
FFN neuron coalitions write axis-aligned patterns
FFN의 down-proj 가중치가 축-정렬된 부호 패턴을 기록하고, 다수의 뉴런 coalition이 majority voting으로 프로토타입 패턴을 재구성한다. writes는 학습에 의해 형성된다.
K/V projections preserve axis-aligned structure
K/V 투영에서도 per-dim 읽기가 axis-aligned 구조를 보존하여 다양한 모달리티의 모델에서 동일한 구조를 확인할 수 있다.
Cross-modality universality of sign-based reading
DINOv2, ViT-Base, AST 등 언어 이외의 모달리티에서도 per-dim sign 구조가 나타나며, 감독 여부에 관계없이 일반적으로 관찰된다.
핵심 아이디어 이해하기
각 차원은 독립적으로 정보를 담고 있으며, 부호 패턴의 부분집합으로 특정 카테고리의 의미를 읽을 수 있다. 훈련 없이도 타입-레벨 캐시를 이용해 신속하게 프로토타입을 구성하고, 카테고리 판독은 부호 일치의 다중 차원 투표로 수행된다. K/V 프로젝션과 FFN writes가 이 읽기-쓰기를 지원하는 전체 회로를 형성하며, 여러 모달리티에서도 같은 구조가 나타난다.
관련 Figure

다수 차원의 envelope가 프롬프트에 관계없이 존재함을 시각적으로 보여주며 population-level 구조가 입력 내용에 종속적이지 않음을 시사한다.
Figure 1은 20개의 프롬프트를 겹쳐 표시하고 2560차원의 잔류 상태를 프롬프트 색상으로 구분해 나타낸다.

학습이 lattice의 pinching, 비대칭 밴딩, 밀도 비대칭 등을 형성하고 random-init는 대칭적이고 밀도가 낮아 내부 구조가 나타나지 않음을 시사한다.
Figure 2는 Trained vs Random Init를 언어/비전/오디오에서 비교한 패널을 보여준다.

차원 간 상관은 미미하고, 차원별 읽기가 가능하다는 핵심 주장을 시각적으로 보강한다.
Figure 3은 개별 차원 궤적을 보여주며 각 차원이 독립적으로 움직임을 보인다.
방법론
- 타입-레벨 캐시를 생성하기 위해 어휘 전체를 단일 토큰 입력으로 모델에 전달하고 layer별 hidden state를 저장한다. 2) 각 차원에 대해 직관적 AUC를 사용해 카테고리 구분력을 평가하고, 임계값 τ=0.75를 초과하는 차원을 Dc로 등록한다. 3) Dc에 대해 polarity를 기록하고, 새로운 토큰의 부호 일치를 통해 점수를 산출한다. 4) K/V 프로젝션에서도 동일한 절차를 적용해 axis-aligned 구조를 검증한다. 5) FFN 작동을 확인하기 위해 노드 단위 및 코얼리션 수준의 매개변수-활동 연결을 분석한다.
관련 Figure

앵커 토큰 → 타입-레벨 캐시 → Per-Dim AUC → Feature Registry → 카테고리 점수의 흐름을 명확히 한다.
Figure 4는 Bag-of-Dims 발견 및 스코어링 파이프라인을 다이어그램으로 제시한다.
주요 결과
Sign-only 읽기( magnitudes=1)로도 Top-5 정확도 60–93%, 800차원-가장 큰 차원에서더 높은 정확도 달성. 175 카테고리의 prototypes를 통한 AUC 0.80–0.99 범위, 컨텍스트 일반화 0.72–0.77의 폴링. K/V 프로젝션에서도 axis-aligned 구조 유지. FFN 뉴런군의 majority-vote writes가 0.70±의 프로토타입 정합을 달성. Cross-modality 실험에서 DINOv2, ViT-Base, AST 모두 비슷한 패턴 보임.
관련 Figure

층이 증가함에 따라 특징 밀도가 증가하고 최적 레이어를 확인하는데 도움을 준다.
Figure 5는 Layer별 카테고리 separability를 보여주며 h24에서 최적 구간을 보인다.
기술 상세
본 연구는 Transformer의 residual stream에서 차원별 부호와 크기로 정보를 표현하는 것을 전제로 한다. D 차원에서 부호는 content를, magnitude는 confidence를 표현하는 독립 채널로 취급한다. 각 카테고리는 선언적 프로토타입 Dc와 polarity π를 구성하며, 토큰의 부호 일치 비율로 분류 점수를 얻는다. K/V 프로젝션은 동일한 디코딩 규칙으로 읽히며, FFN의 down-proj 열은 프로토타입과의 부호 매칭으로 특정 차원을 쓰는 뉴런 군 coalition을 형성한다. 실험적으로 4개 모델(Language: Qwen 3.5-4B, Gemma 3-4B, Mistral 7B, Qwen3-32B; Vision: DINOv2-Base, ViT-Base; Audio: AST)에서 MI가 0.006 bits 이하로 낮고, cross-dim capacity가 불필요하다는 것을 확인한다.
한계점
Limitations 포함: 스케일 확장에서의 지속성은 70B+에서도 확신하기 어려움, Qwen3-32B의 D/V 비율이 낮은 모델에서 컨텍스트 읽기가 약함, Layer 간 좌표계가 레이어별로 다르므로 layer별 스윕이 필요함, 175개 카테고리는 전체 특징의 일부분일 수 있음.
실무 활용
표준 basis를 이용한 학습-제약 없는 특징 읽기가 가능해져 해석 도구의 비용을 줄이고, 실시간 안전성 모니터링과 디버깅에 활용할 수 있다.
- 실시간 모델 해석 및 안전성 모니터링 도구로 프로브 없이 per-dim 특징 판독
- 모델 디버깅 및 원인 파악에 대한 빠른 시각화
- 다중 모달 모델 간 공통 읽기 패턴 비교 및 진단
- 회로 수준의 개념 추적 및 규제 준수 확인
코드 공개 여부: 미확인
키워드
용어 해설
- 부호 패턴(Sign Patterns)
- — 차원별 부호(+1/-1)와 크기(|value|)로 정보를 저장하는 독립 이진 레지스터들의 조합으로, 특정 의미를 구성하는 차원 집합의 부호 정합을 통해 읽힌다.
- 표준 기저(Standard Basis)
- — 차원 공간의 기본 축으로 구성된 좌표계에서, 개별 차원은 독립적으로 의미를 담고 있으며 회전 없이 부호 일치를 통해 특징을 읽을 수 있다.
- 가방-오브-디엠스(Bag-of-Dims)
- — 숨겨진 상태를 독립적인 binary 레지스터들의 모음으로 간주하는 프레임워크. 차원은 부호로 내용, 크기로 확신도를 전달한다.
- FFN writer 뉴런(FFN writer neurons)
- — FFN의 down-proj 가중치 열이 특정 프로토타입 차원에 축을 맞춘 부호 패턴을 기록하는 뉴런들; 다수의 뉴런 coalition이 패턴을 합의하여 residual에 저장한다.
- K/V 프로젝션(K/V projections)
- — attention의 K/V 투영에서 각 차원의 부호 패턴이 axis-aligned 구조를 유지하도록 하는 변환들; 잔류 스트림에서의 읽기/읽은 패턴의 전파를 담당한다.
- 무훈련 발견(Zero-training discovery)
- — 라벨 없이도 단일 토큰 캐시를 이용해 175개 이상의 카테고리를 디스커버하는 방법으로, 특정 학습 없이 특징이 식별된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.