TL;DR
ModelMRI는 로컬에서 실행 중인 LLM, VLM, robot policy와 agent trace를 한 화면에서 조사하는 Chrome DevTools 형태의 MIT 라이선스 도구입니다. Attention arc를 그리는 데서 멈추지 않고 head 제거에 따른 KL 변화, Activation Patching의 층×위치별 정답 복원, SAE feature steering, robot-camera patch attention을 측정하며, 근거가 약하거나 비교가 성립하지 않는 경우 결과를 거부합니다. Qwen3-1.7B에서는 L0 H3 제거로 `p(" Paris")`가 0.539에서 0.029로 떨어졌고, PushT frame에서는 top 5% patch attention mass가 vision layer 0의 27%에서 layer 11의 60%로 증가했습니다. 분석 결과는 weight 없는 `.mri` 파일로 공유할 수 있으며, `verify`, `sweep`, `diff` 명령으로 재현성·분산·양자화 전후 변화를 확인할 수 있지만 alpha 단계의 debugging·research 도구로 분류됩니다.
섹션별 상세
pip install modelmri && modelmri serve # → http://localhost:5900ModelMRI를 설치한 뒤 localhost의 웹 애플리케이션을 실행합니다.






from modelmri.record import trace, step
with trace("fix-failing-tests"):
step("llm_call", name="plan", input=prompt, output=answer, tokens_in=912)
with step("subagent", name="auth-fixer"):
step("tool_call", name="pytest", output="17 passed")LLM 호출과 도구 호출을 중첩된 단계로 기록해 agent 실행 타임라인을 만듭니다.
용어 해설
- 활성값 패칭(Activation Patching)
- — 한 입력에서 얻은 중간 활성값을 다른 입력의 같은 위치에 주입해 모델의 예측 차이가 어느 층과 토큰 위치에서 복원되는지 측정하는 기법입니다. ModelMRI는 층×위치별 결과를 계산하고 같은 노름의 무작위 값과 비교해 우연한 복원을 구분합니다.
- 인과적 제거(Causal Ablation)
- — 모델 내부 구성 요소를 제거하거나 대체한 뒤 원래 실행과 출력이 얼마나 달라지는지 측정하는 방법입니다. ModelMRI는 특정 attention head를 0으로 만들고 다시 추론해 KL divergence와 정답 토큰 확률의 변화를 계산함으로써 예측에 실제로 기여한 head를 순위화합니다.
- 희소 오토인코더(Sparse Autoencoder)
- — 신경망의 다차원 활성값을 소수의 해석 가능한 feature 조합으로 재구성하도록 학습한 모델입니다. ModelMRI는 모델과 SAE의 활성값 규약이 실제로 복원되는지 확인한 뒤 feature를 끄거나 조절해 특정 개념이 출력에 미치는 변화를 비교합니다.
- Logit Lens
- — Transformer의 각 중간 층 표현을 최종 출력층에 통과시켜 해당 시점의 토큰 예측을 추정하는 분석 기법입니다. SAE가 없는 모델에서도 사용할 수 있어 중간 표현이 어떤 토큰을 선호하는지 층별로 확인하는 대안으로 쓰입니다.
- Eager Attention
- — attention 가중치를 실제 행렬로 계산하고 보존하는 실행 방식입니다. SDPA나 FlashAttention은 가중치를 메모리에 materialize하지 않기 때문에 ModelMRI가 attention을 시각화하려면 `attn_implementation="eager"`를 사용해야 하며, 그 대신 실행 속도가 느려집니다.
기술
- ModelMRI
- Python
- PyTorch
- TorchScript
- GGUF
- HuggingFace
- Ollama
- WebGL
- TransformerLens
- BertViz
- nnsight
- Neuronpedia
- SAELens
- Langfuse
- Phoenix
- LangSmith
- promptfoo
- Rerun
- Foxglove
- SmolVLA
- LeRobot
- SDPA
- FlashAttention
- safetensors
활용 사례
- 실행 중인 local LLM의 token별 attention과 head 중요도 조사
- Activation Patching으로 사실 정보가 저장되고 전달되는 층과 위치 측정
- SAE feature를 끄거나 조절해 특정 개념이 출력에 미치는 변화 확인
- 실패한 agent 단계의 LLM·tool·subagent 호출 추적
- SmolVLA가 robot-camera frame에서 주목한 image patch 분석
- 직접 학습한 nn.Module의 layer별 activation 통계와 dead unit, saturation, NaN 확인
- `.mri` 파일로 모델 내부 분석 결과를 weight 없이 동료와 공유
- 양자화 전후 head ranking과 patching 결과를 CI에서 비교
- 모델 checkpoint의 load-time 악성 실행 payload 검사
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
