TL;DR
거대한 LLM의 행렬, Expert, Runtime Cache를 3D 공간에 배치해 각 Tensor의 크기와 실행 연결을 직접 탐색하는 인터랙티브 장면입니다. X·Y축은 행렬 면적을 보존하고 Z축은 실행 깊이를 나타내며, 기본 배율에서 Scalar 하나는 2.5 mm × 2.5 mm 타일로 표현됩니다. MLA Cache는 32,768 Token Page로 접히고 KDA는 96개 Recurrent Head State와 q/k/v History를 보존하며, Router는 896개 후보와 Top-16 선택을 동시에 표시합니다. 화면이 축소되면 Stochastic Footprint Filter가 Scalar를 색 영역으로 바꿔 Moiré를 줄이고, Tensor를 선택하면 Downstream Matrix와 Operation Node 연결을 따라갈 수 있습니다.
섹션별 상세
용어 해설
- 텐서(Tensor)
- — 여러 차원의 숫자 배열을 뜻하는 자료 구조입니다. 이 시각화에서는 행렬을 포함한 대규모 가중치와 상태값을 공간에 배치하는 기본 단위로 쓰이며, 각 축이 데이터 차원이나 실행 깊이를 나타냅니다.
- Mixture of Experts
- — 하나의 거대한 네트워크 대신 여러 Expert를 두고 Router가 입력에 맞는 일부만 선택하는 구조입니다. 이 장면에서는 896개 후보 중 활성 Layer의 Top-16 선택과 전체 후보 연결을 함께 표현합니다.
- MLA 키·값 캐시(MLA Key/Value Cache)
- — 긴 대화에서 이미 계산한 Attention의 Key와 Value 상태를 저장해 재계산을 줄이는 메모리 구조입니다. 본문에서는 32,768 Token 단위 Page로 나누고 실행 깊이에 따라 접어 표현합니다.
- 확률적 풋프린트 필터(Stochastic Footprint Filter)
- — 화면 한 픽셀보다 작은 값들을 개별 문자 대신 통계적인 색 영역으로 렌더링하는 기법입니다. 축소 화면에서 격자 무늬인 Moiré를 줄이고, 가까이 다가가면 실제 숫자 격자로 다시 전환합니다.
기술
- 3D Tensor visualization
- MLA
- KDA
- Router
- Key/Value Cache
- Stochastic Footprint Filter
활용 사례
- LLM 행렬 구조 탐색
- Expert Router 선택 경로 추적
- Runtime Cache 상태 시각화
- Downstream Operation 연결 확인
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

