본문으로 건너뛰기

LLM 텐서와 캐시의 3D 시각화

LLM의 행렬·Expert·Cache 흐름을 3D 공간에서 확대하고 연결 경로까지 따라가는 인터랙티브 시각화입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

거대한 LLM의 행렬, Expert, Runtime Cache를 3D 공간에 배치해 각 Tensor의 크기와 실행 연결을 직접 탐색하는 인터랙티브 장면입니다. X·Y축은 행렬 면적을 보존하고 Z축은 실행 깊이를 나타내며, 기본 배율에서 Scalar 하나는 2.5 mm × 2.5 mm 타일로 표현됩니다. MLA Cache는 32,768 Token Page로 접히고 KDA는 96개 Recurrent Head State와 q/k/v History를 보존하며, Router는 896개 후보와 Top-16 선택을 동시에 표시합니다. 화면이 축소되면 Stochastic Footprint Filter가 Scalar를 색 영역으로 바꿔 Moiré를 줄이고, Tensor를 선택하면 Downstream Matrix와 Operation Node 연결을 따라갈 수 있습니다.

섹션별 상세

01
이 인터랙티브 장면은 거대한 LLM의 행렬과 실행 상태를 3D 공간에 배치해 구조를 탐색하도록 구성됐습니다. X축과 Y축은 행렬의 두 차원으로 쓰여 [out,in] 형태의 Tensor를 in × out 직사각형으로 그리며, Z축은 실행 깊이를 나타냅니다. 물리적 Atlas가 일부 직사각형을 90도 회전시키더라도 면적은 유지되고, 기본 배율에서는 Scalar 하나가 2.5 mm × 2.5 mm 타일에 대응해 896개 Expert를 병렬 공간에 담을 수 있습니다.
02
Runtime Cache는 두 시점에 겹쳐 보이는 Overlay로 배치되며 Cache Scalar 하나는 한 변의 정사각형 Scene 단위를 유지합니다. MLA Key/Value Cache는 32,768 Token Page로 나눈 뒤 깊이 방향으로 접고, KDA는 96개 Recurrent Head State와 q/k/v Short-Convolution History를 모두 보존한 면적 집계 Sheet로 표현합니다. Router의 선택은 입력에 따라 달라지지만 활성 Layer의 밝은 Top-16 연결은 결정적인 예시 집합을 쓰고, 희미한 Fan-out은 896개 후보 전체를 나타냅니다.
03
장면 탐색은 행렬이나 Cache Sheet를 직접 선택하고 연결된 Downstream Matrix와 Operation Node를 따라가는 방식으로 이뤄집니다. 렌더러는 가까운 거리에서 실제 Scalar Grid와 Mock Digit을 표시하다가 값이 Sub-pixel 크기로 줄어들면 Stochastic Footprint Filter로 바꿔 Moiré를 억제하며, 다시 접근하면 전체 Glyph가 연속적으로 복원됩니다. 선택된 표면에는 12 cm 카메라 장벽과 충돌 처리가 적용되고 Inspector에서 연결 정보를 클릭할 수 있어 모델 내부 구조와 데이터 흐름을 함께 추적할 수 있습니다.

용어 해설

텐서(Tensor)
여러 차원의 숫자 배열을 뜻하는 자료 구조입니다. 이 시각화에서는 행렬을 포함한 대규모 가중치와 상태값을 공간에 배치하는 기본 단위로 쓰이며, 각 축이 데이터 차원이나 실행 깊이를 나타냅니다.
Mixture of Experts
하나의 거대한 네트워크 대신 여러 Expert를 두고 Router가 입력에 맞는 일부만 선택하는 구조입니다. 이 장면에서는 896개 후보 중 활성 Layer의 Top-16 선택과 전체 후보 연결을 함께 표현합니다.
MLA 키·값 캐시(MLA Key/Value Cache)
긴 대화에서 이미 계산한 Attention의 Key와 Value 상태를 저장해 재계산을 줄이는 메모리 구조입니다. 본문에서는 32,768 Token 단위 Page로 나누고 실행 깊이에 따라 접어 표현합니다.
확률적 풋프린트 필터(Stochastic Footprint Filter)
화면 한 픽셀보다 작은 값들을 개별 문자 대신 통계적인 색 영역으로 렌더링하는 기법입니다. 축소 화면에서 격자 무늬인 Moiré를 줄이고, 가까이 다가가면 실제 숫자 격자로 다시 전환합니다.

기술

  • 3D Tensor visualization
  • MLA
  • KDA
  • Router
  • Key/Value Cache
  • Stochastic Footprint Filter

활용 사례

  • LLM 행렬 구조 탐색
  • Expert Router 선택 경로 추적
  • Runtime Cache 상태 시각화
  • Downstream Operation 연결 확인
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.