TL;DR
작성자는 18,304 파라미터, d_model 32, 2층 4헤드인 decoder-only transformer를 10×10 곱셈표만으로 학습시켰다. 접두사 '7' 다음에 '*'를 99.99%로 예측하고 '7*' 다음에는 0부터9까지 숫자를 대략 10%씩 균등하게 배분하는 출력이 관찰되어 모델의 확률이 데이터 빈도와 일치함이 확인됐다. 모델이 충분히 작아 학습 중 전체 텐서와 개별 가중치 행렬을 인터랙티브하게 관찰하면서 입력→연산→출력의 메커니즘을 직접 추적할 수 있었다.
섹션별 상세
이미지 분석

이미지에는 층별로 세로로 늘어선 가중치 매트릭스와 중앙의 입력-출력 연결을 나타내는 라인이 포함되어 있어 모델 내부 연산 경로를 시각적으로 추적할 수 있었다. 실험 설명과 일치하게 사용자는 접두사를 입력하면 softmax 출력을 갱신하는 과정과 동시에 특정 텐서의 실제 값 변화를 관찰하는 흐름을 따를 수 있었다. 이런 시각화는 입력→선형/attention 연산→softmax 출력으로 이어지는 처리 파이프라인과 그에 따른 가중치 조정 메커니즘을 직관적으로 파악하는 데 유용함이 확인됐다.
이미지는 'TRANSFORMER MATRIX FLOW'라는 제목과 함께 Layer 1의 가중치 패널을 보여주는 스크린샷 형태의 시각화였다. 이 시각화는 작은 모델의 전체 텐서와 개별 가중치 행렬을 한 화면에서 확인할 수 있음을 시사했다. 작성자는 인터랙티브하게 접두사를 입력하고 분포를 관찰하며 텐서 이름을 클릭해 가중치 행렬을 열람했다고 기술했다.
용어 해설
- 디코더 전용 Transformer(decoder-only transformer)
- — 디코더 전용 Transformer는 입력 시퀀스의 좌측부터 차례로 토큰을 예측하도록 설계된 Transformer 아키텍처이다. 이 구조에서는 causal mask로 미래 토큰을 가리며 self-attention 연산이 이전 토큰 정보만 활용하도록 처리된다. 작은 모델 실험에서 토큰별 확률 분포와 내부 가중치가 어떻게 연관되는지 관찰하기에 적합함이 확인됐다.
- 10×10 곱셈표(10x10 multiplication table)
- — 10×10 곱셈표는 'a*b=c' 형식으로 0부터 9까지 모든 쌍을 포함하는 훈련 데이터 집합이다. 각 곱셈 표현은 동일한 포맷과 동일한 빈도로 나타나므로 접두사 정보로는 두 번째 피연산자를 구별할 근거가 존재하지 않는다. 데이터 통계가 모델의 출력 확률 분포에 직접적으로 반영됨이 실험으로 확인됐다.
- 가중치 행렬(weight matrix)
- — 가중치 행렬은 Transformer 내부의 linear 연산을 수행하는 핵심 텐서로서 입력 임베딩과 attention 연산의 선형 변환을 담당한다. 저자 실험에서는 모델 크기가 작아 전체 가중치 행렬을 실시간으로 시각화하면서 prefix별 출력 변화와 가중치 변화를 직접 추적할 수 있었다. 가중치의 특정 패턴이 확률 분포 형성에서 어떻게 기여하는지 가시적으로 확인됐다.
코드 예제
"7*8=56"훈련 데이터는 각 곱셈식 문자열을 원문 그대로 포함했고 '7*8=56' 같은 한 줄 표기법을 사용했다. 실험자는 임의의 접두사를 입력하여 모델이 다음 토큰에 대해 계산한 softmax 분포를 관찰했고 그 분포와 데이터 빈도 간의 대응관계를 분석했다. 전체 모델이 작아 학습 중에도 텐서 이름을 클릭해 실제 가중치 행렬을 확인하며 내부 동작을 추적할 수 있었다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.