왜 중요한가
FP4 훈련은 메모리와 계산비를 크게 절감하지만, E2M1 비균일 격자와 RHT의 조합은 Shrinkage Bias를 유발하고 층을 따라 신호가 체인처럼 감소하는 문제를 초래한다. E1M2/INT4 같은 uniform grid를 사용하면 RHT의 코드북 활용을 퀀타이제이션 품질로 더 잘 전환할 수 있으며, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 일관되게 달성한다. 향후 가속기는 FP4 훈련 프린티브로 uniform grid를 첫-class로 지원해야 한다.
핵심 기여
Shrinkage Bias의 기하학적 원인 규명
비균일한 RTNE 구간(E2M1)에서 발생하는 음의 기대 양자화 오차가 계층을 따라 누적되며, Random Hadamard Transform(RHT)이 이를 악화시킨다.
Uniform-grid 기반 FP4(UTP4) 제안
E1M2/INT4 스타일의 균일 격자를 기반으로 삼자형 세 GEMM(FPROP, DGRAD, WGRAD)에 RHT를 적용하고, dY에만 SR을 적용하는 UFP4를 제시한다.
실험적 검증-대규모 모델에서의 손실 감소
Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative LM 손실의 차이가 E2M1 대비 UFP4에서 작게 나타난다: 0.9673% vs 1.2570%(Dense 1.5B), 1.8469% vs 2.3596%(MoE 7.9B), 1.3863% vs 1.7308%(MoE 124B).
RHT Scope ablation의 효과
Full-RHT가 가장 큰 손실 감소를 유도하며 SR과의 조합이 추가 이점을 제공한다.
하드웨어 설계 방향의 제언
향후 FP4 트레이닝은 E1M2/INT4 스타일 uniform 그리드를 기본으로 지원하고, E2M1은 범용 워크로드에 한해 범용적으로 유지하되 파인튜닝 및 인퍼런스에는 여전히 사용 가능하도록 제시된다.
핵심 아이디어 이해하기
출발점: FP4 훈련은 차세대 대형 모델의 메모리 및 계산 비용을 크게 줄이지만 4비트 포맷의 비효율성은 정확도 저하를 가져올 수 있다. Non-uniform한 E2M1 격자는 RTNE 구간의 기하학적 비대칭으로 Shrinkage Bias를 만들어 층을 지나면서 신호가 체인처럼 약화된다. 중간 기점: RHT는 텐서의 분포를 재배치해 양자화 효율을 높이는 도구이나, E2M1에서의 적용은 바이어스 증가를 야기할 수 있다. Uniform-grid(E1M2/INT4)에서는 RHT가 텐서의 에너지를 균등하게 분산시키고, 양자화 구간 간의 간격이 일정해 바이어스가 제거되며, RHT를 세 GEMM 경로에 걸쳐 적용해도 신호 손실이 더 잘 통제된다. 결론: Uniform-grid 기반의 UFP4는 RHT를 모든 GEMM에서 적용하면서 dY에만 SR을 적용하는 설계로 BF16-relative 손실 감소를 달성하고, 대규모 MoE에서도 확장 가능성을 보인다.
관련 Figure

비대칭 bin이 Shrinkage Bias를 초래한다는 핵심 주장과 직결되며, Uniform-grid의 필요성을 시사한다.
E2M1 vs E1M2/INT4의 representable 값과 RTNE bin의 기하학적 비대칭을 시각화한 도식으로 Shrinkage Bias의 기하학적 원인을 보여준다.
방법론
수치적 비교: 4-bit 포맷(E2M1, E1M2, INT4) 및 RHT의 조합에 대해 SQNR, bucket-utilization(B_eff), NMSE 등을 측정한다. 각 계산 경로(GEMM)에서의 양자화 품질 변화를 확인하고, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative LM 손실을 추적한다.
관련 Figure

full-RHT 적용 시 이점이 커지며, Fused-RHT+Quantization의 레이턴시 오버헤드도 작다(효율적 구현 가능성).
RHT를 전 경로에 적용했을 때의 성능 비교 및 Fused-RHT의 도입 영향.
주요 결과
주요 벤치마크: E1M2 기반 UFP4가 BF16 대비 손실 감소 폭이 큰 것으로 확인되며, 3가지 스케일에서의 손실 지표가 각각 0.9673%, 1.8469%, 1.3863%로 나타난다. Q1에서 RHT의 효과는 텐서의 분포와 격자 형식에 따라 다르며, linear_fc2 같은 경우 E1M2가 ROT 후 더 높은 SQNR를 유도한다. Q3에서 스케일을 확장해도 E1M2의 이점은 지속되며, FP4 대 BF16 차이는 모델 규모에 따라 감소하는 경향을 보인다. Q4에서 전체 RHT 범위와 SR의 조합이 가장 큰 손실 감소를 보이며, E2M1의 모방은 충분치 않다. Q5에서 RHT를 양자화와 합치면 레이턴시 페널티가 작아져 실현 가능성이 높다.
관련 Figure

대규모 MoE에서 Uniform-grid(UFP4)가 E2M1 기반 레시피보다 BF16 상대 손실을 더 잘 따라잡는다는 실험 증거를 제공한다.
MoE 124B에서 E2M1 vs E1M2의 BF16-relative 손실 비교 그래프.

RHT와 격자 형식의 상호작용으로 E2M1 vs E1M2의 성능 차이가 레이어에 따라 달라진다는 근거를 제공한다.
RHT가 SQNR에 미치는 영향의 레이어별 변화(linear_fc1/fwd_x 중심).

GEMM 출력에서 E1M2는 보존/향상, E2M1은_ROT 후 감소하는 경향이 있음을 보여준다.
linear_fc1에서 RHT 적용 후 GEMM Outputs의 SQNR 변화.

Outlier가 많은 텐서에서 E1M2가 Post-RHT 분포에 더 잘 맞고 버킷 활용도가 증가한다는 것을 시사한다.
linear_fc2/fwd_x 텐서에서 RHT에 따른 SQNR 변화 및 버킷 활용도 변화.

GEMM 경로에서 E1M2가 주로 이익을 얻는 반면 E2M1은 Rotated regime에서 악화될 수 있음을 보여준다.
linear_fc2/fwd_x에서 GEMM 출력 SQNR의 포지션 변화.

Q4–Q5의 ablation 및 범용성 평가를 보강하는 시각적 근거를 제공한다.
RHT에 의한 FP4 그래프에서 E1M2 vs E2M1의 손실 차이와 그 추세를 보여주는 그래프.
기술 상세
아키텍처: FPROP(fwd_y), DGRAD(bwd_dx), WGRAD(bwd_dw) 3개의 training GEMM에 대해 RHT를 적용하고, 양자화는 G={E1M2/INT4, E2M1}의 코드북으로 수행한다. 스케일링은 FP32 단일 레벨 또는 다단계 스케일 계층을 사용할 수 있다. SR은 dY에만 적용한다. 지표로는 BF16-relative LM loss, SQNR, bucket 활용도(B_eff) 및 NMSE를 사용한다. 봉인된 손실 감소를 통해 E1M2 기반 UFP4가 E2M1 기반 레시피보다 BF16 대비 손실 degradation을 줄임을 보였다.
한계점
BF16-Relative 손실은 여전히 존재하고, E1M2 기반의 손실 감소가 모든 상황에서 완전한 BF16과 같지는 않다. E2M1은 여전히 range-limited 워크로드에서 유효할 수 있다. 하드웨어의 완전한 지원 여부에 따라 실제 도입 시 이점이 달라질 수 있다.
실무 활용
E1M2/INT4 스타일 uniform 그리드를 기본으로 하는 FP4 훈련(UFP4)은 RHT를 모든 GEMM에 적용하고 dY에 SR을 적용하는 설계로 BF16-relative 손실 감소를 달성한다.
- 대형 언어 모델의 파인튜닝 및 프리트레이닝에서 FP4 기반의 저비용 훈련 파이프라인 구축
- MoE 기반 대규모 모델에서 메모리 대역폭 감소와 계산량 절감 효과를 극대화
- FP4 하드웨어에서 uniform-grid의 지원 필요성 강조
코드 공개 여부: 미확인
키워드
용어 해설
- FP4(4-bit 형식)(FP4)
- — Activations, weights, and gradients를 4-bit 포맷으로 표현하는 정밀도 형식. E2M1, E1M2/INT4 같은 코드북을 사용하며 블록별 스케일링으로 양자화를 수행한다.
- Shrinkage Bias
- — RTNE(Round-to-Nearest-Even)로 양자화될 때 비균일한 구간(bin)의 기하학적 비대칭으로 인해 부정적 기대편향이 생기는 현상. 층을 따라 누적되어 신호가 체인으로 약화된다.
- Random Hadamard Transform
- — Outlier 에너지를 고르게 확산시키기 위해 Hadamard 변환과 난수 부호를 결합한 변환으로, 양자화 전에 텐서의 분포를 재배치한다.
- 균일 격자(uniform grid (E1M2/INT4 스타일))
- — 모든 양자화 구간이 등간격으로 배치된 4-bit 격자. RHT를 모든 GEMM 경로에 적용해도 비대칭성으로 인한 바이어스가 발생하지 않는다.
- E2M1 그리드(E2M1)
- — 4-bit 형식 중 비균일한 지수-가수 구성(E2M1). 비대칭적 양자화 구간으로 Shrinkage Bias를 유발하고 다층에서 누적될 수 있다.
- E1M2 그리드(E1M2)
- — 4-bit 형식 중 균일한 양자화 구간(E1M2). Post-RHT 배치에 더 잘 맞아 BF16Relative 손실 악화를 줄이고 버킷 활용도를 높인다.
- UFP4 레시피(UFP4)
- — Uniform Grid 기반의 4-bit FP4 훈련 레시피로, three GEMMs(FPROP, DGRAD, WGRAD) 모두에 RHT를 적용하고 dY에만 SR을 적용한다. Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 보인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.