본문으로 건너뛰기

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

FP4 훈련은 메모리와 계산비를 크게 절감하지만, E2M1 비균일 격자와 RHT의 조합은 Shrinkage Bias를 유발하고 층을 따라 신호가 체인처럼 감소하는 문제를 초래한다. E1M2/INT4 같은 uniform grid를 사용하면 RHT의 코드북 활용을 퀀타이제이션 품질로 더 잘 전환할 수 있으며, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 일관되게 달성한다. 향후 가속기는 FP4 훈련 프린티브로 uniform grid를 첫-class로 지원해야 한다.

왜 중요한가

FP4 훈련은 메모리와 계산비를 크게 절감하지만, E2M1 비균일 격자와 RHT의 조합은 Shrinkage Bias를 유발하고 층을 따라 신호가 체인처럼 감소하는 문제를 초래한다. E1M2/INT4 같은 uniform grid를 사용하면 RHT의 코드북 활용을 퀀타이제이션 품질로 더 잘 전환할 수 있으며, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 일관되게 달성한다. 향후 가속기는 FP4 훈련 프린티브로 uniform grid를 첫-class로 지원해야 한다.

핵심 기여

Shrinkage Bias의 기하학적 원인 규명

비균일한 RTNE 구간(E2M1)에서 발생하는 음의 기대 양자화 오차가 계층을 따라 누적되며, Random Hadamard Transform(RHT)이 이를 악화시킨다.

Uniform-grid 기반 FP4(UTP4) 제안

E1M2/INT4 스타일의 균일 격자를 기반으로 삼자형 세 GEMM(FPROP, DGRAD, WGRAD)에 RHT를 적용하고, dY에만 SR을 적용하는 UFP4를 제시한다.

실험적 검증-대규모 모델에서의 손실 감소

Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative LM 손실의 차이가 E2M1 대비 UFP4에서 작게 나타난다: 0.9673% vs 1.2570%(Dense 1.5B), 1.8469% vs 2.3596%(MoE 7.9B), 1.3863% vs 1.7308%(MoE 124B).

RHT Scope ablation의 효과

Full-RHT가 가장 큰 손실 감소를 유도하며 SR과의 조합이 추가 이점을 제공한다.

하드웨어 설계 방향의 제언

향후 FP4 트레이닝은 E1M2/INT4 스타일 uniform 그리드를 기본으로 지원하고, E2M1은 범용 워크로드에 한해 범용적으로 유지하되 파인튜닝 및 인퍼런스에는 여전히 사용 가능하도록 제시된다.

핵심 아이디어 이해하기

출발점: FP4 훈련은 차세대 대형 모델의 메모리 및 계산 비용을 크게 줄이지만 4비트 포맷의 비효율성은 정확도 저하를 가져올 수 있다. Non-uniform한 E2M1 격자는 RTNE 구간의 기하학적 비대칭으로 Shrinkage Bias를 만들어 층을 지나면서 신호가 체인처럼 약화된다. 중간 기점: RHT는 텐서의 분포를 재배치해 양자화 효율을 높이는 도구이나, E2M1에서의 적용은 바이어스 증가를 야기할 수 있다. Uniform-grid(E1M2/INT4)에서는 RHT가 텐서의 에너지를 균등하게 분산시키고, 양자화 구간 간의 간격이 일정해 바이어스가 제거되며, RHT를 세 GEMM 경로에 걸쳐 적용해도 신호 손실이 더 잘 통제된다. 결론: Uniform-grid 기반의 UFP4는 RHT를 모든 GEMM에서 적용하면서 dY에만 SR을 적용하는 설계로 BF16-relative 손실 감소를 달성하고, 대규모 MoE에서도 확장 가능성을 보인다.

관련 Figure

E2M1 vs E1M2/INT4의 representable 값과 RTNE bin의 기하학적 비대칭을 시각화한 도식으로 Shrinkage Bias의 기하학적 원인을 보여준다.
Diagram

비대칭 bin이 Shrinkage Bias를 초래한다는 핵심 주장과 직결되며, Uniform-grid의 필요성을 시사한다.

E2M1 vs E1M2/INT4의 representable 값과 RTNE bin의 기하학적 비대칭을 시각화한 도식으로 Shrinkage Bias의 기하학적 원인을 보여준다.

방법론

수치적 비교: 4-bit 포맷(E2M1, E1M2, INT4) 및 RHT의 조합에 대해 SQNR, bucket-utilization(B_eff), NMSE 등을 측정한다. 각 계산 경로(GEMM)에서의 양자화 품질 변화를 확인하고, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative LM 손실을 추적한다.

관련 Figure

RHT를 전 경로에 적용했을 때의 성능 비교 및 Fused-RHT의 도입 영향.
Chart

full-RHT 적용 시 이점이 커지며, Fused-RHT+Quantization의 레이턴시 오버헤드도 작다(효율적 구현 가능성).

RHT를 전 경로에 적용했을 때의 성능 비교 및 Fused-RHT의 도입 영향.

주요 결과

주요 벤치마크: E1M2 기반 UFP4가 BF16 대비 손실 감소 폭이 큰 것으로 확인되며, 3가지 스케일에서의 손실 지표가 각각 0.9673%, 1.8469%, 1.3863%로 나타난다. Q1에서 RHT의 효과는 텐서의 분포와 격자 형식에 따라 다르며, linear_fc2 같은 경우 E1M2가 ROT 후 더 높은 SQNR를 유도한다. Q3에서 스케일을 확장해도 E1M2의 이점은 지속되며, FP4 대 BF16 차이는 모델 규모에 따라 감소하는 경향을 보인다. Q4에서 전체 RHT 범위와 SR의 조합이 가장 큰 손실 감소를 보이며, E2M1의 모방은 충분치 않다. Q5에서 RHT를 양자화와 합치면 레이턴시 페널티가 작아져 실현 가능성이 높다.

관련 Figure

MoE 124B에서 E2M1 vs E1M2의 BF16-relative 손실 비교 그래프.
Chart

대규모 MoE에서 Uniform-grid(UFP4)가 E2M1 기반 레시피보다 BF16 상대 손실을 더 잘 따라잡는다는 실험 증거를 제공한다.

MoE 124B에서 E2M1 vs E1M2의 BF16-relative 손실 비교 그래프.

RHT가 SQNR에 미치는 영향의 레이어별 변화(linear_fc1/fwd_x 중심).
Chart

RHT와 격자 형식의 상호작용으로 E2M1 vs E1M2의 성능 차이가 레이어에 따라 달라진다는 근거를 제공한다.

RHT가 SQNR에 미치는 영향의 레이어별 변화(linear_fc1/fwd_x 중심).

linear_fc1에서 RHT 적용 후 GEMM Outputs의 SQNR 변화.
Chart

GEMM 출력에서 E1M2는 보존/향상, E2M1은_ROT 후 감소하는 경향이 있음을 보여준다.

linear_fc1에서 RHT 적용 후 GEMM Outputs의 SQNR 변화.

linear_fc2/fwd_x 텐서에서 RHT에 따른 SQNR 변화 및 버킷 활용도 변화.
Chart

Outlier가 많은 텐서에서 E1M2가 Post-RHT 분포에 더 잘 맞고 버킷 활용도가 증가한다는 것을 시사한다.

linear_fc2/fwd_x 텐서에서 RHT에 따른 SQNR 변화 및 버킷 활용도 변화.

linear_fc2/fwd_x에서 GEMM 출력 SQNR의 포지션 변화.
Chart

GEMM 경로에서 E1M2가 주로 이익을 얻는 반면 E2M1은 Rotated regime에서 악화될 수 있음을 보여준다.

linear_fc2/fwd_x에서 GEMM 출력 SQNR의 포지션 변화.

RHT에 의한 FP4 그래프에서 E1M2 vs E2M1의 손실 차이와 그 추세를 보여주는 그래프.
Chart

Q4–Q5의 ablation 및 범용성 평가를 보강하는 시각적 근거를 제공한다.

RHT에 의한 FP4 그래프에서 E1M2 vs E2M1의 손실 차이와 그 추세를 보여주는 그래프.

기술 상세

아키텍처: FPROP(fwd_y), DGRAD(bwd_dx), WGRAD(bwd_dw) 3개의 training GEMM에 대해 RHT를 적용하고, 양자화는 G={E1M2/INT4, E2M1}의 코드북으로 수행한다. 스케일링은 FP32 단일 레벨 또는 다단계 스케일 계층을 사용할 수 있다. SR은 dY에만 적용한다. 지표로는 BF16-relative LM loss, SQNR, bucket 활용도(B_eff) 및 NMSE를 사용한다. 봉인된 손실 감소를 통해 E1M2 기반 UFP4가 E2M1 기반 레시피보다 BF16 대비 손실 degradation을 줄임을 보였다.

한계점

BF16-Relative 손실은 여전히 존재하고, E1M2 기반의 손실 감소가 모든 상황에서 완전한 BF16과 같지는 않다. E2M1은 여전히 range-limited 워크로드에서 유효할 수 있다. 하드웨어의 완전한 지원 여부에 따라 실제 도입 시 이점이 달라질 수 있다.

실무 활용

E1M2/INT4 스타일 uniform 그리드를 기본으로 하는 FP4 훈련(UFP4)은 RHT를 모든 GEMM에 적용하고 dY에 SR을 적용하는 설계로 BF16-relative 손실 감소를 달성한다.

  • 대형 언어 모델의 파인튜닝 및 프리트레이닝에서 FP4 기반의 저비용 훈련 파이프라인 구축
  • MoE 기반 대규모 모델에서 메모리 대역폭 감소와 계산량 절감 효과를 극대화
  • FP4 하드웨어에서 uniform-grid의 지원 필요성 강조

코드 공개 여부: 미확인

키워드

FP4 trainingShrinkage BiasRandom Hadamard Transformuniform gridsE2M1E1M2/INT4BF16-relative lossMoEdense-1.5Bscaling-law

용어 해설

FP4(4-bit 형식)(FP4)
Activations, weights, and gradients를 4-bit 포맷으로 표현하는 정밀도 형식. E2M1, E1M2/INT4 같은 코드북을 사용하며 블록별 스케일링으로 양자화를 수행한다.
Shrinkage Bias
RTNE(Round-to-Nearest-Even)로 양자화될 때 비균일한 구간(bin)의 기하학적 비대칭으로 인해 부정적 기대편향이 생기는 현상. 층을 따라 누적되어 신호가 체인으로 약화된다.
Random Hadamard Transform
Outlier 에너지를 고르게 확산시키기 위해 Hadamard 변환과 난수 부호를 결합한 변환으로, 양자화 전에 텐서의 분포를 재배치한다.
균일 격자(uniform grid (E1M2/INT4 스타일))
모든 양자화 구간이 등간격으로 배치된 4-bit 격자. RHT를 모든 GEMM 경로에 적용해도 비대칭성으로 인한 바이어스가 발생하지 않는다.
E2M1 그리드(E2M1)
4-bit 형식 중 비균일한 지수-가수 구성(E2M1). 비대칭적 양자화 구간으로 Shrinkage Bias를 유발하고 다층에서 누적될 수 있다.
E1M2 그리드(E1M2)
4-bit 형식 중 균일한 양자화 구간(E1M2). Post-RHT 배치에 더 잘 맞아 BF16Relative 손실 악화를 줄이고 버킷 활용도를 높인다.
UFP4 레시피(UFP4)
Uniform Grid 기반의 4-bit FP4 훈련 레시피로, three GEMMs(FPROP, DGRAD, WGRAD) 모두에 RHT를 적용하고 dY에만 SR을 적용한다. Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 보인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.