본문으로 건너뛰기

QAH로 4비트 모델 성능 회복

QAH는 원래 교사 모델의 Logits을 이용해 4비트 압축 모델의 성능을 회복하고 9개 벤치마크 중 7개에서 bfloat16 모델을 앞섰다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 언어 모델은 구조 압축과 4비트 양자화로 메모리와 연산량을 줄일 수 있지만 추론·수학·코딩 성능이 함께 떨어진다. Quantization-Aware Healing은 복구된 작은 모델이 아니라 압축 전 원래 모델을 고정된 교사로 삼고, 두 모델의 출력 Logits를 KL Divergence로 맞춰 손실된 정보를 다시 전달한다. GPT-OSS 120B를 60B MXFP4로 만든 실험에서 QAH 모델은 같은 60B bfloat16 모델보다 9개 벤치마크 중 7개에서 높았고, GPT-OSS 9B 비교에서는 약 100스텝에 54.9점에 도달한 뒤 안정적으로 유지됐다. Chunked KL은 긴 문맥 학습의 피크 메모리를 약 250GB에서 약 128GB로 낮춰 H200의 약 141GB 용량 안에 맞춘다.

섹션별 상세

01
대규모 언어 모델은 먼저 레이어·헤드·뉴런을 제거해 구조를 줄이고 남은 가중치를 4비트로 양자화하는 방식으로 메모리와 연산량을 낮추지만, 추론·수학·코딩 능력이 함께 저하된다. 기존 파이프라인은 이 손상을 복구하기 위해 QAT 같은 추가 학습 단계를 넣는다. 이 글의 핵심 문제는 구조 압축과 양자화를 모두 거친 모델을 어떤 교사 신호로 복구해야 성능 상한을 넘을 수 있는가에 있다.
02
기존 QAT는 Fake Quantization을 Forward Pass에 삽입하고 Task Loss로 학생 모델을 계속 Fine-tuning하므로, 과거의 Supervised Fine-tuning·RLHF·Agentic Tuning 과정을 낮은 정밀도에서 사실상 다시 거쳐야 한다. QAD는 이 비용을 줄이기 위해 Full-precision 교사의 출력 Logits와 양자화 학생의 분포를 KL Divergence로 맞추지만, 구조 압축 뒤에는 같은 작은 구조의 독립적인 Full-precision 교사가 존재하지 않는다. 복구된 bfloat16 모델을 교사로 쓰면 이미 손상된 목표를 다시 학습하게 되어 학생 모델의 정확도가 그 체크포인트의 성능 한계에 묶인다.
03
QAH는 복구된 모델이 아니라 구조 압축 전 원래 모델을 고정된 교사로 사용해 이 성능 상한을 제거한다. 교사는 전체 크기·Full-precision이고 학생은 절반 크기·MXFP4이지만, 교사의 출력 분포를 Logits 수준에서 맞추므로 두 모델이 같은 구조를 공유할 필요가 없다. 학생은 Hard Label을 보지 않고 교사의 분포만 학습하며, 양자화 단계가 단순한 손실 처리가 아니라 이전 복구 단계에서 전달하지 못한 정보를 추가로 전달하는 증류 과정으로 바뀐다.
구조 압축과 양자화 뒤 성능이 크게 낮아진 학생 모델을 원래의 Full-precision 모델이 교사로 복구하는 QAH 흐름도
Diagram도식은 Original Model이 레이어·헤드·뉴런 제거와 양자화를 거쳐 Compressed Student가 되고, 이 과정에서 능력이 크게 줄어드는 흐름을 보여준다. QAH는 압축 전 원래 모델의 고정된 Teacher Logits와 학생의 Logits 사이 KL Divergence를 계산해 학생 가중치를 업데이트하며, 최종적으로 압축·양자화 상태에서 회복된 모델을 만든다.
04
긴 문맥 학습에서는 문서 길이가 최대 32k 토큰에 이르기 때문에 일반적인 KL 계산이 전체 Vocabulary-by-Sequence 행렬을 메모리에 올리는 문제가 생긴다. QAH는 이를 피하려고 시퀀스를 한 조각씩 처리하는 메모리 효율적인 Chunked KL 손실을 사용하며, 제공된 메모리 비교에서 Dense KL은 약 250GB까지 치솟지만 Fused Chunked KL은 약 128GB로 H200의 약 141GB 용량 아래에 머문다. 이 구현 덕분에 고정된 GPU 메모리 예산 안에서 긴 문맥 복구 학습을 수행할 수 있다.
Dense KL과 Fused Chunked KL의 학습 중 GPU 메모리 피크 비교
Chart누적 영역 그래프에서 Dense KL은 Loss·Logits 메모리가 급증해 피크 약 250GB에 이르므로 약 141GB인 H200 용량을 초과한다. Fused Chunked KL은 Logits를 시퀀스 전체에 대해 한 번에 만들지 않고 구간별로 처리해 피크를 약 128GB로 낮추며, H200 용량선 아래에서 학습을 수행한다.
05
GPT-OSS 120B를 60B로 압축한 뒤 MXFP4로 양자화한 QAH 모델은 원래 60B bfloat16 복구 모델보다 9개 벤치마크 중 7개에서 높은 점수를 기록했다. AA-LCR에서는 35.3에서 42.7로 7.4포인트, AIME 2025에서는 70.7에서 76.3으로 5.6포인트 상승했으며, MMLU-Pro와 SciCode에서만 각각 0.2포인트와 1.4포인트 낮았다. GPT-OSS 9B 비교에서도 QAH는 약 100스텝에 평균 54.9점에 도달해 약 700스텝이 필요한 QAT의 54.6점과 비슷한 최고 성능을 보였고, 1,200스텝 뒤에도 안정적으로 유지된 반면 QAT는 약 19포인트 하락했다.
GPT-OSS 120B MXFP4 교사, 60B bfloat16 복구 모델, 60B MXFP4 QAH 모델의 9개 벤치마크 점수 비교
Chart막대그래프는 QAH 모델이 60B bfloat16 모델보다 AA-LCR에서 35.3 대 42.7, AIME 2025에서 70.7 대 76.3으로 높은 점수를 기록하는 등 대부분의 벤치마크에서 성능을 회복하거나 개선했음을 나타낸다. QAH 모델은 MMLU-Pro와 SciCode에서는 각각 73.8과 34.2로 bfloat16 모델보다 낮지만, LiveCodeBench에서는 66.5로 120B MXFP4 교사의 66.0도 넘어선다.

용어 해설

양자화 인지 복구(Quantization-Aware Healing)
구조 압축과 4비트 양자화로 성능이 떨어진 모델을 원래의 전체 크기·Full-precision 교사 모델에서 직접 지식 증류해 회복하는 방법이다. 학생 모델은 교사의 출력 Logits 분포를 KL Divergence로 맞추며, 기존 복구 모델의 성능 상한을 넘도록 학습한다.
양자화 인지 학습(Quantization-Aware Training)
Forward Pass에 Fake Quantization 연산을 넣고 낮은 정밀도 환경에서 Task Loss를 기준으로 모델을 계속 Fine-tuning하는 방식이다. 양자화 오차에 가중치가 적응하지만, 최적점을 지나치면 성능이 불안정해지고 조기 종료가 필요하다.
지식 증류(Knowledge Distillation)
교사 모델의 출력 분포를 학생 모델에 전달해 학습시키는 기법이다. QAH에서는 Hard Label 대신 고정된 교사의 Logits 분포를 사용하므로, 서로 다른 구조와 크기의 모델 사이에도 정보 전달이 가능하다.
KL Divergence
두 확률분포가 얼마나 다른지 측정하는 손실 함수로, 이 글에서는 교사와 학생의 출력 Logits 분포를 일치시키는 데 사용된다. Chunked KL 방식은 긴 시퀀스의 Vocabulary-by-Sequence 전체 행렬을 만들지 않고 일부 구간씩 계산해 GPU 메모리 사용량을 제한한다.
MXFP4
모델 가중치를 4비트 형식으로 표현하는 저정밀도 포맷이다. 글의 실험에서는 GPT-OSS 모델을 MXFP4로 양자화한 뒤 QAH를 적용해 메모리와 연산량을 줄이면서 성능을 회복했다.

기술

  • GPT-OSS
  • MXFP4
  • bfloat16
  • QAH
  • QAT
  • QAD
  • Chunked KL Divergence
  • RLHF

활용 사례

  • 구조 압축과 4비트 양자화를 거친 LLM의 성능 복구
  • 작은 GPU에서 실행하는 긴 문맥 LLM
  • 메모리와 토큰당 연산량을 줄인 모델 배포
  • 추론 비용을 낮추면서 수학·코딩·추론 성능을 유지하는 모델 압축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.