본문으로 건너뛰기

Mix-Quant: 에이전트형 LLM을 위한 프리필링의 양자화와 디코딩의 정밀성 보장

에이전트형 LLM의 입력 컨텍스트가 길어지면서 프리필링이 주된 병목이 된다. 기존의 전체 파이프라인에 저비트 양자화를 적용하면 디코딩 품질이 악화될 수 있는데, Mix-Quant은 프리필링에만 NVFP4 양자화를 적용하고 디코딩은 BF16으로 유지해 계산 효율과 생성 품질의 균형을 달성한다. 이로써 긴 맥락과 다회 상호작용이 요구되는 에이전트형 인퍼런스의 효율을 크게 개선한다.

용어 해설

NVFP4
Blackwell 계열에서 지원하는 4-bit microscaling FP4 포맷으로, 16개 요소의 로컬 스케일 블록과 FP8(E4M3) 그리드의 두 가지 규모를 조합해 ultra-low 비트폭에서도 정밀도를 높이고 하드웨어 가속을 가능하게 한다.
BF16
BFloat16 형식으로, 16비트의 가벼운 부동소수 표현을 사용하되, 메모리 대역과 연산 효율을 확보하면서도 신경망 가중치/활성화의 정밀도 균형을 유지한다.
KV 캐시(KV Cache)
Transformer의 Q/K/V 매트릭스에서 생성된 키-값 쌍을 재사용하기 위한 캐시 메모리 체계.
프리필링-디코딩 분리(Prefill-Decode Disaggregation)
프리필링과 디코딩 경로를 서로 다른 하드웨어 경로에서 독립적으로 실행하는 시스템 설계.
페이즈 스플리팅(Phase Splitting)
프리필링과 디코딩의 서로 다른 워크로드를 분리해 각각에 최적의 양자화/정밀도 전략을 적용하는 원칙.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.