본문으로 건너뛰기

Jacobian 기반 Noise Injection으로 LLM 양자화 견고성 강화

Jacobian 민감도에서 noise 세기를 정해 낮은 비트 양자화 성능을 보강하는 학습 기법이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Large Language Models와 SigLIP의 낮은 비트 양자화는 self-attention의 softmax가 이상치와 입력 상태에 민감해 성능 저하가 커지는 문제가 있다. 이 연구는 pre-attention logits에 평균이 0인 Gaussian noise를 주입하되, noise variance를 Jacobian Frobenius norm에서 직접 산출하는 Jacobian-Guided Noise Injection을 제안한다. 모델은 학습 과정에서 Attention 민감도에 맞춘 변동을 경험하며 양자화 오차에 견고한 표현을 형성한다. 실험에서 SigLIP의 ImageNet-1K Top-1 accuracy는 상대적으로 최대 +37%, 언어 모델의 WikiText perplexity는 상대적으로 최대 40% 개선됐지만, 세부 비트 수와 절대 성능은 본문에 공개되지 않았다.

빠른 이해

새로운 점

Jacobian의 Frobenius norm에서 noise variance를 직접 산출해 Attention의 국소적 양자화 민감도에 맞추는 Noise Injection 방식이다.

핵심 메커니즘

학습 중 pre-attention logits의 Jacobian Frobenius norm을 계산하고, 그 크기에서 평균이 0인 Gaussian noise의 variance를 정한다. 이 noise를 logits에 주입한 뒤 softmax와 self-attention을 거쳐 출력을 만들면서 모델이 양자화 오차에 견디는 파라미터를 학습한다.

핵심 수치

  • SigLIP ImageNet-1K Top-1 accuracy: 상대적 최대 +37%- 낮은 비트 양자화 견고성 평가
  • 언어 모델 WikiText perplexity: 상대적 최대 40% 개선- 낮은 비트 양자화 환경

섹션별 상세

01

양자화 안정성을 가로막는 Attention 민감도

Large Language Models와 Vision-language Models의 양자화는 self-attention 내부의 연속적인 값을 낮은 비트의 이산값으로 바꾸는 과정에서 성능 저하가 발생하기 쉽다. 연구진은 특히 logits를 Attention 가중치로 변환하는 softmax operator가 이상치와 입력 상태에 따른 Jacobian 변화에 민감하다는 점을 안정성 저하의 병목으로 규정했다. 이 민감도가 클수록 작은 양자화 오차가 Attention 출력의 큰 변화로 이어질 가능성이 커진다. 따라서 양자화 후 정확도와 perplexity를 유지하려면 단순히 가중치만 압축하는 대신 Attention 입력의 국소적 민감도를 함께 제어해야 한다.
02

Jacobian norm에서 정하는 Noise Injection

제안한 Jacobian-Guided Noise Injection은 학습 중 pre-attention logits에 평균이 0인 Gaussian noise를 주입하는 방식이다. Noise의 variance를 임의의 하이퍼파라미터로 고정하지 않고, 해당 logits에 대한 Jacobian의 Frobenius norm에서 직접 계산해 Attention이 민감한 구간에 맞춘다. 입력 logits가 noise를 거쳐 softmax와 Attention 연산으로 전달되면서 모델은 양자화 과정에서 나타날 수 있는 변동에 더 견고한 표현을 학습한다. 연구진의 이론은 Jacobian norm을 억제하면 양자화로 인한 성능 저하를 제한할 수 있다는 관계를 근거로 삼으며, Jacobian을 직접 벌점으로 넣거나 휴리스틱에 의존한 기존 접근과 구별된다.
03

SigLIP와 언어 모델에서의 성능 개선

연구진은 제안 기법을 최신 LLM architecture와 SigLIP에 적용하고 인기 있는 PTQ 방법과 견고성을 비교했다. ImageNet-1K에서 SigLIP의 Top-1 accuracy는 상대적으로 최대 +37% 개선됐고, 낮은 비트 양자화 환경의 언어 모델에서는 WikiText perplexity가 상대적으로 최대 40% 개선됐다. 전자는 이미지 분류 정확도, 후자는 언어 모델의 예측 불확실성을 측정하므로 서로 다른 작업에서 양자화 오차의 영향이 줄었음을 나타낸다. 다만 본문에 전체 절대 정확도, perplexity 값, 비트 수와 비교 모델별 세부 조건은 제시되지 않아 개선 폭을 모든 설정에 일반화할 수는 없다.

용어 해설

양자화(Quantization)
모델의 가중치나 중간값을 더 적은 비트의 이산적인 값으로 바꾸는 최적화 기법이다. 메모리 사용량과 추론 비용을 낮추지만, 원래의 연속적인 값이 반올림되면서 성능 저하가 발생할 수 있다. 이 글은 특히 낮은 비트 환경에서 이러한 오차에 대한 LLM과 VLM의 견고성을 높이는 방법을 다룬다.
Softmax 연산자(Softmax Operator)
Attention의 logits를 입력으로 받아 각 항목의 상대적인 가중치를 합이 1인 확률 형태로 변환하는 연산이다. 일부 입력값이 매우 크거나 작은 이상치에 영향을 받으면 출력 분포가 급격히 달라질 수 있다. 연구진은 이 민감성이 양자화 오차를 키우는 병목으로 작용한다고 분석했다.
Jacobian
함수의 여러 출력이 여러 입력값의 변화에 얼마나 민감한지를 미분값으로 나타내는 행렬이다. 이 글에서는 pre-attention logits 변화가 Attention 출력에 미치는 민감도를 Jacobian의 Frobenius norm으로 측정한다. norm이 작아지면 양자화로 생기는 성능 저하를 제한하는 데 유리하다는 이론적 관계를 사용한다.
PTQ
모델을 다시 학습하거나 전체 Fine-tuning을 수행하지 않고, 학습이 끝난 뒤 가중치와 활성값을 낮은 비트로 변환하는 방식이다. 계산량과 저장 공간을 줄일 수 있지만, 양자화 과정에서 생기는 discretization error를 보정하기 어렵다. 연구진은 기존 PTQ 방법과 비교해 낮은 비트 조건의 성능 저하를 줄이는 것을 목표로 삼았다.

기술

  • Jacobian-Guided Noise Injection
  • Quantization
  • softmax
  • self-attention
  • Gaussian noise
  • PTQ
  • SigLIP
  • ImageNet-1K
  • WikiText
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 15.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.