본문으로 건너뛰기

회로 속성 기반 망각: Circuit Attribution으로 인한 Quantization-Permanent Unlearning

deployed LLM은 일반적으로 4-bit PTQ로 양자화되며, 기존의 망각 기법은 양자화로 인해 되돌려지거나 망각이 축소될 수 있다. 본 연구는 회로 단위로 지식이 저장된 부분을 찾아 그 부분에 한정된 업데이트를 적용하고, 이를 NF4 양자화의 바운더를 넘어가도록 floor를 적용해 양자화-영구적 망각(permanence)을 보장한다. CAD를 도입해 구조적 erasure를 행동적 성능 변화와 분리 진단한다. 이로써 멀티모달/대형언어모델의 배포 환경에서 망각의 지속 가능성을 실험적으로 검증할 수 있게 된다.

용어 해설

희소성-영구성 트레이드오프(Sparsity–Permanence Tradeoff)
그라디언트 업데이트를 특정 회로로 집중할 때 각 파라미터당 업데이트 크기가 커지며 양자화 경계 cross가 가능해지지만, 회로 밖의 파라미터를 동결하면 전체 업데이트가 줄어들고 양자화 환경에서의 망각이 지속될 확률이 증가하는 현상.
회로 속성 차이(Circuit Attribution Divergence (CAD))
원래의 forget 회로에 대한 EAP-IG attribution 맵을 unlearned 모델 θ′에서 재실행하여 두 맵 간 상대적 차이를 측정하는 계측. CAD가 높으면 회로가 붕괴되었음을 나타내고, CAD가 0에 가까우면 인퍼런스-타임 리다이렉션과 같이 회로가 유지되었음을 시사한다.

코드 예제

text
Algorithm 1: MANSU (Mechanistic-Aligned Null-Space Unlearning) — Phase 1 Localize (EAP-IG attribution); Phase 2 Project (restrict updates to circuit C and apply Fisher-based mask); Phase 3 Floor (rescale updates to cross NF4 bin boundaries).

Phase 1: EAP-IG로 forget 회로를 찾고, Phase 2: C에 속한 매개변수만 업데이트하고 Fisher 정보의 방향으로 투영, Phase 3: NF4 바아의 경계 근처에서 모든 업데이트가 양자화를 벗어나도록 floor를 적용.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 14.수집 2026. 05. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.