TL;DR
표현에서 특정 속성(예: 성별, 유해성)을 제거할 때 다른 관련 정보들이 손상되지 않도록 하는 것은 개인 정보 보호와 공정성 측면에서 핵심 과제이다. MANCE는 편집을 표현의 자연 분포가 차지하는 매니폴드로 제한하여 목표 개념을 제거하는 동안 제어 개념 보존을 개선하는 실용적 전략을 제시했다. 이 접근은 표현 편집을 downstream 적용(예: activation patching, 재투입)에서 사용할 수 있는 형태로 유지하면서 비선형 신호까지 효과적으로 다루는 결과를 보였다.
왜 중요한가
표현에서 특정 속성(예: 성별, 유해성)을 제거할 때 다른 관련 정보들이 손상되지 않도록 하는 것은 개인 정보 보호와 공정성 측면에서 핵심 과제이다. MANCE는 편집을 표현의 자연 분포가 차지하는 매니폴드로 제한하여 목표 개념을 제거하는 동안 제어 개념 보존을 개선하는 실용적 전략을 제시했다. 이 접근은 표현 편집을 downstream 적용(예: activation patching, 재투입)에서 사용할 수 있는 형태로 유지하면서 비선형 신호까지 효과적으로 다루는 결과를 보였다.
핵심 기여
매니폴드 제약 가설(MCH) 정식화
자연 표현이 구조화된 저차원 매니폴드에 집중한다는 가정을 정식화했다. 이 가설은 동일한 목표 제거 효과를 내는 편집이라면 매니폴드에 국한된 편집이 다른 인코딩된 개념을 더 잘 보존한다고 예측했다. 논문은 이 가설을 개념 제거 문제의 맥락에서 실험적으로 검증 가능한 형태로 제시했다.
MANCE 알고리즘 계열 제시
MANCE는 비선형 개념 프로브의 그래디언트를 각 샘플의 국소 접공간으로 투사하고 스펙트럼 가중치와 지역 반경 기반 캡을 적용해 반복 갱신을 수행하는 알고리즘이다. 알고리즘은 자연 입력에서 얻은 고정된 표현 집합으로부터 k-NN 이웃을 찾고, 로컬 PCA(SVD)로 접기저(탠전트 기저)를 추정하여 편집 방향을 구성한다. 해당 루프는 τ 주기마다 프로브를 재학습하고 H 라운드 후 편집된 표현을 반환하는 구조로 구현되며, MANCE+, MANCE++ 전처리 변형을 통해 선형 모멘트 보정 단계를 추가했다.
광범위한 실험과 SOTA 성능 달성
텍스트와 비전 합쳐 총 119 설정(13 LLM 계열 × 3 개념, CelebA 40 속성 × 2 수술성 체계)에서 평가를 수행했다. MANCE++는 동일한 수술성(ΔY) 한도하에서 기존 비선형 방법들을 상회하는 목표 누출 감소 및 높은 커버리지를 달성했다. 논문은 Ablation(예: AmbCE++)을 통해 향상이 접공간 제약에서 기인함을 실증적으로 확인했다.
핵심 아이디어 이해하기
신경 표현은 전체 d차원 공간을 균일하게 채우지 않고 입력 분포와 인코더 구조가 결합해 형성한 저차원 구조에 집중한다는 관찰이 출발점이다. 이 구조를 매니폴드로 모델링하면 한 점에서 자연스럽게 발생할 수 있는 변동 방향들이 접공간으로 요약되며, 편집이 이 접공간을 벗어나면 자연 표현의 국소 이웃에서 벗어나 제어 정보가 손상될 위험이 커진다. 따라서 편집 방향을 접공간에 투사하면 목표 신호를 감소시키면서도 자연 분포 내의 변화로 제한되어 다른 개념이 보존될 가능성이 높아진다.
관련 Figure

그림은 자연 표현이 저차원 매니폴드에 집중한다는 전제를 시각화하고 비제약 그래디언트 업데이트가 매니폴드를 벗어나 다른 개념들을 손상시킬 수 있음을 보여주었다. MANCE는 각 편집에서 로컬 접공간을 추정하고 편집 방향을 접공간으로 투사하므로 매니폴드 위에 머무르며 다른 인코딩된 개념을 보존하는 동작을 나타냈다.
MANCE의 개념적 도식으로 자연 표현의 매니폴드, 비제약 업데이트의 오프-매니폴드 이동, 매니폴드 제약 업데이트(접공간 투사)를 비교했다.
방법론
MANCE는 세 단계로 구성된다. 첫째, 각 편집 대상 표현 x_i에 대해 자연 입력에서 얻은 고정된 표현 집합 X^(0)에서 k-NN을 찾아 그 이웃의 평균과 편차 행렬 S_i를 구성하고 SVD를 통해 상위 r개의 우측 특이벡터를 접기저 B_i로 취득한다. 둘째, 현재 라운드의 비선형 개념 프로브 f_t의 입력 그래디언트 ∇f_t(x_i)를 정규화한 뒤 B_i^T로 투사하여 접기저 좌표 c_i를 얻고 특이값 σ_i,ℓ^α로 가중치 재배분해 접공간 내 편집 방향 d_i를 구성한다. 셋째, 편집 단계 크기 λ_i를 각 샘플의 지역 반경 r_i와 분산 내적 ⟨x_i,û_i⟩를 사용한 닫힌형 해로 계산해(λ_i = min(λ_max, ε·r_i / |⟨x_i,û_i⟩|)) d_i 방향으로 x_i의 해당 성분을 감소시키며 H 라운드를 반복한다.
주요 결과
주요 지표는 목표 누출(target leakage, D_S)과 수술성(ΔY)으로, ΔY 예산별로 각 방법의 최선 단계(예산 내) 결과를 비교했다. NLP 39개 설정에서 MANCE++는 DY≤3pp부터 평균 누출을 거의 0pp로 끌어내렸고 DY≤10pp에서는 35/39 설정을 무작위(majority) 수준으로 만들었다. CelebA 비전 실험에서는 저상관(regime)에서 MANCE++가 DY≤1pp에서 39/40, DY≤3pp에서 40/40의 커버리지를 달성하는 등 기존 방법들이 커버하지 못한 고상관 속성에서도 높은 수술성-누출 트레이드오프를 보였다.
관련 Figure

그래프는 원시 표현 대비 다양한 방법의 누출 감소를 ΔY 예산별로 비교해 MANCE 계열 특히 MANCE++가 낮은 누출을 유지함을 수치적으로 확인시켰다. 또한 AmbCE++ 같은 비제약 전제의 대조군이 접공간 제약을 제거했을 때 성능이 현저히 악화되는 경향을 보여 매니폴드 제약의 이점을 실증했다.
NLP 설정에서 수술성 예산별(ΔY) 평균 목표 누출(mean target leakage)을 여러 방법과 비교한 집계 그래프이다.

막대차트는 각 모델에서 원본, Obliviator, MANCE++ 결과를 직접 비교하며 MANCE++가 더 많은 모델에서 다수결 수준으로 목표 성능을 끌어내는 경향을 보였다. 특히 직업과 강하게 상관된 성별 제거에서 MANCE++의 수술성-누출 균형 우위가 뚜렷했다.
여러 언어 모델별 성별 개념 제거 성능(S_acc) 비교 바 차트로 DY≤1pp과 DY≤5pp 두 예산을 병렬로 제시했다.

산점도는 고상관 제약 하에서 기존 방법들이 높은 누출을 유지하거나 커버리지가 낮다는 점을 보여주었고 MANCE++는 더 넓은 커버리지에서 낮은 누출을 동시에 달성해 파레토 우위를 형성했다. 이 결과는 매니폴드 제약이 상관성이 높은 경우에도 편집의 수술성을 유지하는 데 유리하다는 근거로 연결되었다.
CelebA 속성 편집에서 커버리지(예산 내 에디트 가능한 속성 수) 대비 평균 목표 누출을 고·저 상관 제약과 두 예산에서 비교한 산점도이다.
기술 상세
전체 구조는 반복적 편집 루프와 로컬 매니폴드 추정으로 구성되어 있으며 입력 표현 집합 X^(0)는 편집 대상과 독립적으로 고정된다. 각 샘플에 대해 k개의 자연 이웃을 가져와 평균 중심화된 행렬 S_i를 SVD로 분해하고 상위 r개의 우측 특이벡터를 접기저 B_i로 취득하여 T_{x_i}(M)을 근사했다. 접기저 좌표 계산은 c_i = B_i^T u_i이며 u_i는 프로브 출력에 대한 입력 그래디언트를 L2 정규화한 벡터이다. 핵심 수식은 단계 크기 산정식 λ_i = min(λ_max, ε·r_i / |⟨x_i,û_i⟩|)로, 여기서 r_i는 i의 k-NN 평균 거리이고 ε는 지역 반경의 비율로 설정된다. 이 수식에서 입력은 현재 표현 x_i와 접공간 기반 편집 방향 û_i이며 처리 흐름은 내적을 통해 편집 방향의 표현 성분을 확인한 뒤 지역 반경으로 허용 가능한 최대 이동을 계산해 그 값으로 스칼라 λ_i를 제한하여 최종 편집을 산출한다. 예시 수치로 r_i=0.5, ε=0.1, |⟨x_i,û_i⟩|=0.2이면 cap-implied λ_i = 0.1·0.5/0.2 = 0.25가 되고 λ_max보다 작으면 λ_i = 0.25로 설정되어 그 크기만큼 x_i의 해당 성분이 축소된다. 이 설계는 편집이 접공간 일차 근사 범위를 벗어나지 않도록 보장해 로컬 지오메트리에 부합하는 변형을 유지한다.
한계점
측정은 재학습한 비선형 MLP 프로브를 통해 복구 가능성을 평가하는 경험적 프로브 기반 지표에 의존하므로 완전한 불가역성 보장은 아니다. 매니폴드 추정은 k-NN 기반의 국소 접공간과 TwoNN에 의한 차원 추정에 의존해 자연 표현이 희소하거나 곡률이 큰 영역에서 품질이 저하될 수 있다. 계산 비용 측면에서 매 라운드마다 각 샘플에 대해 k-NN 검색과 SVD를 수행하므로 LEACE 같은 닫힌형 선형 방법보다 학습 및 배포 비용이 크다.
실무 활용
코드와 구현이 공개되어 있어 연구자와 엔지니어가 기존 개념 제거 파이프라인에 MANCE를 추가해 성능을 개선할 수 있다. MANCE는 하나의 편집 루프와 로컬 SVD 기반 전처리를 포함하므로 배치 적용이나 사전 계산된 자연 표현 집합을 활용한 오프라인 처리에 적합하다. 다만 배포 시에는 각 입력마다 k-NN 조회와 접기저 투사가 필요해 계산 비용을 고려해야 한다.
- 사전 학습 표현에서 특정 민감 속성(예: 성별, 인종 관련 신호)을 줄여 downstream 분류기 편향을 완화하는 프라이버시·공정성 파이프라인 통합.
- 모델 디버깅에서 특정 개념 신호가 예측에 미치는 영향을 국소적이고 수술적으로 제거해 원치 않는 유입 경로를 차단하는 진단 워크플로.
- 활성 패칭(activation patching)이나 모델 내 피처 편집을 필요로 하는 시스템에서, 편집된 벡터를 동일한 차원으로 유지한 채 재투입해야 하는 실시간 또는 오프라인 조정 작업.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Manifold Constraint Hypothesis
- — 자연 입력에서 생성된 표현들이 낮은 차원의 구조화된 매니폴드에 집중한다는 가정으로, 편집(update)을 해당 매니폴드에 국한하면 다른 인코딩된 개념들을 더 잘 보존하면서 목표 개념만 제거할 수 있다는 직관과 그에 따른 기댓값을 기술한다.
- Tangent Space
- — 한 점 주변의 매니폴드를 일차 근사하는 선형 부분공간으로서, 국소 이웃 샘플의 주성분(우측 특이벡터)을 통해 추정하고 편집 방향을 이 공간에 투사하여 매니폴드 상의 이동으로 제한하는 데 사용된다.
- Surgicality
- — 표현에서 목표 개념만 제거하는 과정에서 다른 제어(control) 개념들이 손상되는 정도를 가리키는 척도로서, 편집 이후 제어 개념의 정확도 감소(ΔY)를 통해 정량화하고 편집의 부작용을 최소화하는 것이 목표이다.
- CovMatch
- — 클래스별 공분산 차이의 주된 고유벡터를 제거하는 rank-2 특수화 전처리 절차로서, 데이터 전체 차원의 2차 모멘트 비대칭을 보정해 선형 단계에서 제거하기 어려운 축을 감소시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.