TL;DR
MoE 모델의 거부 메커니즘이 정치적 검열과 안전 가드레일로 분리되어 있음을 밝히고, 추론 시점의 훅을 통해 이를 선택적으로 제거하는 기법을 제시했다.
배경
Mac Studio M3 Ultra 환경에서 Qwen3.5-397B-A17B 모델의 중국 정치 관련 검열을 제거하기 위해 FailSpy의 abliteration 기법을 MoE 아키텍처에 맞춰 개선하고 실험한 결과를 공유했다.
의미 / 영향
MoE 모델의 거부 메커니즘이 전문가 라우팅과 밀접하게 연관되어 있으며, 단순 가중치 수정보다 잔차 스트림 개입이 더 강력한 제어 수단임이 확인됐다. 대규모 모델일수록 활성화 공간 수정에 대한 허용 오차가 작아지므로 정밀한 튜닝 전략이 필수적이다.
커뮤니티 반응
작성자의 구체적인 실험 데이터와 가설에 대해 긍정적인 반응이며, 특히 MoE 모델에서의 라우팅 가설에 대해 다른 대형 모델(DeepSeek V3 등)에서의 재현 여부에 관심이 집중됐다.
주요 논점
MoE 모델의 거부 메커니즘은 라우팅 단계와 출력 단계로 분리되어 있으며 훅 방식이 더 효과적이다
합의점 vs 논쟁점
합의점
- MoE 모델에서 정치적 검열과 안전 가드레일은 서로 다른 활성화 방향을 가진다
- 대형 모델일수록 활성화 공간 수정에 더 민감하게 반응한다
논쟁점
- 안전 거부 로직이 실제로 특정 전문가 레이어에 고립되어 있는지에 대한 추가 검증 필요
실용적 조언
- MoE 모델의 검열을 완벽히 제거하려면 가중치 수정 대신 vMLX 등을 이용한 추론 시점 훅을 사용하라
- 397B 모델의 경우 상위 16개 방향 제거가 가장 안정적인 설정이다
섹션별 상세
용어 해설
- Abliteration
- — LLM의 활성화 공간에서 거부 반응과 관련된 특정 벡터 방향을 찾아내어 이를 직교화함으로써 모델의 가드레일을 무력화하는 기술이다. 모델이 특정 주제에 대해 답변을 거부하는 성향을 강제로 억제하여 검열을 해제하는 데 사용된다.
- MoE (Mixture of Experts)
- — 모델의 전체 파라미터 중 일부 전문가 레이어만 활성화하여 추론하는 아키텍처이다. 입력값에 따라 어떤 전문가를 사용할지 결정하는 라우터가 핵심이며, 대규모 모델의 연산 효율성을 극대화하는 구조이다.
- Residual Stream
- — 트랜스포머 모델의 각 레이어를 거치며 정보가 누적되고 전달되는 통로이다. 모델의 최종 판단 근거가 되는 모든 활성화 정보가 흐르는 곳으로, 이곳에 훅을 걸어 특정 정보의 흐름을 조절하거나 수정할 수 있다.
- Orthogonalization
- — 수학적으로 두 벡터가 서로 수직이 되도록 만드는 과정이다. AI 모델 수정에서는 특정 활성화 방향(예: 거부)을 다른 정보 흐름과 수직으로 만들어 해당 성분이 결과에 영향을 미치지 못하게 제거하는 용도로 쓰인다.
언급된 도구
설정 기반의 추론 훅 배포 및 실행
4비트 양자화 모델 추론 및 실험 하드웨어
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.