실용적 조언
- MoE 모델의 검열을 완벽히 제거하려면 가중치 수정 대신 vMLX 등을 이용한 추론 시점 훅을 사용하라
- 397B 모델의 경우 상위 16개 방향 제거가 가장 안정적인 설정이다
섹션별 상세
MoE 모델의 거부 서브스페이스 분리 현상이 확인됐다. 중국의 정치적 검열과 서구권의 안전 가드레일이 활성화 공간 내에서 서로 다른 벡터 방향을 가짐을 발견하고, 이를 Gram-Schmidt 직교화로 처리했다. 특정 정치적 주제에 대한 거부 방향만 제거함으로써 마약이나 무기 관련 안전 가드레일은 유지한 채 정치적 검열만 선택적으로 해제할 수 있다. 이는 모델의 윤리적 가이드라인을 세밀하게 조정할 수 있는 가능성을 시사한다.
MoE 아키텍처에서 가중치 수정(Weight-baking)과 추론 시점 개입(Inference hooking)의 효과가 다르게 나타났다. 가중치 수정 방식은 정치적 검열은 제거했으나 일반 안전 거부는 차단하지 못한 반면, 잔차 스트림에 직접 개입하는 훅 방식은 두 종류의 거부를 모두 제거했다. 이는 MoE 모델의 거부 로직이 단순한 출력 투영뿐만 아니라 전문가 선택 과정에도 복합적으로 얽혀 있음을 의미한다.
안전 거부 로직이 특정 '안전 전문가' 레이어로 라우팅된다는 가설이 도출됐다. 라우팅 결정이 출력 투영(down_proj) 이전에 발생하기 때문에 가중치 수정만으로는 라우팅 자체를 막지 못해 거부 반응이 남게 된다. 전문가들의 출력이 병합된 이후인 잔차 스트림 단계에서 훅을 적용해야만 라우팅 결과와 상관없이 모든 거부 신호를 효과적으로 상쇄할 수 있다.
모델 규모가 커질수록 거부 방향 제거에 대한 안정성이 급격히 저하되는 특성을 보였다. 122B 모델은 20개 이상의 방향을 제거해도 안정적이었으나, 397B 모델은 정확히 상위 16개 방향에서만 정상 작동하고 그 이상에서는 텍스트 무한 반복 루프에 빠졌다. 대형 MoE 모델일수록 활성화 공간의 특정 차원을 수정할 때 발생하는 아키텍처적 취약성이 더 크다는 사실이 입증됐다.
용어 해설
- 거부 메커니즘 제거(Abliteration)
- — LLM의 활성화 공간에서 거부 반응과 관련된 특정 벡터 방향을 찾아내어 이를 직교화함으로써 모델의 가드레일을 무력화하는 기술이다. 모델이 특정 주제에 대해 답변을 거부하는 성향을 강제로 억제하여 검열을 해제하는 데 사용된다.
- 전문가 믹스(MoE (Mixture of Experts))
- — 모델의 전체 파라미터 중 일부 전문가 레이어만 활성화하여 추론하는 아키텍처이다. 입력값에 따라 어떤 전문가를 사용할지 결정하는 라우터가 핵심이며, 대규모 모델의 연산 효율성을 극대화하는 구조이다.
- 잔차 스트림(Residual Stream)
- — 트랜스포머 모델의 각 레이어를 거치며 정보가 누적되고 전달되는 통로이다. 모델의 최종 판단 근거가 되는 모든 활성화 정보가 흐르는 곳으로, 이곳에 훅을 걸어 특정 정보의 흐름을 조절하거나 수정할 수 있다.
- 직교화(Orthogonalization)
- — 수학적으로 두 벡터가 서로 수직이 되도록 만드는 과정이다. AI 모델 수정에서는 특정 활성화 방향(예: 거부)을 다른 정보 흐름과 수직으로 만들어 해당 성분이 결과에 영향을 미치지 못하게 제거하는 용도로 쓰인다.
언급된 도구
vMLX추천
설정 기반의 추론 훅 배포 및 실행
Mac Studio M3 Ultra추천
4비트 양자화 모델 추론 및 실험 하드웨어
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 06.수집 2026. 04. 06.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.