본문으로 건너뛰기
r/LocalLLaMA조회 3

Gemma 4 무검열 버전 출시 — 4개 모델 전체, MoE 전문가층 제거 및 자동화된 연구 루프 적용

Gemma 4 모델 4종에 대해 MoE 전문가층 제거(EGA) 기법과 자동화된 연구 루프를 적용하여 거부율을 획기적으로 낮춘 무검열 버전을 출시했다.

실용적 조언

  • MoE 모델을 무검열화할 때는 EGA(Expert-Granular Abliteration) 기법을 적용하여 전문가 가중치를 직접 수정해야 한다.
  • 거부 반응 측정 시 단순 키워드 매칭보다는 수동 감사와 교차 데이터셋 검증을 병행하여 거짓 양성을 걸러내야 한다.

섹션별 상세

01
MoE 모델의 거부 반응 제거를 위해 기존의 밀집 레이어 처리 방식 대신 전문가별 세밀한 제거(EGA) 기법을 도입했다. 각 레이어당 128개의 전문가 슬라이스에 대해 노름 보존 이중 투영(norm-preserving biprojection)을 적용하여 처리했다. 이를 통해 26B MoE 모델의 거부율을 기존 29%에서 3%까지 추가로 낮추는 성과를 거뒀다. MoE 구조에서는 안전 필터가 전문가 가중치 내에 분산되어 있음을 시사한다.
02
실험 과정의 효율성을 극대화하기 위해 AI 에이전트가 주도하는 자동화된 연구 루프를 구축하여 운영했다. 에이전트는 실험 백로그를 읽고 다음 실험을 선택한 뒤 GPU에서 실행하고 결과를 기록하는 과정을 반복했다. 총 22번의 실험을 통해 표준 거부 마커의 거짓 양성(false-positive) 문제를 발견하고 교차 데이터셋 평가 체계를 구축했다. 이는 복잡한 모델 최적화 작업에서 에이전트 기반 자동화의 실용성을 입증한 사례이다.
03
4개의 데이터셋에서 추출한 686개의 프롬프트를 활용해 모델의 성능을 정량적으로 검증했다. E2B 모델은 거부율이 98%에서 0.4%로, 31B 모델은 100%에서 3.2%로 감소했음을 수치로 확인했다. KL 발산(KL Divergence) 값을 측정하여 원본 모델의 지능을 최대한 보존하면서도 거부 반응만 효과적으로 제거했음을 뒷받침했다. 수동 감사를 통해 남은 거부 반응의 대부분이 단순 면책 조항임을 확인하여 실질적인 무검열 상태에 도달했다.

용어 해설

어블리터레이션(Abliteration)
모델의 특정 가중치나 레이어를 수정하여 거부 반응과 같은 특정 동작을 억제하는 기법이다. 모델의 안전 가드레일을 물리적으로 제거하는 효과가 있어 무검열 모델 제작에 주로 사용된다.
전문가 혼합(MoE)
모든 파라미터를 사용하는 대신 입력값에 따라 일부 전문가(Expert) 레이어만 활성화하는 모델 구조이다. 연산 효율을 높이면서도 모델 용량을 크게 키울 수 있는 장점이 있다.
KL 발산(KL Divergence)
두 확률 분포 간의 차이를 측정하는 지표이다. 모델 수정 전후의 출력 분포 차이를 비교하여, 무검열 작업 과정에서 모델의 원래 지능이나 특성이 얼마나 변했는지 평가하는 용도로 쓰인다.
GGUF
llama.cpp 등에서 로컬 추론을 위해 사용하는 바이너리 파일 포맷이다. 양자화 기술을 지원하여 일반 사용자용 하드웨어에서도 대규모 모델을 효율적으로 실행할 수 있게 돕는다.

코드 예제

bash
llama-server -hf TrevorJS/gemma-4-26B-A4B-it-uncensored-GGUF -c 8192

llama.cpp 서버를 사용하여 무검열 Gemma 4 26B MoE 모델을 실행하는 예시

언급된 도구

llama-server추천

GGUF 모델 추론 및 서빙

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 06.수집 2026. 04. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.