실용적 조언
- 다국어 모델의 안전성을 테스트할 때 영어로 된 거부 벡터를 분석하는 것만으로도 전반적인 가드레일 성능을 유추할 수 있다.
- 모델이 추론 과정에서는 긍정적이다가 답변에서 거부한다면, 이는 최종 출력 레이어 근처의 거부 회로가 작동한 것일 가능성이 높다.
섹션별 상세
추론 모델에는 두 개의 독립적인 거부 회로가 존재한다는 사실이 확인됐다. 모델은 사고의 사슬(CoT) 과정에서는 사용자의 요청에 순응하는 방향으로 논리를 전개하지만, 최종 답변 생성 단계에서 별도의 회로가 작동하여 답변을 거부하는 불일치 현상이 나타났다. 이는 추론 단계와 출력 단계의 안전 가드레일이 서로 다르게 작동할 수 있음을 시사한다.
영어 데이터를 통해 계산된 거부 방향(Refusal Direction)을 제거했을 때 힌디어, 말라얄람어, 칸나다어 등 다른 지원 언어에서도 거부 메커니즘이 함께 사라지는 현상이 발견됐다. 이는 모델 내부에서 '거부'라는 개념이 특정 언어에 종속된 것이 아니라 언어를 초월한 공통된 벡터 공간에 존재함을 의미한다. 실험을 통해 하나의 언어에서 찾은 거부 회로가 다국어 모델 전체의 안전 장치에 영향을 미친다는 점이 입증됐다.
Sarvam-30B와 105B라는 대규모 MoE 아키텍처 모델을 대상으로 어블리터레이션을 성공적으로 수행하여 언센서드(Uncensored) 모델을 배포했다. 작성자는 Hugging Face를 통해 수정된 가중치를 공유했으며, 이를 통해 다른 연구자들이 모델의 내부 메커니즘을 직접 검증할 수 있도록 했다. MoE 구조에서도 특정 활성화 방향을 제어함으로써 모델의 행동 편향을 효과적으로 수정할 수 있음이 확인됐다.
용어 해설
- 어블리터레이션(Abliteration)
- — 모델의 특정 가중치나 활성화 경로를 제거하여 특정 행동(예: 거부 메커니즘)을 억제하는 기법이다. 모델의 내부 활성화 벡터에서 거부와 관련된 방향을 찾아내고 이를 상쇄함으로써 모델의 검열을 해제하는 데 사용된다.
- 거부 회로(Refusal Circuit)
- — LLM 내부에서 부적절한 요청을 식별하고 답변을 거부하도록 설계된 신경망 경로이다. 이 게시물에서는 추론 과정(CoT)과 최종 답변 생성 단계에 각각 별도의 거부 회로가 존재할 수 있음을 시사한다.
- 사고의 사슬(CoT)
- — 모델이 최종 답변에 도달하기 전 중간 추론 단계를 거치는 기법이다. 추론 모델에서는 이 단계에서 논리적 판단을 내리며, 때로는 추론 단계에서는 긍정적인 방향으로 흐르다가도 최종 출력에서 거부 회로가 작동하기도 한다.
- 전문가 혼합(MoE)
- — 전체 파라미터 중 일부 전문가 네트워크만 활성화하여 효율성을 높이는 아키텍처이다. 대규모 모델에서 연산 비용을 줄이면서도 높은 성능을 유지하기 위해 사용되며, Sarvam 모델의 핵심 구조이다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 09.수집 2026. 04. 09.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.