TL;DR
LLM의 안전 정렬 과정에서 모델이 유해한 요청을 인지하는 것과 실제로 거절하는 메커니즘이 내부적으로 분리되어 있음을 실험적으로 증명한 연구이다. 연구진은 프로빙 기법을 통해 유해성 판단과 거절 반응이 서로 다른 활성화 공간에 존재함을 확인했으며, 스티어링을 통해 유해하다고 판단하면서도 거절하지 않게 하거나 그 반대의 조절이 가능함을 보여주었다. 이는 기존의 안전 학습이 두 개념을 혼동하여 발생하는 과도한 거절 문제를 해결할 수 있는 중요한 기술적 근거를 제공한다. 결과적으로 모델의 내부 표현을 직접 수정함으로써 더 정교한 안전 제어가 가능하다는 점을 시사한다.
챕터별 상세
연구 배경 및 안전 정렬의 한계
안전 정렬은 모델이 유해한 답변을 하지 않도록 만드는 과정이지만, 이 과정이 너무 강하면 무해한 질문도 거절하는 부작용이 생긴다.
유해성과 거절의 분리 가설 제시
프로빙을 통한 내부 표현 분석
코사인 유사도가 낮다는 것은 두 벡터가 서로 직교에 가깝거나 독립적인 방향을 향하고 있어 서로 간섭이 적다는 뜻이다.
활성화 스티어링 실험 및 인과 관계 검증
스티어링은 모델의 뇌 속에서 특정 생각을 강제로 주입하거나 제거하는 것과 유사한 기법이다.
모델별 비교 및 층별 인코딩 특성 분석
결론 및 향후 연구 방향
용어 해설
- Probing
- — 모델의 중간 레이어 활성화 값에서 특정 정보를 추출할 수 있는지 확인하는 분석 기법이다. 선형 분류기를 통해 모델이 내부적으로 유해성이나 거절 의도와 같은 특정 개념을 얼마나 명확하게 인코딩하고 있는지 측정하는 데 사용된다.
- Activation Steering
- — 모델의 추론 과정에서 특정 레이어의 활성화 값에 특정 벡터를 더하거나 빼서 모델의 출력을 제어하는 기법이다. 본 연구에서는 거절 벡터를 조작하여 모델이 유해한 질문에 답변하게 하거나 무해한 질문을 거절하게 만드는 실험적 도구로 활용되었다.
- Safety Alignment
- — LLM이 유해하거나 부적절한 요청에 응답하지 않도록 모델의 행동을 조정하는 학습 과정이다. RLHF나 SFT 등을 통해 수행되며, 모델이 유해성을 인지하고 적절한 거절 반응을 보이도록 만드는 것이 핵심 목표이다.
- Representation Engineering
- — 모델의 가중치 자체를 수정하는 대신 내부 활성화 공간의 표현을 분석하고 조작하여 모델의 행동을 제어하는 연구 분야이다. 모델의 블랙박스 내부를 기하학적으로 해석하고 제어 가능한 요소를 찾아내는 데 중점을 둔다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
