TL;DR
기존 선형 표현 가설(LRH)은 직교성을 가정하여 스티어링의 불안정성을 설명하지 못함. 본 연구는 개념 간 중첩을 허용하는 원통형 표현 가설(CRH)을 통해 스티어링의 성공과 실패가 샘플별 국소 기하학적 구조에 기인함을 규명함.
배경
언어 모델의 내부 표현을 조작하여 출력을 제어하는 스티어링 기법의 불안정성을 이론적으로 분석함.
대상 독자
LLM의 내부 작동 원리와 해석 가능성(Interpretability)을 연구하는 AI 연구자 및 엔지니어.
의미 / 영향
LLM 스티어링의 불안정성을 기하학적으로 규명함으로써, 더 정교한 모델 제어 기법 개발의 이론적 토대를 마련함. 향후 스티어링은 단순 벡터 가산이 아닌, 샘플별 국소 기하학을 고려한 적응형 제어 방식으로 발전할 것임.
챕터별 상세
스티어링의 개념과 기존 가설의 한계
원통형 표현 가설(CRH)의 구조
스티어링의 예측 가능성과 한계
실험적 검증과 향후 연구 방향
용어 해설
- Steering
- — 언어 모델의 내부 활성화 벡터를 조작하여 모델의 출력 스타일이나 내용을 제어하는 기법. 주로 특정 개념과 관련된 벡터를 추가하거나 빼는 방식으로 작동함.
- Linear Representation Hypothesis
- — LLM 내부에서 개념들이 선형적인 방향(벡터)으로 표현된다는 가설. 스티어링의 이론적 근거로 널리 사용되나, 개념 간의 직교성을 가정하여 실제 모델의 복잡한 기하학적 구조를 설명하는 데 한계가 있음.
- Cylindrical Representation Hypothesis
- — 기존 선형 가설을 확장하여 개념 간의 중첩을 허용하는 가설. 중심 축(중심 의미 변화)과 이를 둘러싼 법평면(normal plane)으로 구성된 기하학적 구조를 통해 스티어링의 불안정성을 설명함.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
