본문으로 건너뛰기

InvertSteer: LLM에서 Activation Steering의 역추정

Activation Steering의 역추정을 통해 화이트박스 제어와 블랙박스 프롬프트 간의 근본적 차이를 밝힌다. 프롬프트 기반 해석가능성이나 안전성 연구가 Activation Steering의 용이성만으로 평가되어서는 안 되며, 화이트박스와 블랙박스 개입을 구분하는 평가 프로토콜이 필요하다고 제시한다.

용어 해설

Activation Steering
활성화 제어를 통해 모델의 내부 활성화를 수정하여 행동 변화를 이끌어내는 기법. 화이트박스 제어에 해당하며 해석가능성 및 안전성 연구에서도 활용된다.
서젝서비티(Surjectivity)
함수 f가 정의역의 모든 원소를 공역의 원소에 대응시키는 성질. 본 연구에서는 Activation Steering이 Forward Pass의 프리이미지를 보장하는지 여부를 다룬다.
프리이미지(Preimage)
주어진 출력 값을 생성하는 입력 값의 모임. Activation Steering의 경우, 특정 활성화 상태를 만들어내는 텍스트 프롬프트의 존재 여부를 의미한다.
화이트박스 제어(White-box Control)
모델의 내부 구조와 동작을 알고 있는 상태에서 수행하는 제어 방법. 본 연구는 이와 대조되는 black-box 프롬프트와의 차이를 강조한다.
블랙박스 프롬핑(Black-box Prompting)
모델의 내부를 알지 못한 채 입력(prompt)만으로 제어를 시도하는 방법. Activation Steering과의 차이를 분석하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 07.수집 2026. 05. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.