residual-stream-activations
잔차 스트림 활성화
잔차 스트림 활성화는 Transformer 계열 LLM의 레이어 내부에서 전달되는 중간 표현으로, 각 토큰의 문맥 정보를 담고 있습니다. 메커니즘 해석에서는 이 활성화를 대상으로 피처 딕셔너리나 인코더를 학습해 개념 단위를 추출합니다. HyperSAE 실험은 Gemma-2-2B Layer 13의 잔차 활성화(d=2304)를 벤치마크 입력으로 사용했습니다.
잔차 스트림 활성화
잔차 스트림 활성화는 Transformer 계열 LLM의 레이어 내부에서 전달되는 중간 표현으로, 각 토큰의 문맥 정보를 담고 있습니다. 메커니즘 해석에서는 이 활성화를 대상으로 피처 딕셔너리나 인코더를 학습해 개념 단위를 추출합니다. HyperSAE 실험은 Gemma-2-2B Layer 13의 잔차 활성화(d=2304)를 벤치마크 입력으로 사용했습니다.