TL;DR
PCCG-Qwen3-4B는 PCCG-Qwen3-4B의 continuation을 내부 활성화 개입으로 제어하는 재현 가능한 연구 저장소입니다. 연구자는 prompt, 가중치, 생성된 reasoning prefix를 고정하고 block 29에서 2,560차원 활성화 방향을 개입 강도 2.0으로 적용해 GO와 native EOS 사이의 continuation을 전환했습니다. Jacobian Lens로 내부 어휘 신호를 읽고 additive activation intervention의 효과를 측정했으며, GO→EOS와 EOS→GO가 각각 40/40, 비교 정답 trace가 80/80으로 기록됐습니다. 결과와 활성화, fitted lens, 실행 코드, 프로토콜, 해시가 저장소에 포함되고 Python 표준 라이브러리만으로 CPU 재검증이 가능합니다.
섹션별 상세
용어 해설
- Jacobian Lens
- — 모델 내부 활성화와 출력 어휘 사이의 관계를 읽는 분석 기법입니다. 이 연구에서는 특정 블록의 활성화가 생성 결과에 미치는 영향을 확인하기 위해 내부 표현을 어휘 수준의 신호로 변환하는 데 사용합니다. 이를 통해 개입 전후의 생성 경로를 비교할 수 있습니다.
- 활성화 개입(Activation Intervention)
- — 모델이 추론하는 도중 특정 층의 활성화에 방향 벡터를 더하거나 조정하는 방법입니다. 이 연구는 block 29에서 고정된 2,560차원 방향을 생성 직후 적용해 이후 continuation의 변화를 측정합니다. 출력 변화가 해당 내부 신호의 인과적 효과인지 확인하는 데 쓰입니다.
- 연속 생성 제어(Continuation Control)
- — 이미 생성된 접두부 이후에 이어질 토큰이나 종료 행동을 내부 표현 개입으로 바꾸는 기법입니다. PCCG-Qwen3-4B는 같은 prompt와 가중치를 유지한 채 GO와 EOS 사이의 continuation을 전환하도록 설계됐습니다. 생성된 reasoning prefix를 고정하므로 개입이 후속 생성에 미치는 영향을 분리해 관찰할 수 있습니다.
- 인과 효과(Causal Effect)
- — 내부 표현의 특정 요소를 의도적으로 바꾼 뒤 모델 출력이 어떻게 달라지는지 측정하는 개념입니다. 이 저장소는 block 29의 활성화 방향을 더하고 GO→EOS 및 EOS→GO 결과를 비교합니다. 단순한 상관관계가 아니라 개입으로 인한 출력 변화를 확인하는 것이 핵심입니다.
코드 예제
git lfs pull
python verify.pyGit LFS에 저장된 lens 파일을 내려받은 뒤 패키지 해시와 확인 기록을 재검증합니다.
기술
- PCCG-Qwen3-4B
- Jacobian Lens
- Git LFS
- Python standard library
활용 사례
- 모델 내부 표현이 후속 텍스트 생성에 미치는 인과 효과 측정
- GO와 EOS 같은 continuation 행동의 개입 기반 제어
- 활성화 개입 실험의 기록·해시 검증·재현
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.