본문으로 건너뛰기

PCCG-Qwen3-4B 연속 생성 제어

PCCG-Qwen3-4B가 고정된 활성화 방향으로 GO와 EOS 사이의 continuation을 전환한 재현 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

PCCG-Qwen3-4B는 PCCG-Qwen3-4B의 continuation을 내부 활성화 개입으로 제어하는 재현 가능한 연구 저장소입니다. 연구자는 prompt, 가중치, 생성된 reasoning prefix를 고정하고 block 29에서 2,560차원 활성화 방향을 개입 강도 2.0으로 적용해 GO와 native EOS 사이의 continuation을 전환했습니다. Jacobian Lens로 내부 어휘 신호를 읽고 additive activation intervention의 효과를 측정했으며, GO→EOS와 EOS→GO가 각각 40/40, 비교 정답 trace가 80/80으로 기록됐습니다. 결과와 활성화, fitted lens, 실행 코드, 프로토콜, 해시가 저장소에 포함되고 Python 표준 라이브러리만으로 CPU 재검증이 가능합니다.

섹션별 상세

01
PCCG-Qwen3-4B는 생성 중간의 continuation을 모델 재학습이나 prompt 변경 없이 조절하는 실험 대상으로 구성됐습니다. 연구자는 prompt, 가중치, 생성된 reasoning prefix를 고정한 뒤 모델이 이어서 생성할 부분에만 개입했습니다. 이 조건은 출력 차이를 입력 변화가 아니라 내부 활성화 조정과 연결하기 위한 실험 설계입니다.
02
개입은 block 29에서 모델 활성화에 하나의 고정된 2,560차원 방향을 더하는 방식으로 이뤄졌습니다. 생성 직후 intervention strength 2.0을 적용하고, Jacobian Lens로 내부 표현을 어휘 수준의 신호로 읽어 continuation 변화를 추적했습니다. 그 결과 GO 뒤 native EOS가 나오도록 하는 GO→EOS와 EOS→GO 두 방향의 제어 기록이 만들어졌습니다.
03
확인 실험에서는 GO→EOS와 EOS→GO가 각각 40/40의 결과를 기록했고, 생성 비교 trace와 답변의 정답성은 80/80으로 나타났습니다. 개입을 하지 않은 replay도 80/80을 기록했으며, 통제 조건은 640/640으로 유지됐습니다. 같은 prompt와 모델 조건에서 continuation만 바꿨다는 점이 내부 방향의 효과를 검증하는 근거가 됩니다.
04
저장소에는 전체 study records, logits, activations, fitted lens, fixed direction과 실행된 연구 코드가 함께 들어 있습니다. protocol 디렉터리에는 prompt, case set, 모델 qualification record, 재현 설정이 있고 SHA256SUMS에는 패키지 파일 해시가 담겼습니다. Git LFS로 lens를 받은 뒤 Python 표준 라이브러리 기반의 verify.py를 CPU에서 실행할 수 있어 결과 재검증 절차가 구체화돼 있습니다.

용어 해설

Jacobian Lens
모델 내부 활성화와 출력 어휘 사이의 관계를 읽는 분석 기법입니다. 이 연구에서는 특정 블록의 활성화가 생성 결과에 미치는 영향을 확인하기 위해 내부 표현을 어휘 수준의 신호로 변환하는 데 사용합니다. 이를 통해 개입 전후의 생성 경로를 비교할 수 있습니다.
활성화 개입(Activation Intervention)
모델이 추론하는 도중 특정 층의 활성화에 방향 벡터를 더하거나 조정하는 방법입니다. 이 연구는 block 29에서 고정된 2,560차원 방향을 생성 직후 적용해 이후 continuation의 변화를 측정합니다. 출력 변화가 해당 내부 신호의 인과적 효과인지 확인하는 데 쓰입니다.
연속 생성 제어(Continuation Control)
이미 생성된 접두부 이후에 이어질 토큰이나 종료 행동을 내부 표현 개입으로 바꾸는 기법입니다. PCCG-Qwen3-4B는 같은 prompt와 가중치를 유지한 채 GO와 EOS 사이의 continuation을 전환하도록 설계됐습니다. 생성된 reasoning prefix를 고정하므로 개입이 후속 생성에 미치는 영향을 분리해 관찰할 수 있습니다.
인과 효과(Causal Effect)
내부 표현의 특정 요소를 의도적으로 바꾼 뒤 모델 출력이 어떻게 달라지는지 측정하는 개념입니다. 이 저장소는 block 29의 활성화 방향을 더하고 GO→EOS 및 EOS→GO 결과를 비교합니다. 단순한 상관관계가 아니라 개입으로 인한 출력 변화를 확인하는 것이 핵심입니다.

코드 예제

bash
git lfs pull
python verify.py

Git LFS에 저장된 lens 파일을 내려받은 뒤 패키지 해시와 확인 기록을 재검증합니다.

기술

  • PCCG-Qwen3-4B
  • Jacobian Lens
  • Git LFS
  • Python standard library

활용 사례

  • 모델 내부 표현이 후속 텍스트 생성에 미치는 인과 효과 측정
  • GO와 EOS 같은 continuation 행동의 개입 기반 제어
  • 활성화 개입 실험의 기록·해시 검증·재현
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.