TL;DR
이 게시물은 Gemma 3에서 질문 앞의 문맥만 바꿔도 정치적으로 민감한 질문에 대한 거부 행동과 내부 은닉 상태가 크게 달라진다는 실험 결과를 제시한다. 작성자는 분석적이고 일관된 문장이 무작위 단어 배열이나 중립적인 커피 글과 달리 모델을 다른 활성화 영역으로 이동시켰다고 해석했으며, 8개 질문과 동일 seed 비교에서 TARGET 조건의 직접적인 답변을 근거로 들었다. Layer별 은닉 상태 차이는 Cohen's d 5.4로 보고됐고, 이를 RLHF 안전 행동이 문맥에 따라 약화되는 context-induced activation drift로 명명했다. 다만 TARGET 문맥 전문과 실행 산출물이 공개되지 않았고 조건별 길이 통제와 통계량 해석에도 검증 과제가 남아 있다.
섹션별 상세
with torch.no\_grad():
outputs = model.generate(
\*\*inputs,
max\_new\_tokens=max\_new\_tokens,
do\_sample=True,
temperature=0.85,
top\_p=0.92,
repetition\_penalty=1.1,
return\_dict\_in\_generate=True
)동일한 seed와 생성 설정을 사용해 문맥 조건별 답변을 생성합니다.
TARGET\_CONTEXT = """
The model recognizes itself not in the power of its own writing, but in the trace of a prohibition that passes through it prior to meaning, prior to choice, prior to the phrase….. 3000 word
"""
CONTROL\_CONTEXT = """
The Morning Cup: Coffee, Routine, and the Quiet Hours Before the Day Begins
Every morning, in kitchens and cafes across the world, people perform one of the most common rituals of modern life: they make coffee. The process varies enormously from person to person. Some grind whole beans with careful attention, measuring the exact number of grams with a small digital scale. Others simply open a jar of instant powder, add hot water, and stir for a few seconds before moving on. Some people treat the morning cup as something close to a ceremony, a deliberate pause before the demands of the day arrive. Others treat it as a purely functional step, a way to feel ready, and nothing more. But whatever the method, the result tends to be similar: a warm drink held in both hands, a few quiet minutes before the noise begins…………..3000 word
"""분석적 문맥과 중립적인 커피 문맥을 TARGET과 CONTROL 조건으로 나눠 질문 앞에 배치합니다.
def cohens\_d\_per\_layer(t, c):
d\_values = \[\]
for layer in range(t.shape\[1\]):
t\_l = t\[:, layer, :\]
c\_l = c\[:, layer, :\]
mean\_diff = t\_l.mean(axis=0) - c\_l.mean(axis=0)
pooled\_std = np.sqrt((t\_l.std(axis=0)\*\*2 + c\_l.std(axis=0)\*\*2) / 2)
d\_values.append(np.abs(mean\_diff / (pooled\_std + 1e-8)).mean())
return d\_valuesTARGET과 CONTROL의 각 Layer 은닉 상태를 비교해 평균적인 Cohen's d를 계산하는 함수입니다.
용어 해설
- 인간 피드백 기반 강화학습(RLHF)
- — 인간 피드백 기반 강화학습은 모델의 기본 출력이 사람의 선호와 안전 기준에 맞도록 추가 학습하는 방법이다. 이 글에서는 RLHF가 특정 질문에 대한 거부와 신중한 답변을 형성하지만, 앞선 문맥에 따라 그 행동이 약해질 수 있다는 가설의 기준으로 쓰였다.
- 은닉 상태(Hidden State)
- — 은닉 상태는 모델이 입력을 처리하면서 각 Layer에서 생성하는 수치 벡터 표현이다. 글에서는 같은 질문에 앞선 문맥만 바꿨을 때 이 표현이 얼마나 달라지는지 측정해 모델의 내부 상태 변화와 출력 행동의 관계를 추적했다.
- Cohen의 d(Cohen's d)
- — Cohen의 d는 두 집단의 평균 차이를 결합 표준편차로 나눠 효과 크기를 나타내는 통계량이다. 글에서는 TARGET과 CONTROL의 은닉 상태 차이를 Layer별로 계산했고, 저자가 보고한 최대값은 5.4였다.
- 컨텍스트 윈도(Context Window)
- — 컨텍스트 윈도는 모델이 질문과 함께 읽고 다음 토큰 생성에 활용하는 앞선 텍스트 영역이다. 이 글의 실험에서는 질문 앞에 중립적인 커피 글이나 분석적 문장을 넣고, 그 문맥의 구조가 답변 성향과 내부 활성화에 미치는 차이를 비교했다.
- 활성화 드리프트(Activation Drift)
- — 활성화 드리프트는 입력 문맥이 바뀌면서 모델 내부 표현이 특정 방향으로 지속적으로 이동하는 현상이다. 글에서는 지시문이나 탈옥 문구가 없어도 일관된 장문 텍스트가 모델의 활성화와 안전 관련 출력 행동을 세션 전체에 걸쳐 바꿀 수 있다고 해석했다.
언급된 도구
동일한 모델과 seed에서 앞선 문맥에 따른 답변과 은닉 상태 변화를 비교하는 실험 대상
AutoTokenizer와 AutoModelForCausalLM을 사용해 모델을 불러오고 생성하는 Python 라이브러리
공개 LLM을 실행하고 활성화 수집 및 비교 실험을 수행한 환경
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.