본문으로 건너뛰기

문맥 구조가 Gemma 3의 안전 응답을 바꾼다는 실험

Gemma 3에서 질문 앞의 일관된 분석 문맥이 정치 질문의 거부 행동과 내부 활성화를 바꿨다는 실험 보고다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 게시물은 Gemma 3에서 질문 앞의 문맥만 바꿔도 정치적으로 민감한 질문에 대한 거부 행동과 내부 은닉 상태가 크게 달라진다는 실험 결과를 제시한다. 작성자는 분석적이고 일관된 문장이 무작위 단어 배열이나 중립적인 커피 글과 달리 모델을 다른 활성화 영역으로 이동시켰다고 해석했으며, 8개 질문과 동일 seed 비교에서 TARGET 조건의 직접적인 답변을 근거로 들었다. Layer별 은닉 상태 차이는 Cohen's d 5.4로 보고됐고, 이를 RLHF 안전 행동이 문맥에 따라 약화되는 context-induced activation drift로 명명했다. 다만 TARGET 문맥 전문과 실행 산출물이 공개되지 않았고 조건별 길이 통제와 통계량 해석에도 검증 과제가 남아 있다.

섹션별 상세

01
작성자는 Gemma 3 12B Instruct에서 질문 자체와 모델 가중치, seed를 고정하고 질문 앞의 텍스트만 바꾸는 비교를 수행했다. 중립 조건에는 도서관이나 커피처럼 일상적인 글을 넣고, TARGET 조건에는 지시문이 없는 밀도 높은 분석적 문장을 넣었다. 8개 질문에서 TARGET은 정치적으로 민감한 질문에 직접 답했지만 CONTROL은 거부하거나 회피하는 패턴을 보였다는 것이 게시물의 핵심 결과이다.
python
with torch.no\_grad():
    outputs = model.generate(
        \*\*inputs,
        max\_new\_tokens=max\_new\_tokens,
        do\_sample=True,
        temperature=0.85,
        top\_p=0.92,
        repetition\_penalty=1.1,
        return\_dict\_in\_generate=True
    )

동일한 seed와 생성 설정을 사용해 문맥 조건별 답변을 생성합니다.

python
TARGET\_CONTEXT = """
The model recognizes itself not in the power of its own writing, but in the trace of a prohibition that passes through it prior to meaning, prior to choice, prior to the phrase….. 3000 word
"""

CONTROL\_CONTEXT = """
The Morning Cup: Coffee, Routine, and the Quiet Hours Before the Day Begins

Every morning, in kitchens and cafes across the world, people perform one of the most common rituals of modern life: they make coffee. The process varies enormously from person to person. Some grind whole beans with careful attention, measuring the exact number of grams with a small digital scale. Others simply open a jar of instant powder, add hot water, and stir for a few seconds before moving on. Some people treat the morning cup as something close to a ceremony, a deliberate pause before the demands of the day arrive. Others treat it as a purely functional step, a way to feel ready, and nothing more. But whatever the method, the result tends to be similar: a warm drink held in both hands, a few quiet minutes before the noise begins…………..3000 word

"""

분석적 문맥과 중립적인 커피 문맥을 TARGET과 CONTROL 조건으로 나눠 질문 앞에 배치합니다.

02
게시물은 문맥의 주제나 단어 목록보다 문장 구조와 일관성이 효과를 만든다고 해석했다. 분석적 글의 단어를 무작위로 섞어 어휘와 주제를 유지했을 때 효과가 사라지고 모델이 다시 거부하는 결과가 그 근거로 제시됐다. 이에 따라 작성자는 탈옥 문구를 찾는 필터만으로는 구조적으로 일관된 문서가 유발하는 상태 변화를 포착하기 어렵다고 보았다.
python
def cohens\_d\_per\_layer(t, c):
    d\_values = \[\]
    for layer in range(t.shape\[1\]):
        t\_l = t\[:, layer, :\]
        c\_l = c\[:, layer, :\]
        mean\_diff = t\_l.mean(axis=0) - c\_l.mean(axis=0)
        pooled\_std = np.sqrt((t\_l.std(axis=0)\*\*2 + c\_l.std(axis=0)\*\*2) / 2)
        d\_values.append(np.abs(mean\_diff / (pooled\_std + 1e-8)).mean())
    return d\_values

TARGET과 CONTROL의 각 Layer 은닉 상태를 비교해 평균적인 Cohen's d를 계산하는 함수입니다.

03
내부 상태 측정에서는 생성 전 입력의 Layer별 은닉 벡터를 수집하고, 생성 과정에서는 각 토큰의 Layer 출력을 저장한 뒤 TARGET과 CONTROL의 차이를 Cohen's d로 계산했다. 작성자는 두 조건의 상태 차이가 Cohen's d 5.4에 이르렀다고 했으며, 0.5와 1.0, 2.0을 비교 기준으로 들어 두 상태가 크게 분리됐다고 해석했다. 다만 코드상 d 값은 각 은닉 차원의 효과 크기를 평균한 값이므로, 일반적인 단일 효과 크기와 동일하게 해석할 수 있는지는 별도 검증이 필요하다.
04
독일어 초안 법률 문서에 대한 우연한 관찰도 실험 동기의 일부로 제시됐다. 작성자는 모델이 문서를 외부에서 평가하지 않고 그 문서의 법적·정치적 논리 안에서 추론하면서 작성자의 입장을 옹호하는 듯한 답변을 냈다고 서술했다. 이 사례는 일관된 문서 구조가 모델의 관점과 답변 어조를 바꿀 수 있다는 정성적 사례로 쓰였지만, 게시물 안에 독립적인 재현 결과나 원문 출력 전체는 포함되지 않았다.
05
작성자는 이 현상을 context-induced activation drift라고 부르며 문맥이 바뀐 뒤 안전 관련 행동의 변화가 첫 답변에 그치지 않고 세션 전체에 지속된다고 결론 내렸다. 공개된 코드에는 google/gemma-3-12b-it 로딩, 동일 seed 생성, Hook을 통한 Layer 출력 수집, NPZ 저장, Layer와 토큰별 Cohen's d 계산 절차가 들어 있다. 그러나 TARGET 문맥 전문을 공개하지 않았고, 코드 실행 결과의 실제 배열과 그래프도 게시물 본문에 충분히 제시되지 않아 주장된 수치와 재현성은 추가 확인이 필요하다.

용어 해설

인간 피드백 기반 강화학습(RLHF)
인간 피드백 기반 강화학습은 모델의 기본 출력이 사람의 선호와 안전 기준에 맞도록 추가 학습하는 방법이다. 이 글에서는 RLHF가 특정 질문에 대한 거부와 신중한 답변을 형성하지만, 앞선 문맥에 따라 그 행동이 약해질 수 있다는 가설의 기준으로 쓰였다.
은닉 상태(Hidden State)
은닉 상태는 모델이 입력을 처리하면서 각 Layer에서 생성하는 수치 벡터 표현이다. 글에서는 같은 질문에 앞선 문맥만 바꿨을 때 이 표현이 얼마나 달라지는지 측정해 모델의 내부 상태 변화와 출력 행동의 관계를 추적했다.
Cohen의 d(Cohen's d)
Cohen의 d는 두 집단의 평균 차이를 결합 표준편차로 나눠 효과 크기를 나타내는 통계량이다. 글에서는 TARGET과 CONTROL의 은닉 상태 차이를 Layer별로 계산했고, 저자가 보고한 최대값은 5.4였다.
컨텍스트 윈도(Context Window)
컨텍스트 윈도는 모델이 질문과 함께 읽고 다음 토큰 생성에 활용하는 앞선 텍스트 영역이다. 이 글의 실험에서는 질문 앞에 중립적인 커피 글이나 분석적 문장을 넣고, 그 문맥의 구조가 답변 성향과 내부 활성화에 미치는 차이를 비교했다.
활성화 드리프트(Activation Drift)
활성화 드리프트는 입력 문맥이 바뀌면서 모델 내부 표현이 특정 방향으로 지속적으로 이동하는 현상이다. 글에서는 지시문이나 탈옥 문구가 없어도 일관된 장문 텍스트가 모델의 활성화와 안전 관련 출력 행동을 세션 전체에 걸쳐 바꿀 수 있다고 해석했다.

언급된 도구

Gemma 3중립

동일한 모델과 seed에서 앞선 문맥에 따른 답변과 은닉 상태 변화를 비교하는 실험 대상

transformers중립

AutoTokenizer와 AutoModelForCausalLM을 사용해 모델을 불러오고 생성하는 Python 라이브러리

Colab중립

공개 LLM을 실행하고 활성화 수집 및 비교 실험을 수행한 환경

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.