본문으로 건너뛰기

LLM 스타일 프롬프트의 내부 작동 방식

style prompt의 문구 차이가 LLM 내부 상태와 출력 문체를 얼마나 다르게 바꾸는지 gemma-2-2b-it으로 측정한 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 “Please remove all mannered prose” 같은 style prompt가 LLM의 출력에 미치는 영향이 문구의 인간적 의미만으로 예측하기 어렵다는 문제에서 출발합니다. 저자는 Apple M3 Pro와 18 GB RAM에서 실행 가능한 gemma-2-2b-it에 IFEval의 538개 base prompt를 넣고, 11개 스타일 클러스터와 대조군을 결합해 residual state, logit, stylometry를 비교했습니다. 비슷한 의미로 묶은 문구도 같은 클러스터 안에서 효과가 크게 갈렸고, plain과 ornate처럼 반대되는 지시는 중간층에서 잠시 같은 방향을 보이다가 후반층에서 반대 출력으로 갈라졌습니다. plain 프롬프트의 일관성은 과제 유형별로 ρ=0.217에서 0.353까지 달랐으며, tone_friendly는 plain보다 모든 가독성 지표에서 읽기 쉬운 결과를 냈습니다. 따라서 수작업 prompt engineering은 과제와 문구에 민감한 방식으로 작동하며, 모델 문서에 style prompt별 정량 사양을 포함해야 한다는 결론으로 이어집니다.

섹션별 상세

01
저자는 “Please be concise”나 “avoid em dashes and semicolons”처럼 출력 문체를 조정하는 짧은 지시가 실제로는 예측하기 어렵게 작동한다는 문제를 제기합니다. 특히 사람이 비슷하다고 판단하는 문구가 모델에는 서로 다른 방향의 변화로 해석될 수 있고, 하나의 지시가 생성·질의응답·요약 같은 여러 과제에서 동일하게 작동하지 않을 수 있습니다. 이런 불확실성을 줄이려면 특정 업무용 평가 세트가 없어도 prompt modifier가 출력에 미치는 변화를 정량적으로 기록할 필요가 있다는 문제의식이 실험 전체를 이끕니다.
02
저자는 Apple M3 Pro와 18 GB RAM에서 다룰 수 있는 open-weight 모델로 gemma-2-2b-it을 선택했습니다. IFEval의 base prompt 538개를 Generation 333개, Open QA 69개, Closed QA 45개, Rewrite 45개, Brainstorming 31개, Summarization 15개로 나누고, 각 prompt 앞에 스타일 지시를 붙였습니다. 스타일 지시는 no style prompt와 placebo를 포함해 plain, ornate, brief, tokens, verbose, tone_formal, tone_friendly, cot, direct, careful, careless의 11개 클러스터로 구성했으며 각 클러스터에는 사람이 같은 효과를 의도한 세 문구가 들어갔습니다.
03
Transformer의 각 decoder block은 입력 토큰마다 2304차원 상태를 출력하고, 전체 입력을 볼 수 있는 마지막 토큰의 벡터가 다음 block으로 전달됩니다. 저자는 이 벡터에서 각 style prompt의 상태를 전체 스타일 평균과 뺀 diff를 계산한 뒤, 두 diff 사이의 cosine similarity로 프롬프트 효과의 방향을 비교했습니다. 동시에 생성 직전 첫 토큰의 logit 분포에서도 스타일별 평균 차이를 계산해 내부 상태 변화가 실제 출력 공간의 변화와 연결되는지 확인했습니다.
04
PCA로 투영한 결과 세 주성분이 출력층 변동의 29%, 다른 층 변동의 최대 36%만 설명했지만 스타일 클러스터 간 분리는 관찰됐습니다. plain과 ornate는 초기 layer에서 cosine similarity가 0.918까지 올라갔지만 layer 26에서는 -0.513으로 떨어졌고, tone_formal과 tone_friendly도 0.668에서 -0.618로 바뀌었습니다. 이는 초기 층이 두 프롬프트의 공통 의미와 단어를 처리한 뒤 후반 층에서 서로 다른 출력 계획으로 전개될 수 있음을 시사합니다.
05
Logit Lens로 layer 24의 평균 diff를 토큰으로 변환하자 plain은 “basic”, “plain”, “straight” 같은 토큰과 연결됐고 ornate는 “Dearest”, “doth”, “esteemed” 같은 토큰과 연결됐습니다. tone_friendly는 “hey”, “okay”, “guys”가, tone_formal은 “formal”, “esteemed”, “distinguished”가 상위 토큰에 포함됐습니다. 중간층 토큰이 곧 최종 출력은 아니지만, 스타일 지시가 단순한 표면 문구가 아니라 특정 어휘와 표현 방향을 내부적으로 활성화한다는 정황을 제공합니다.
06
같은 클러스터에 속한 세 문구도 모델 내부에서 항상 비슷한 효과를 만들지는 않았습니다. plain 세 문구 사이의 최종층 cosine similarity는 0.45에서 0.81이었고, brief 세 문구는 0.56에서 0.92, careless 세 문구는 일부 쌍에서 -0.04까지 떨어졌습니다. 반면 ornate 세 문구는 0.74에서 0.83, tone_friendly 세 문구는 0.88에서 0.96으로 비교적 가까웠으므로, 인간에게 유사한 의미라는 판단만으로 프롬프트를 대체하기 어렵습니다.
07
반대 축의 프롬프트가 항상 수학적으로 정확한 반대 벡터가 되는 것도 아니었습니다. brief와 verbose는 최종층에서 대체로 음의 유사도를 보였고 plain과 ornate도 반대 방향에 놓였지만, careful과 careless는 여러 layer에서 양의 유사도를 유지하다가 출력층에서 -0.151로 끝났습니다. no style prompt와 placebo는 최종층 cosine similarity 0.938로 매우 가까웠고 verbose 클러스터와도 가까워, 모델의 기본 응답이 이미 비교적 장황한 방향에 있다는 결과와 맞닿았습니다.
08
스타일 효과의 과제 간 일관성을 평균 효과의 제곱 크기를 개별 효과 크기의 평균으로 나눈 ρ로 정의한 결과, direct는 0.123, careful은 0.135, brief는 0.153, plain은 0.244, tone_friendly는 0.437, ornate는 0.55를 기록했습니다. ornate 계열은 과제 맥락이 달라도 비슷한 장식적 표현을 반복해 더 높은 일관성을 보였다는 해석이 제시됐습니다. plain 효과를 과제 유형별로 나누면 Closed QA ρ=0.217, Rewrite ρ=0.244, Generation ρ=0.277, Open QA ρ=0.318, Summarization ρ=0.344, Brainstorming ρ=0.353으로 차이가 났지만, Generation 표본이 333개로 가장 많아 전체 값에 큰 영향을 줬습니다.
09
실제 생성 문체를 Flesch reading ease, 음절 수, 문자 수, 3음절 이상 단어 비율, 쉼표 빈도, Guiraud lexical richness, 단어 수로 비교한 결과 plain, brief, direct가 대체로 읽기 쉬운 분포에 놓였습니다. tone_friendly는 모든 가독성 지표에서 plain보다 읽기 쉬웠고, careful은 placebo와 거의 겹쳤으며, verbose는 placebo보다 단어 수가 많았지만 다른 지표에서는 placebo와 가까웠습니다. 과제 유형별 비교에서는 어휘 선택 관련 지표가 상대적으로 안정적이었고 문장 구조 관련 지표는 과제 자체의 영향을 크게 받아 plain 효과의 변동을 키웠습니다.
10
저자는 style prompt 대신 steering vector를 사용해 같은 현상을 재현하려 했지만, 이 실험에서는 원래의 style prompt만큼 일관되거나 유용한 결과를 얻지 못했습니다. 전체 결과는 prompt engineering이 개별 prompt에서 잘 작동하는 것처럼 보여도 문구, 과제 유형, 모델 내부 처리 단계에 따라 효과가 달라질 수 있음을 보여줍니다. 따라서 모델 문서에 style prompt와 추가 context가 출력에 미치는 영향을 기계 부품의 force/deformation curve처럼 정량 사양으로 제공해야 한다는 결론으로 이어집니다.

이미지 분석

스타일 프롬프트 클러스터와 모델 출력 방향의 관계를 오각형 형태의 연결망으로 표현한 다이어그램입니다.
Diagram

이미지는 plain, ornate, brief, verbose, formal, friendly, direct, careful, careless, placebo 같은 스타일 축을 원형으로 배치하고 각 프롬프트 사이의 연결을 선으로 나타냅니다. 기사에서 계산한 프롬프트별 내부 상태 방향과 클러스터 간 유사성 개념을 시각적으로 압축한 자료로, 인간이 비슷하다고 느끼는 문구도 모델 공간에서는 여러 방향으로 분산될 수 있다는 핵심 결과와 연결됩니다. 장식적인 연금술 도식의 형태를 취했지만, 중심의 문구와 주변 스타일 이름이 실험에서 사용한 출력 성향을 직접 가리킵니다.

스타일 프롬프트 클러스터와 모델 출력 방향의 관계를 오각형 형태의 연결망으로 표현한 다이어그램입니다.

용어 해설

활성값 조향(Activation Steering)
모델 내부의 중간 활성값을 특정 방향으로 이동시켜 출력 성향을 바꾸는 기법입니다. 이 글에서는 스타일 프롬프트가 각 Transformer block의 residual state를 어떻게 움직이는지 비교하는 분석 틀로 활용합니다. 프롬프트 자체를 바꾸는 대신 내부 상태의 변화 방향과 크기를 측정한다는 점이 핵심입니다.
Residual Stream
Transformer block 사이를 흐르며 각 층의 계산 결과가 누적되는 벡터 상태입니다. 이 글에서는 전체 입력을 볼 수 있는 마지막 토큰의 2304차원 상태를 스타일 프롬프트의 영향 측정값으로 사용합니다. 스타일별 상태 차이의 cosine similarity를 계산해 프롬프트가 모델의 출력을 어느 방향으로 밀어내는지 비교합니다.
Logit Lens
모델 중간층의 내부 벡터를 최종 decoding 및 unembedding 층에 통과시켜 해당 시점에서 선호되는 토큰을 추정하는 기법입니다. 글에서는 style prompt의 평균 차이 벡터를 layer 24에서 토큰으로 변환해 각 프롬프트가 유도하는 의미적 방향을 읽습니다. 실제 생성 결과와 동일하지는 않지만 중간층의 표현을 해석하는 단서로 사용됩니다.
코사인 유사도(Cosine Similarity)
두 벡터가 같은 방향을 가리키는 정도를 각도로 측정하는 방법입니다. 이 글에서는 스타일 프롬프트가 base prompt의 내부 상태와 첫 토큰 logit에 유도한 변화 벡터 사이의 유사도를 계산합니다. 값이 높으면 두 프롬프트가 모델을 비슷한 방향으로 이동시키고, 음수면 반대 방향의 출력 성향을 시사합니다.
문체 통계 분석(Stylometry)
텍스트의 문체를 단어와 문장 특성의 정량 지표로 측정하는 방법입니다. 글에서는 Flesch reading ease, 음절 수, 문자 수, 다음절 단어 비율, 쉼표 빈도, Guiraud lexical richness, 단어 수를 사용해 스타일 프롬프트의 출력 변화를 비교합니다. 내부 상태 측정과 달리 실제 생성 텍스트의 읽기 쉬움과 어휘 특성을 직접 평가합니다.

기술

  • gemma-2-2b-it
  • IFEval
  • PCA
  • Logit Lens
  • RMSNorm
  • Softmax
  • Flesch reading ease
  • Guiraud lexical richness
  • MDS

활용 사례

  • LLM 응답 문체 조정
  • Prompt modifier 평가
  • 모델 문서의 정량적 프롬프트 사양
  • 과제 유형별 출력 일관성 측정
  • Transformer 내부 상태 해석

언급된 리소스

논문Improving Instruction-Following through Activation Steering
문서The Key of Solomon
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.