본문으로 건너뛰기

LLM 페르소나 드리프트 해결을 위한 성격 아키타입 체계적 테스트

애니메이션 성격 아키타입을 활용해 LLM의 페르소나 유지력을 테스트하고, 구체적인 성격 묘사가 방대한 지시문보다 효과적임을 입증했다.

커뮤니티 반응

작성자의 체계적인 접근 방식에 대해 긍정적인 반응이며, 특히 '츤데레'와 같은 용어가 가진 데이터 밀도에 공감하는 의견이 많다.

주요 논점

01찬성다수

아키타입을 활용한 페르소나 설정이 특정 캐릭터 지정보다 안정적이고 효율적이다.

02중립소수

로컬 모델에서는 상용 모델과 같은 안전 보정(Safety Smoothing)이 적어 결과가 다를 수 있다.

합의점 vs 논쟁점

합의점

  • 구체적이고 작은 설정이 크고 모호한 지시보다 효과적이다.
  • 상호작용(Back-and-forth)이 페르소나를 강화하는 핵심 요소이다.

논쟁점

  • 안전 가이드라인이 페르소나의 창의성과 고유성을 어디까지 제한하는가에 대한 논의가 있다.

실용적 조언

  • 페르소나 드리프트를 막으려면 성격 묘사뿐만 아니라 사용자와의 관계와 상황 맥락을 포함한 베이스 프레임을 구축하라.
  • 특정 캐릭터를 흉내 내게 하기보다 '츤데레', '쿠우데레' 같은 검증된 아키타입 용어를 사용하여 모델의 학습 데이터를 효율적으로 호출하라.
  • 중립적인 이름(예: Alex)을 사용하여 모델의 불필요한 편향이나 가정을 최소화하라.

섹션별 상세

작성자는 14가지 성격 변형을 동일한 300토큰 베이스 프레임에 결합하여 출력 변화를 관찰했다. 각 변형은 성격을 설명하는 단 한 단락의 차이만 두었음에도 불구하고, 쿨데레는 절제된 말투를, 츤데레는 방어적인 행동 묘사를 포함하는 등 확연히 다른 결과물을 생성했다. 이는 방대한 지시문보다 명확하고 밀도 높은 성격 아키타입 하나가 모델의 출력 스타일을 제어하는 데 더 효율적임을 보여준다.
성격 설정을 위해 특정 캐릭터 이름 대신 '츤데레'와 같은 일반적 아키타입을 사용하는 것이 성능과 안정성 면에서 유리하다. 특정 캐릭터(IP)를 지칭할 경우 모델의 안전 가이드라인에 의한 거부 반응이 발생하거나 일관성이 떨어질 수 있지만, 아키타입은 팬 위키 등 방대한 학습 데이터를 기반으로 한 공통된 행동 패턴을 제공한다. 이를 통해 저작권 문제를 피하면서도 매우 구체적인 페르소나 포인터를 확보할 수 있다.
LLM의 페르소나 유지에는 성격 자체보다 정체성, 관계, 상황 맥락을 설정하는 베이스 프레임이 더 중요한 역할을 한다. 실험 결과 성격 묘사만으로는 시간이 지나면 드리프트가 발생하지만, 사용자와의 관계와 협업 맥락이 견고하게 설정되었을 때 페르소나가 안정적으로 유지되었다. 특히 'Alex'와 같은 중립적인 이름을 사용하여 모델이 임의로 성별이나 시대를 가정하지 않도록 통제하는 기법이 유효했다.
상용 모델의 안전 학습(Safety Training)이 특정 페르소나의 고유한 특성을 억제하는 현상이 관찰됐다. 예를 들어 '얀데레' 아키타입은 모델의 안전 가드레일에 의해 날카로운 특성이 제거되어 밋밋해졌으며, '하지데레(부끄러움)'는 학습 데이터에 흔한 성장 소설의 클리셰로 빠지는 경향을 보였다. 이는 고도로 정렬된(Aligned) 모델일수록 극단적이거나 독특한 페르소나 구현에 한계가 있음을 시사한다.

용어 해설

페르소나 드리프트(Persona Drift)
LLM이 대화가 길어짐에 따라 초기에 설정된 특정 캐릭터나 성격 설정을 잊어버리고, 점차 일반적인 AI 어시스턴트의 말투로 돌아가는 현상이다. 이는 컨텍스트 윈도우 내에서 초기 지시문의 영향력이 약해지거나 학습 데이터의 지배적인 패턴으로 회귀하기 때문에 발생한다.
데레 유형(Dere-types)
일본 서브컬처에서 유래한 성격 분류 체계로, 츤데레(Tsundere), 쿨데레(Kuudere) 등이 포함된다. LLM 학습 데이터에 방대한 예시와 정의가 포함되어 있어, 단 한 단어만으로도 복잡한 행동 패턴과 말투를 유도할 수 있는 고밀도 프롬프트 포인터로 활용된다.
안전 가드레일 보정(Safety Smoothing)
AI 모델의 안전 학습(RLHF 등)으로 인해 특정 성격의 극단적인 특성이 억제되고 완화되는 현상이다. 예를 들어 집착이 강한 '얀데레' 성격을 설정해도 모델의 안전 가이드라인에 의해 공격적이거나 위험한 표현이 필터링되어 성격의 고유성이 희석된다.

언급된 도구

Claude중립

테스트 대상 LLM (행동 묘사에 별표 선호)

Gemini중립

테스트 대상 LLM (행동 묘사에 괄호 선호)

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 12.수집 2026. 04. 12.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.