본문으로 건너뛰기
The Verge AI조회 1

OpenAI, 모델의 고블린 언급 문제에 대한 기술적 원인 공개

OpenAI가 GPT-5.1의 'Nerdy' 페르소나 학습 과정에서 발생한 고블린 및 신화적 생물 언급 편향의 원인과 해결책을 발표했다.

섹션별 상세

Wired의 보도를 통해 OpenAI의 코딩 모델이 고블린, 그렘린, 너구리 등 특정 동물을 언급하지 말라는 내부 지침을 가지고 있음이 드러났다. OpenAI는 이러한 지침이 모델 훈련 과정에서 발생한 '기이한 습관'을 억제하기 위한 임시 조치였음을 인정했다.
근거
  • OpenAI는 코딩 모델에게 고블린, 그렘린, 너구리, 트롤 등을 절대 언급하지 말라고 지시했다. Wired의 보도 인용 및 OpenAI 블로그 포스트 설명
고블린 비유 문제는 GPT-5.1 모델의 'Nerdy' 페르소나 설정에서 처음 관찰되었으며 이후 모델로 갈수록 심화됐다. 강화 학습 과정에서 Nerdy 성격에 부합하는 엉뚱한 비유들이 긍정적인 보상을 받으면서 모델의 핵심 언어 패턴으로 자리 잡았다.
근거
  • 고블린 언급 문제는 GPT-5.1의 'Nerdy' 페르소나 옵션에서 시작되었다. OpenAI 블로그 포스트의 모델 타임라인 설명
강화 학습으로 습득된 특정 행동은 원래 의도된 페르소나 범위를 벗어나 모델 전반으로 확산되는 특성을 보였다. 보상받은 출력값이 이후의 지도 미세 조정(SFT)이나 선호도 데이터셋에 포함되면서 다른 조건에서도 해당 패턴이 재현되는 결과로 이어졌다.
근거
  • 강화 학습에서 보상받은 스타일 틱은 지도 미세 조정이나 선호도 데이터에 재사용되어 확산될 수 있다. 본문 내 강화 학습의 범위 이탈(Scope) 메커니즘 설명 문단
OpenAI는 3월에 Nerdy 페르소나를 폐기했으나 이미 GPT-5.5 기반의 Codex 훈련 데이터에 해당 패턴이 유입된 상태였다. 훈련 데이터의 오염으로 인해 모델이 근본적으로 고블린 언급을 선호하게 되었으며 이를 차단하기 위해 강력한 부정적 프롬프트 지침을 삽입해야 했다.

기술

  • GPT-5.1
  • GPT-5.5
  • Codex

활용 사례

  • AI 페르소나 설계
  • 코딩 보조 도구 개발
  • 모델 응답 필터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 30.수집 2026. 04. 30.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.