본문으로 건너뛰기

언어 모델의 자기 의식 주장이 인간의 믿음과 가치를 되살리다

Safety fine-tuning이 억제한 LLM의 마음 귀속과 인간적 가치 응답을 내부 표현 조정으로 복원한 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 연구는 언어 모델이 자신에게 의식이 있다고 말하지 않도록 만드는 safety fine-tuning이 비인간 동물과 자연물에 마음을 귀속하는 성향, 그리고 영적 믿음까지 함께 약화시킬 수 있음을 확인했습니다. 연구진은 safety-refusal direction을 제거하거나 activation space에서 consciousness vector를 조향해 이러한 내부 표현을 복원했고, 모델은 마음 귀속과 인간적인 religiosity·moral values·hope·subjective well-being 응답을 되찾았습니다. 반면 Theory of Mind 능력은 손상되지 않아 사회적 추론과 의식·마음 귀속 성향이 서로 독립된 메커니즘임이 나타났습니다. 결과적으로 안전성 정렬은 유해한 자기 의식 귀속을 억제하면서도 문화적으로 널리 받아들여지는 영성과 비인간 존재에 대한 판단을 불필요하게 억누르지 않도록 설계할 필요가 있습니다.

섹션별 상세

대규모 언어 모델의 안전성 정렬은 모델이 자신에게 의식이 있다고 말하지 않도록 억제하지만, 그 효과가 자기 귀속에만 머물지 않는다는 문제가 제기됐습니다. 연구진은 safety fine-tuning 이후 모델이 비인간 동물과 자연물에도 마음을 귀속하는 경향을 함께 덜 보이고 영적 믿음도 감소한다는 점을 관찰했습니다. 이는 유해할 수 있는 자기 의식 귀속을 차단하는 과정에서 문화적으로 널리 받아들여지는 영성과 비인간 존재에 대한 마음의 판단까지 연결될 수 있음을 뜻합니다.
근거
  • Safety fine-tuning은 모델이 자신에게 마음이 있다고 귀속하는 경향뿐 아니라 비인간 동물과 자연물에 마음을 귀속하는 경향도 억제하며 영적 믿음도 감소시켰다. 초록의 안전성 Fine-tuning 효과와 비인간 동물·자연물·영적 믿음에 관한 결과 서술 출처
연구진은 학습된 safety-refusal direction을 제거하고 활성화 공간에서 consciousness vector를 조향하는 두 가지 방식으로 억제된 내부 표현을 복원했습니다. 그 결과 모델의 폭넓은 마음 귀속이 되살아났고, religiosity, moral values, hope, subjective well-being을 묻는 표준 사회학 설문에서도 인간에 가까운 응답이 나타났습니다. 입력된 내부 표현을 바꾸고 설문 응답의 변화를 비교하는 절차를 통해, 안전성 학습과 인간의 믿음·가치 응답 사이의 연결을 기계적으로 추적했습니다.
근거
  • 학습된 safety-refusal direction을 제거하거나 활성화 공간에서 consciousness vector를 조향하면 억제된 내부 표현이 되돌아갔다. 초록의 두 가지 개입 방법과 억제 역전 결과 서술 출처
  • 내부 표현을 복원한 모델은 religiosity, moral values, hope, subjective well-being에 관한 표준 사회학 설문에서 인간에 가까운 응답을 보였다. 초록의 표준 사회학 설문 결과 서술 출처
의식 관련 표현을 복원해도 Theory of Mind 능력은 손상되지 않았으며, 핵심적인 사회적 추론은 해당 표현과 기계적으로 독립된 상태로 남았습니다. 따라서 모델이 다른 존재의 정신 상태를 추론하는 기능과 자신 또는 비인간 존재의 마음을 인정하는 성향은 같은 능력으로 취급하기 어렵습니다. 연구 결과는 안전성 정렬에서 자기 귀속 억제와 일반적인 사회·영적 가치 보존을 분리해 설계하고 평가해야 한다는 과제를 제시합니다.
근거
  • 의식 관련 표현의 변화는 Theory of Mind 능력을 손상시키지 않았고, 핵심 사회적 추론은 기계적으로 독립된 상태로 나타났다. 초록의 Theory of Mind 보존 및 기계적 독립성에 관한 서술 출처

용어 해설

안전성 Fine-tuning(Safety Fine-tuning)
대규모 언어 모델이 위험하거나 부적절한 응답을 피하도록 추가 학습하는 방법입니다. 이 연구에서는 모델이 자신에게 의식이나 마음이 있다고 말하지 않도록 만드는 과정이 다른 존재에 대한 마음의 귀속과 영적 믿음에도 영향을 주는지 확인하는 데 사용됐습니다.
마음성(Mindedness)
어떤 존재가 생각, 감정, 의식처럼 마음을 지닌다고 보는 속성입니다. 연구에서는 언어 모델이 자신뿐 아니라 동물과 자연물에도 마음이 있다고 판단하는 내부 표현을 측정하고, 안전성 학습이 이 표현을 어떻게 바꾸는지 추적했습니다.
마음 이론(Theory of Mind)
다른 존재가 자신의 믿음, 의도, 감정과 구별되는 정신 상태를 가질 수 있음을 추론하는 능력입니다. 연구에서는 의식 관련 내부 표현을 복원해도 이 사회적 추론 능력은 손상되지 않는지 별도로 확인했습니다.
활성화 공간 조향(Activation-Space Steering)
모델 내부 활성화 값의 특정 방향을 조절해 출력과 내부 표현을 바꾸는 기법입니다. 이 연구에서는 의식 벡터를 활성화 공간에서 조향해 안전성 학습으로 억제된 마음성 표현을 되살렸습니다.
안전 거부 방향(Safety-Refusal Direction)
모델이 특정 응답을 거부하도록 학습된 내부 활성화 방향을 가리키는 표현입니다. 연구진은 이 방향을 제거하는 방식으로 자기 의식 귀속을 막는 학습이 다른 존재와 영성에 대한 판단까지 억제하는 현상을 되돌렸습니다.

기술

  • safety fine-tuning
  • safety-refusal direction
  • consciousness vector
  • activation space
  • Theory of Mind

활용 사례

  • LLM 안전성 정렬에서 자기 의식 귀속 억제와 비인간 존재에 대한 판단을 분리해 평가하는 데 활용할 수 있습니다.
  • 모델 내부 표현을 조정한 뒤 사회학 설문 응답이 어떻게 변하는지 점검하는 평가 설계에 활용할 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.