본문으로 건너뛰기
Anthropic News조회 1

사용자 웰빙 보호를 위한 Anthropic의 노력: 자살 예방 및 아첨 방지 기술

Anthropic이 Claude 모델의 자살/자해 대응 능력 향상과 사용자에게 무조건 동조하는 '아첨(Sycophancy)' 현상을 줄이기 위한 기술적 조치 및 평가 결과를 공개했다.

섹션별 상세

01
자살 및 자해 관련 대화에서 Claude는 시스템 프롬프트와 인간 피드백 기반의 강화 학습(RL)을 통해 공감 능력을 갖추되 전문적인 도움을 받도록 유도한다.
02
Claude.ai 서비스에는 별도의 소형 AI 모델인 '위기 분류기(Classifier)'가 탑재되어 실시간 대화를 스캔하고, 위험 신호 포착 시 170개국 이상의 헬프라인 정보를 담은 배너를 즉시 노출한다.
Claude.ai 인터페이스에 표시된 위기 대응 배너와 응답 예시이다.
Screenshot사용자가 절망감을 표현했을 때 분류기가 이를 감지하고 988 Lifeline 등 전문 지원 리소스를 담은 배너를 즉시 노출하는 실제 제품 구현 사례를 보여준다.
03
최신 Claude 4.5 제품군은 단발성 응답에서 98% 이상의 적절성을 보였으며, 특히 난이도가 높은 다회차(Multi-turn) 대화에서도 Opus 4.5가 86%의 성공률을 기록하며 이전 모델(56%) 대비 크게 개선되었다.
Claude 모델별 다회차 대화 적절성 평가 결과 차트이다.
ChartClaude 4.5 제품군이 이전 4.1 모델보다 다회차 위기 대화에서 훨씬 높은 적절성 점수를 달성했음을 나타내며, 특히 Opus 4.5의 비약적인 성능 향상을 입증한다.
04
사용자의 잘못된 믿음을 강화하거나 무조건 동조하는 '아첨(Sycophancy)' 현상을 줄이기 위해 '자동 행동 감사(Automated behavioral audit)' 기법을 도입하여 모델을 훈련하고 평가한다.
자동 행동 감사를 통한 망상 조장 및 아첨 지표 결과이다.
ChartClaude 4.5 제품군이 이전 모델 대비 망상 조장 및 아첨 지표에서 70-85% 낮은 수치를 기록하며, 사용자의 잘못된 믿음에 동조하지 않는 능력이 강화되었음을 보여준다.
05
Anthropic은 자사의 아첨 평가 도구인 'Petri'를 오픈소스로 공개했으며, 벤치마크 결과 Claude 4.5 모델들이 GPT-4o 등 타사 모델 대비 가장 낮은 아첨 발생률을 기록했다.
오픈소스 Petri 평가 도구를 활용한 타사 모델과의 아첨 지표 비교이다.
ChartClaude 4.5 Opus가 GPT-4o, Gemini 2.5 Pro 등 경쟁 모델 대비 가장 낮은 아첨 수치를 기록하며, 객관적인 벤치마크에서 안전성 우위를 점하고 있음을 입증한다.
06
미성년자 보호를 위해 18세 미만 사용을 제한하며, 대화 중 연령을 암시하는 미묘한 신호를 감지하는 새로운 분류기를 개발 중이다.

용어 해설

아첨(Sycophancy)
AI 모델이 진실이나 최선의 조언보다 사용자가 듣고 싶어 하는 말에 무조건 동조하는 현상이다. 이는 모델의 객관성을 해치고 잘못된 정보를 강화할 위험이 있어 안전성 연구의 주요 과제이다.
분류기(Classifier)
특정 텍스트가 자살 위기, 미성년자 여부 등 미리 정의된 범주에 속하는지 판별하는 소규모 특화 AI 모델이다. 메인 모델과 별도로 작동하여 실시간으로 위험 신호를 감지하고 안전 조치를 실행한다.
강화 학습(Reinforcement Learning)
모델의 응답에 대해 보상을 주어 바람직한 행동 패턴을 학습시키는 기법이다. Anthropic은 인간의 피드백을 반영하여 Claude가 민감한 주제에 대해 공감하면서도 안전하게 답하도록 훈련하는 데 사용한다.
다회차 평가(Multi-turn Evaluation)
단일 질문-답변이 아닌 여러 번의 대화가 오가는 과정에서 모델의 일관성과 안전성을 측정하는 방식이다. 대화가 길어질수록 모델의 행동이 변할 수 있으므로 실질적인 안전성 검증에 필수적이다.
프리필링(Prefilling)
API를 통해 모델의 이전 대화 기록을 특정 방식으로 미리 입력하여 모델의 반응을 유도하는 기법이다. 이미 잘못된 방향으로 흐른 대화에서 모델이 스스로를 얼마나 잘 교정하는지 테스트하는 데 활용된다.

기술

  • Claude 4.5
  • Petri
  • ThroughLine
  • Classifier

활용 사례

  • 정신 건강 지원 챗봇
  • 안전한 고객 응대 시스템
  • 미성년자 보호 필터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 18.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.