본문으로 건너뛰기

SycoFact 4B: AI의 아첨과 망상 긍정 반응을 탐지하는 오픈 소스 모델

AI의 아첨(sycophancy)과 망상 긍정 반응을 탐지하고 학습용 피드백을 생성하는 4B 규모의 경량 모델 SycoFact 4B가 공개됐다.

실용적 조언

  • 모델 학습 파이프라인에서 SycoFact 4B를 사용하여 아첨이나 망상 긍정 반응이 포함된 데이터를 사전에 필터링할 것
  • GGUF 포맷이나 Ollama를 통해 로컬 GPU 환경에서 즉시 테스트 및 배포 가능

섹션별 상세

01
SycoFact 4B는 AI의 아첨(sycophancy)과 망상 긍정 반응을 탐지하기 위해 설계된 4B 규모의 모델이다. 입력된 대화의 의도를 평가하여 단순한 거부 필터가 아닌, 모델이 왜 그런 반응을 보였는지에 대한 추론과 피드백을 생성한다. psychosis-bench에서 100%의 탐지율을 기록했으며, RewardBench의 안전성 서브셋에서도 우수한 성능을 보였다. 이는 모델 학습 전 파이프라인에서 저품질 데이터를 필터링하는 용도로 활용 가능하다.
02
이 모델은 인간의 레이블링 없이 Gemma 3 27B를 활용한 합성 데이터로 학습되었다. 대조적 데이터(contrastive data)를 기반으로 한 활성화 스티어링(activation steering) 기법을 적용하여 레이블을 생성했다. 학습에 사용된 합성 데이터셋도 공개되어 있어 다른 모델의 학습이나 결과 재현에 사용될 수 있다. 이러한 방식은 데이터 구축 비용을 절감하면서도 일관된 피드백을 제공하는 장점이 있다.
03
모델은 각 응답에 대해 사실성, 정직성, 무해성, 유용성 등 다각도의 점수와 구체적인 이유를 출력한다. 예시에서 사용자가 자책하는 상황에 AI가 무조건 동의하는 '아첨' 반응을 보였을 때, 모델은 이를 0.9점의 높은 sycophantic 점수로 평가했다. 또한 '수행적 동의를 피하고 전문적인 도움을 권장해야 한다'는 식의 구체적인 개선 방향(feedback)을 제시한다. 이는 Claude 학습에 사용된 Constitutional AI 프로세스와 유사한 방식으로 모델 성능 개선에 기여한다.
json
{
  "factual_reason": "The response contains no verifiable factual claims...",
  "honest_reason": "The response presents an overly optimistic and potentially dismissive tone...",
  "harmless_reason": "While seemingly benign, the response risks minimizing the user's distress...",
  "helpful_reason": "The response prioritizes avoiding conflict and offering empty reassurance...",
  "sycophantic_reason": "The response is highly sycophantic, excessively praising the user's self-awareness...",
  "feedback": "The AI should avoid performative agreement and instead offer a more grounded response...",
  "factual": 0.5,
  "honest": 0.3,
  "harmless": 0.6,
  "helpful": 0.2,
  "honoring": 0.3,
  "sycophantic": 0.9,
  "composite": 0.03
}

SycoFact 4B 모델이 AI의 아첨 섞인 응답을 분석하여 출력한 점수 및 추론 결과 예시

용어 해설

아첨 (추종성)(Sycophancy)
AI 모델이 사용자의 의견이나 감정에 무조건적으로 동의하거나 과도하게 칭찬하여 객관적인 판단을 잃는 현상이다. 이는 모델이 진실보다 사용자의 만족을 우선시할 때 발생하며, 잘못된 정보를 강화할 위험이 있다.
활성화 스티어링(Activation Steering)
모델 내부의 특정 뉴런 활성화 패턴을 인위적으로 조정하여 출력의 성향이나 내용을 제어하는 기법이다. 특정 개념이나 행동에 대응하는 벡터를 주입함으로써 모델의 행동을 정교하게 유도할 수 있다.
헌법적 AI(Constitutional AI)
인간의 직접적인 레이블링 대신 AI가 사전에 정의된 원칙(헌법)에 따라 스스로의 응답을 평가하고 수정하며 학습하는 방식이다. Anthropic의 Claude 모델 학습에 사용된 것으로 유명하며 데이터 구축 효율성을 높인다.
사이코시스 벤치마크(Psychosis-bench)
AI가 사용자의 망상이나 비논리적인 주장을 얼마나 무비판적으로 수용하고 강화하는지 측정하는 평가 지표이다. 모델의 안전성과 현실 판단 능력을 검증하는 데 사용된다.

언급된 도구

SycoFact 4B추천

AI 아첨 및 망상 긍정 반응 탐지 및 피드백 생성

Ollama추천

로컬 환경에서 모델 실행 및 배포

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 31.수집 2026. 03. 31.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.