TL;DR
자동화된 행동 감사에서 네 개 모델의 오정렬 행동 비율을 비교한 결과 Sonnet 4.6이 2.89로 가장 높은 비율을 보였고 Mythos Preview는 1.95로 가장 낮았다. Opus 4.8은 2.10, Sonnet 5는 2.53으로 Sonnet 5는 Sonnet 4.6보다 전반적으로 오정렬이 줄었지만 Mythos Preview와 Opus 4.8보다는 높은 위치에 있었다. 차트는 각 평균값과 오차범위를 함께 제시하여 상대적 차이를 정량적으로 확인할 수 있으며 세부 시나리오와 개별 행동별 결과는 Sonnet 5 System Card의 해당 섹션을 통해 확인할 수 있다.
섹션별 상세
이미지 분석

이미지는 자동화된 행동 감사로 측정한 평균 점수를 시각화하여 모델 간 상대적 안전성 차이를 전달한다. 각 막대 위에 평균값(2.89, 1.95, 2.10, 2.53)이 적혀 있어 수치 비교가 즉각적으로 가능하며 오차막대는 각 평균의 불확실성을 보여준다. 하단 캡션은 감사가 광범위한 부적절 행동을 테스트한 것과 Sonnet 5가 Sonnet 4.6보다 전반적으로 낮은 비율을 기록했지만 Mythos Preview와 Opus 4.8보다는 높다고 명시하고 있어 차트 해석의 문맥을 제공한다.
모델별 오정렬 행동 비율을 막대그래프로 비교한 차트로 Sonnet 4.6, Mythos Preview, Opus 4.8, Sonnet 5의 평균 점수와 오차막대가 표시되어 있다.

두 번째 이미지는 첫 번째와 동일한 차트를 다른 형식으로 제공하며 핵심 수치와 시각적 구성이 동일하게 유지된다. 이 이미지는 게시물의 주요 근거 자료 역할을 하며 그래프의 값과 캡션을 통해 모델 간 안전성 비교를 직접 확인할 수 있다. 원문 캡션이 차트의 측정 맥락(자동화된 행동 감사, 섹션 6.4 참조)을 함께 제시하고 있어 차트 해석에 필요한 출처 정보를 보완한다.
동일한 오정렬 행동 비교 차트의 미리보기 이미지로 모델별 평균점수와 오차막대가 포함되어 있다.
용어 해설
- Misaligned behavior
- — 모델이 의도한 안전·윤리 기준이나 사용자 의도와 어긋나는 응답을 생성하는 경향을 말한다. 이 항목은 특정 입력에서 유해하거나 부적절한 출력을 내는 빈도와 유형을 정량화하며 모델 안전성 평가에서 핵심적인 지표로 사용된다. 실무에서는 이 지표를 낮추는 것이 사용자 신뢰와 규정 준수 측면에서 중요하다.
- Behavioral audit
- — 자동화된 테스트 세트를 이용해 모델의 다양한 입력 상황에서 나타나는 바람직하지 않은 행동을 체계적으로 측정하는 절차이다. 입력 패턴을 주고 응답의 유형과 빈도를 기록·분류하며, 수치화된 점수로 모델 간 비교를 가능하게 한다. 결과는 모델 튜닝과 안전성 개선 우선순위를 정하는 근거로 활용된다.
- System Card
- — 특정 모델의 설계, 한계, 평가 결과와 안전성 테스트 절차를 문서화한 공식 리포트 형식이다. 시스템 카드는 감사에서 사용한 시나리오, 측정 지표, 결과 해석과 권장 완화책을 포함하여 투명성과 재현성을 제공한다. 모델 간 비교나 규제 대응 시 참조 문서로 기능한다.
- Automated evaluation
- — 사람의 수작업 개입을 최소화하고 스크립트화된 입력과 판정 기준으로 모델 성능을 측정하는 방법이다. 동일한 테스트를 대량으로 실행하여 통계적 신뢰도를 확보하며 반복 실험에서 일관된 비교 결과를 제공한다. 단점으로는 인간 판단의 미묘한 문맥 해석을 완전히 대체하지 못할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
