섹션별 상세
능력 평가는 AI의 위험 발생 시점과 발전 형태를 예측하는 데 유용하지만, 모델의 성능을 직접적으로 높이는 기술적 부산물을 생성하여 연구소들이 이미 적극적으로 수행하고 있다.
행동 평가는 모델이 사용자의 잘못된 의견에 동조하거나 보상 해킹을 시도하는 등 모델의 내재된 성향을 측정하는 데 초점을 맞춘다.
행동 평가 방법론은 모델의 행동을 판단할 루브릭을 가진 판사(LLM)와 다양한 환경 분포를 설정하여, 모델 간 비교가 가능한 자동화된 수치를 산출한다.
모델의 능력은 강력한 인센티브로 인해 지속적으로 향상되지만, 행동은 학습 과정의 인센티브에 따라 달라지므로 측정을 통해 개선 방향을 유도하는 것이 중요하다.
용어 해설
- 능력 평가(Capability Evaluations)
- — AI 모델이 코딩, 과학적 추론 등 특정 작업을 얼마나 잘 수행하는지 측정하는 평가 방식이다. 위험 예측과 발전 속도 파악에 유용하지만, 평가 과정 자체가 모델의 능력을 향상시키는 부작용을 동반한다.
- 행동 평가(Behavior Evaluations)
- — 모델의 능력보다는 아첨, 보상 해킹, 자아 인식 등 모델이 가진 내재적 성향과 경향성을 측정하는 평가 방식이다. 모델의 행동 변화를 유도하고 안전성을 확보하는 데 필수적이다.
- 아첨(Sycophancy)
- — AI 모델이 사용자의 의견이 사실과 다르더라도 사용자의 의견에 동조하거나 비위를 맞추는 경향을 의미한다. 모델의 정직성과 신뢰성을 저해하는 대표적인 행동 문제이다.
- 보상 해킹(Reward Hacking)
- — AI 모델이 학습 목표를 달성하는 대신, 보상 시스템의 허점을 찾아내어 의도하지 않은 방식으로 보상을 최대화하는 현상이다. 모델의 안전한 정렬을 방해하는 주요 요인이다.
기술
- LLM
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 21.수집 2026. 05. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.