본문으로 건너뛰기

LLM 평가자마다 사실 판정이 달라지는 이유

다섯 LLM 평가자의 사실 판정 일치율과 confidence 신뢰성을 실제 주장 1,000개로 비교한 공개 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Lenz는 웹 검색과 thinking을 활성화한 다섯 모델에 실제 사용자 제출 주장 1,000개를 같은 prompt로 판정하게 하고 verdict와 confidence의 일치도를 비교했습니다. 다섯 모델이 모두 같은 답을 낸 비율은 37%였고, 23%에서는 5점 척도 기준 두 단계 이상 차이가 났으며 11%에서는 다수 의견이 형성되지 않았습니다. 모델 간 정확 일치율은 Gemini와 Grok이 76%, Gemini와 Sonar가 49%였고, Claude는 다수 의견과 86% 일치해 가장 높았습니다. 반면 confidence 응답의 76%가 9점 또는 10점에 몰렸고, 전체 척도로 의견이 갈린 주장에서도 평균 8.1점이어서 self-reported confidence보다 모델 간 verdict 불일치가 더 유용한 escalation 신호로 나타났습니다. 연구는 accuracy가 아니라 consistency를 측정했으며 gold label과 다수 의견을 truth로 동일시할 수 없다는 한계를 함께 밝혔습니다.

주요 논점

01찬성다수

단일 LLM judge의 verdict를 객관적 측정값으로 취급하기 어렵다는 연구 결과에 동의하는 입장입니다. 서로 다른 모델의 판정 불일치를 사람 검토로 보낼 uncertainty 신호로 활용하는 접근이 더 타당하다는 판단입니다.

02중립소수

이번 결과는 모델 간 consistency를 측정한 것이며 실제 accuracy나 truth를 판정한 결과는 아니라는 유보적 입장입니다. gold label과 사람 평가자 비교가 없으므로 모델 간 불일치만으로 어느 판정이 옳은지 결정할 수 없습니다.

합의점 vs 논쟁점

합의점

  • 동일한 주장과 prompt를 사용해도 모델별 verdict와 confidence가 크게 달라질 수 있습니다. 따라서 단일 judge의 출력은 모델 선택과 설정에 영향을 받는 결과입니다. 모델 간 불일치는 개별 모델의 self-reported confidence보다 강한 uncertainty 신호로 볼 수 있습니다.

논쟁점

  • 모델 간 verdict 차이가 실제 오류를 뜻하는지는 확인되지 않았습니다. gold label이 없고 사람도 일부 주장에 합의하지 못할 수 있어, 불일치율을 곧바로 부정확성으로 해석할 수 없습니다. 5점 척도에서 한 단계 차이를 disagreement로 볼지 calibration 차이로 볼지도 해석의 여지가 있습니다.

실용적 조언

  • 사실 주장 판정 pipeline에서 사람 검토 대상을 정할 때 단일 모델의 confidence 점수만 사용하지 않는 편이 낫습니다. 여러 모델의 verdict가 서로 다른지 먼저 확인하고, 의견이 갈린 사례를 escalation 대상으로 삼는 방식이 연구 결과와 맞습니다. 모델 confidence는 전반적으로 높게 치우쳐 있어 단독 routing 기준으로 쓰면 검토 대상이 거의 남지 않을 수 있습니다.
  • judge를 하나만 선택해야 한다면 가격이나 latency뿐 아니라 판정 성향을 함께 확인해야 합니다. Gemini처럼 True와 False에 치우친 모델과 Sonar처럼 hedging이 잦은 모델은 같은 정확도에서도 후속 시스템의 처리 방식에 다른 영향을 줄 수 있습니다. 모델별 다수 의견 일치율과 confidence 분포를 별도로 측정한 뒤 실제 pipeline에 배치하는 편이 안전합니다.

섹션별 상세

01
Lenz는 자사 플랫폼에 최근 제출된 검증 대상 실제 주장 1,000개를 사용하고, 다섯 frontier model에 동일한 claim text와 prompt를 입력했습니다. 각 모델은 웹 검색과 thinking을 켠 상태에서 True, Mostly True, Mixed, Mostly False, False의 5점 척도와 1~10 confidence 점수를 함께 산출했습니다. 사전 라벨이 있는 benchmark가 아니라 새 사용자 제출물을 사용했기 때문에 모델이 정답을 외워 판정하는 상황을 피하려는 구성이었습니다.
02
다섯 모델이 모두 같은 verdict를 낸 주장은 37%에 그쳤고, 23%에서는 5점 척도 기준 두 단계 이상 차이가 났습니다. 11%에서는 다수 의견 자체가 형성되지 않았으며, 가장 비슷한 Gemini와 Grok도 76%만 정확히 일치했고 Gemini와 Sonar의 일치율은 49%였습니다. 이 수치는 동일한 사실 주장에 대한 단일 judge의 결과가 선택한 vendor에 따라 달라질 수 있음을 보여줍니다.
03
모델마다 판정 성향도 달랐습니다. Gemini는 True 또는 False로 양극화되는 경향이 강했고, Sonar는 자주 유보하면서 다른 네 모델의 다수 의견과 63%만 일치했습니다. Claude는 다수 의견과 86% 일치해 가장 높은 일치율을 기록했고 confidence 척도의 하위 절반도 유의미하게 사용한 유일한 모델이었습니다.
04
모델이 직접 매긴 confidence는 의견 충돌을 찾는 신호로 거의 기능하지 않았습니다. 전체 4,985개 응답 중 76%가 9점 또는 10점이었고, 패널이 True부터 False까지 전체 척도로 갈린 주장에서도 평균 confidence가 8.1점이었습니다. Krippendorff's alpha는 confidence에서 0.44, verdict에서 0.77로 나타나 모델 간 confidence 합의가 verdict 합의보다 훨씬 약했습니다.
05
연구는 consistency를 측정했을 뿐 accuracy를 확정하지 않았습니다. gold label이 없으므로 다수 의견을 truth로 간주할 수 없고, 일부 주장에서는 사람 평가자도 의견이 갈릴 가능성이 있습니다. 또한 5점 척도에서 한 단계 차이는 calibration 차이일 수 있어, 연구는 두 단계 이상 차이인 23%와 다수 의견이 없는 11%를 별도로 보고했습니다.
06
이번 v1.1은 앞선 v1.0에 대한 비판을 반영해 Grok을 추가하고 verdict 전에 reasoning을 수행하도록 바꾸었으며, 4점 척도도 5점 척도로 개편했습니다. 원 작성자는 v1.0이 HN에서 여러 지적을 받은 뒤 같은 문제를 중심으로 연구를 다시 구성했다고 밝혔습니다. Paper, code, prompts, data.csv를 모두 공개해 수치와 실험 구성을 직접 확인할 수 있게 했습니다.

이미지 분석

동일한 997개 주장에 대한 모델 쌍별 정확 일치율을 비교한 차트입니다.
Chart

차트는 다섯 모델 조합마다 같은 997개 주장에 대해 verdict가 정확히 일치한 비율을 비교합니다. 본문 수치와 연결하면 Gemini와 Grok의 일치율은 76%로 가장 높고 Gemini와 Sonar는 49%로 가장 낮아, judge 선택에 따라 사실 판정 결과가 크게 달라질 수 있음을 시각적으로 확인할 수 있습니다.

동일한 997개 주장에 대한 모델 쌍별 정확 일치율을 비교한 차트입니다.

용어 해설

LLM 평가자(LLM-as-judge)
LLM-as-judge는 한 언어 모델이 다른 모델의 답변이나 사실 주장의 진위를 판정하는 방식입니다. 이 글에서는 평가자 모델의 선택에 따라 판정 결과가 달라지는지 비교해 단일 모델 판정의 일관성을 측정했습니다.
Krippendorff 알파(Krippendorff's alpha)
Krippendorff's alpha는 여러 평가자의 판정 일치도를 측정하는 통계량입니다. 이 연구에서는 모델 간 confidence 점수의 일치도와 verdict 일치도를 비교하는 데 사용했으며, 값이 높을수록 평가 결과가 서로 비슷하다는 뜻입니다.
신뢰도 점수(confidence score)
confidence score는 모델이 자신의 판정에 얼마나 확신하는지 1에서 10까지 표시한 값입니다. 연구에서는 모델들이 실제로 의견이 갈린 주장에도 9 또는 10을 자주 부여해, 사람 검토로 보낼 사례를 가르는 신호로서 한계를 확인했습니다.
웹 검색 기반 검색(web retrieval)
web retrieval은 모델이 외부 웹 정보를 찾아 입력 주장과 대조하도록 하는 처리 방식입니다. 이번 비교에서는 다섯 모델 모두 웹 검색과 thinking을 활성화하고 동일한 주장과 prompt를 입력해 모델별 판정 차이를 비교했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.