TL;DR
Lenz는 웹 검색과 thinking을 활성화한 다섯 모델에 실제 사용자 제출 주장 1,000개를 같은 prompt로 판정하게 하고 verdict와 confidence의 일치도를 비교했습니다. 다섯 모델이 모두 같은 답을 낸 비율은 37%였고, 23%에서는 5점 척도 기준 두 단계 이상 차이가 났으며 11%에서는 다수 의견이 형성되지 않았습니다. 모델 간 정확 일치율은 Gemini와 Grok이 76%, Gemini와 Sonar가 49%였고, Claude는 다수 의견과 86% 일치해 가장 높았습니다. 반면 confidence 응답의 76%가 9점 또는 10점에 몰렸고, 전체 척도로 의견이 갈린 주장에서도 평균 8.1점이어서 self-reported confidence보다 모델 간 verdict 불일치가 더 유용한 escalation 신호로 나타났습니다. 연구는 accuracy가 아니라 consistency를 측정했으며 gold label과 다수 의견을 truth로 동일시할 수 없다는 한계를 함께 밝혔습니다.
주요 논점
단일 LLM judge의 verdict를 객관적 측정값으로 취급하기 어렵다는 연구 결과에 동의하는 입장입니다. 서로 다른 모델의 판정 불일치를 사람 검토로 보낼 uncertainty 신호로 활용하는 접근이 더 타당하다는 판단입니다.
이번 결과는 모델 간 consistency를 측정한 것이며 실제 accuracy나 truth를 판정한 결과는 아니라는 유보적 입장입니다. gold label과 사람 평가자 비교가 없으므로 모델 간 불일치만으로 어느 판정이 옳은지 결정할 수 없습니다.
합의점 vs 논쟁점
합의점
- 동일한 주장과 prompt를 사용해도 모델별 verdict와 confidence가 크게 달라질 수 있습니다. 따라서 단일 judge의 출력은 모델 선택과 설정에 영향을 받는 결과입니다. 모델 간 불일치는 개별 모델의 self-reported confidence보다 강한 uncertainty 신호로 볼 수 있습니다.
논쟁점
- 모델 간 verdict 차이가 실제 오류를 뜻하는지는 확인되지 않았습니다. gold label이 없고 사람도 일부 주장에 합의하지 못할 수 있어, 불일치율을 곧바로 부정확성으로 해석할 수 없습니다. 5점 척도에서 한 단계 차이를 disagreement로 볼지 calibration 차이로 볼지도 해석의 여지가 있습니다.
실용적 조언
- 사실 주장 판정 pipeline에서 사람 검토 대상을 정할 때 단일 모델의 confidence 점수만 사용하지 않는 편이 낫습니다. 여러 모델의 verdict가 서로 다른지 먼저 확인하고, 의견이 갈린 사례를 escalation 대상으로 삼는 방식이 연구 결과와 맞습니다. 모델 confidence는 전반적으로 높게 치우쳐 있어 단독 routing 기준으로 쓰면 검토 대상이 거의 남지 않을 수 있습니다.
- judge를 하나만 선택해야 한다면 가격이나 latency뿐 아니라 판정 성향을 함께 확인해야 합니다. Gemini처럼 True와 False에 치우친 모델과 Sonar처럼 hedging이 잦은 모델은 같은 정확도에서도 후속 시스템의 처리 방식에 다른 영향을 줄 수 있습니다. 모델별 다수 의견 일치율과 confidence 분포를 별도로 측정한 뒤 실제 pipeline에 배치하는 편이 안전합니다.
섹션별 상세
이미지 분석

차트는 다섯 모델 조합마다 같은 997개 주장에 대해 verdict가 정확히 일치한 비율을 비교합니다. 본문 수치와 연결하면 Gemini와 Grok의 일치율은 76%로 가장 높고 Gemini와 Sonar는 49%로 가장 낮아, judge 선택에 따라 사실 판정 결과가 크게 달라질 수 있음을 시각적으로 확인할 수 있습니다.
동일한 997개 주장에 대한 모델 쌍별 정확 일치율을 비교한 차트입니다.
용어 해설
- LLM 평가자(LLM-as-judge)
- — LLM-as-judge는 한 언어 모델이 다른 모델의 답변이나 사실 주장의 진위를 판정하는 방식입니다. 이 글에서는 평가자 모델의 선택에 따라 판정 결과가 달라지는지 비교해 단일 모델 판정의 일관성을 측정했습니다.
- Krippendorff 알파(Krippendorff's alpha)
- — Krippendorff's alpha는 여러 평가자의 판정 일치도를 측정하는 통계량입니다. 이 연구에서는 모델 간 confidence 점수의 일치도와 verdict 일치도를 비교하는 데 사용했으며, 값이 높을수록 평가 결과가 서로 비슷하다는 뜻입니다.
- 신뢰도 점수(confidence score)
- — confidence score는 모델이 자신의 판정에 얼마나 확신하는지 1에서 10까지 표시한 값입니다. 연구에서는 모델들이 실제로 의견이 갈린 주장에도 9 또는 10을 자주 부여해, 사람 검토로 보낼 사례를 가르는 신호로서 한계를 확인했습니다.
- 웹 검색 기반 검색(web retrieval)
- — web retrieval은 모델이 외부 웹 정보를 찾아 입력 주장과 대조하도록 하는 처리 방식입니다. 이번 비교에서는 다섯 모델 모두 웹 검색과 thinking을 활성화하고 동일한 주장과 prompt를 입력해 모델별 판정 차이를 비교했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.