TL;DR
여러 LLM 평가자가 같은 항목에 동의해도 동일한 Prompt, 학습 계보, 모델 계열 또는 공통 편향을 공유한다면 그 동의는 독립적인 증거가 아니라 반복된 오류일 수 있다. 연구진은 Ising 모델로 평가자별 신뢰도와 평가자 쌍의 의존성을 함께 학습하고, 사람의 참조 라벨 없이 평가 로그에서 실제 라벨을 잠재 변수로 추론하는 집계 방식을 제안했다. 10개 평가자 모델을 사용한 관련성·독성·요약 평가에서 정확도는 각각 0.912, 0.792, 0.806으로, Weighted Majority Vote보다 9%에서 14% 높았다. 실무에서는 평가자 수보다 오류 패턴의 다양성을 측정하고, 의존성 군집을 감사하며, 상관된 표에 맞춰 불확실성을 조정해야 한다.
섹션별 상세





용어 해설
- LLM 평가자(LLM-as-a-judge)
- — LLM 평가자는 다른 모델의 출력이나 검색 결과를 정해진 기준에 따라 판정하는 시스템이다. 여러 평가자의 투표를 결합하면 단일 모델의 변동성을 줄일 수 있지만, 동일한 Prompt·학습 계보·모델 계열을 공유하면 같은 오류를 반복할 수 있다. 따라서 투표 수뿐 아니라 평가자 간 오류 의존성도 함께 추정해야 한다.
- 다수결 투표(Majority Vote)
- — 다수결 투표는 각 평가자에게 동일한 한 표를 부여하고 가장 많은 표를 얻은 라벨을 최종 결과로 선택하는 집계 방식이다. Weighted Majority Vote는 과거 정확도가 높은 평가자에게 더 큰 가중치를 주지만, 평가자들이 독립적으로 오류를 낸다는 가정을 유지한다. 평가자 간 상관이 높으면 다수 의견이 실제로는 중복된 증거일 수 있다.
- Ising 모델(Ising Model)
- — Ising 모델은 이진 변수 사이의 쌍별 의존성을 표현하는 통계 모델이다. 이 연구에서는 각 LLM 평가자의 개별 신뢰도와 평가자 쌍의 유사한 출력 패턴을 함께 학습하고, 관측된 투표에서 실제 라벨을 잠재 변수로 추론한다. 이를 통해 함께 발생한 오류를 독립적인 증거로 중복 집계하는 문제를 줄인다.
- 잠재 변수(Latent Variable)
- — 잠재 변수는 직접 관측되지 않지만 관측된 데이터의 생성 과정을 설명하기 위해 추론하는 변수다. 연구의 비지도 설정에서는 사람이 부여한 참조 라벨 대신 각 항목의 실제 라벨을 잠재 변수로 두고 평가자 투표에서 그 확률을 추정한다. 이후 이 추정값을 이용해 평가자 신뢰도와 쌍별 의존성을 번갈아 갱신한다.
- 조건부 독립(Conditional Independence)
- — 조건부 독립 가정은 실제 라벨이 주어졌을 때 여러 평가자의 오류가 서로 영향을 주지 않는다고 보는 방식이다. Uniform Majority Vote와 Weighted Majority Vote는 평가자별 표의 수나 신뢰도는 다르게 다루지만, 잘못된 판단이 함께 발생하는 관계는 모델링하지 않는다. 공유된 Rubric이나 모델 계보가 있는 LLM 패널에서는 이 가정이 투표의 확신을 실제보다 크게 만들 수 있다.
기술
- LLM-as-a-judge
- Ising models
- Weighted Majority Vote
- Uniform Majority Vote
- temperature zero
활용 사례
- 검색된 정보의 관련성 분류
- 콘텐츠 독성 분류
- 요약 품질 평가
- LLM 평가 패널 감사
- 중복 평가자 식별
- 평가 로그 기반 불확실성 산정
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.