본문으로 건너뛰기

LLM 평가자 동의에서 중복 증거를 걸러내는 Ising 집계

Ising 모델로 LLM 평가자 간 중복 판단을 할인해 세 과제 정확도를 높였다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

여러 LLM 평가자가 같은 항목에 동의해도 동일한 Prompt, 학습 계보, 모델 계열 또는 공통 편향을 공유한다면 그 동의는 독립적인 증거가 아니라 반복된 오류일 수 있다. 연구진은 Ising 모델로 평가자별 신뢰도와 평가자 쌍의 의존성을 함께 학습하고, 사람의 참조 라벨 없이 평가 로그에서 실제 라벨을 잠재 변수로 추론하는 집계 방식을 제안했다. 10개 평가자 모델을 사용한 관련성·독성·요약 평가에서 정확도는 각각 0.912, 0.792, 0.806으로, Weighted Majority Vote보다 9%에서 14% 높았다. 실무에서는 평가자 수보다 오류 패턴의 다양성을 측정하고, 의존성 군집을 감사하며, 상관된 표에 맞춰 불확실성을 조정해야 한다.

섹션별 상세

01
LLM-as-a-judge 패널에서 10명 중 8명이 같은 판단을 내렸더라도 그 표가 서로 독립적인 증거인지 확인해야 한다. 평가자들이 같은 Prompt template, 학습 계보, 모델 계열 또는 공통 사각지대를 공유하면 동일한 오류를 반복할 수 있어, 8 대 2의 다수결이 실제 증거보다 강해 보일 수 있다. 이 문제는 검색된 문서의 관련성 판정처럼 여러 LLM 평가자를 동시에 사용하는 평가 파이프라인에서 특히 중요하다.
J1부터 J10까지의 LLM 평가자가 항목의 관련성·독성·충실성을 판정하고, 실선은 더 강한 공유 행동, 점선은 더 약한 교차 평가자 상관을 나타낸다.
Diagram이미지는 평가자들의 동의가 모두 독립적인 증거는 아니라는 점을 네트워크 구조로 표현한다. 서로 강하게 연결된 평가자들이 같은 판단을 내리면 표를 그대로 더하기보다 중복된 신호로 할인해야 한다는 연구의 핵심 문제와 연결된다.
02
Uniform Majority Vote는 모든 평가자에게 한 표씩 주고, Weighted Majority Vote는 과거 정확도가 높은 평가자에 더 큰 영향력을 부여한다. 그러나 두 방식 모두 평가자들이 잘못된 답을 서로 독립적으로 낸다고 가정하므로, 같은 Rubric이나 예시 Prompt를 공유하는 평가자들의 공동 오류를 따로 처리하지 못한다. 따라서 개별 평가자의 성능이 높아도 오류 패턴이 겹치면 패널 전체가 제공하는 새로운 정보량은 투표 수보다 작아진다.
8명의 평가자가 Yes, 2명이 No라고 답한 상황을 다수결 투표와 의존성 인식 집계로 비교한다.
Diagram왼쪽은 8 대 2 결과가 결정적으로 보이지만 모든 표를 새로운 증거로 취급한다. 오른쪽은 평가자 간 중복 관계를 먼저 학습해 공유된 오류를 할인하므로, 투표 수와 실제 독립 증거량을 구분하는 과정을 시각화한다.
03
연구진은 평가자 패널을 네트워크로 보고 Ising 모델을 사용해 개별 평가자 신뢰도와 평가자 쌍의 의존성을 함께 학습한다. 알고리즘은 각 항목의 실제 라벨을 잠재 변수로 두고 투표에서 양성 라벨일 확률을 계산한 뒤, 그 확률과 평가자 신뢰도·쌍별 의존성을 번갈아 갱신한다. 사람이 만든 참조 라벨 없이 평가 로그만으로 학습하는 비지도 방식이므로, 기존 LLM 평가 결과에 남아 있는 동의와 불일치 패턴을 집계 신호로 활용한다.
04
의존성 모델은 두 수준으로 구성된다. 하나는 양성·음성 라벨에서 평가자 관계가 대체로 같다고 보고 상관이 높은 평가자들의 중복 동의를 가중치에서 할인하며, 다른 하나는 라벨에 따라 관계 구조가 달라지도록 허용해 명확한 항목과 모호한 항목에서 나타나는 군집 패턴까지 반영한다. 후자는 더 많은 파라미터를 추정해야 하므로 충분한 데이터가 필요하지만, 평가자 간 분할 자체가 라벨 정보를 담는 상황을 표현할 수 있다.
05
10개 평가자 모델을 사용한 세 과제에서 의존성 인식 집계가 Weighted Majority Vote보다 9%에서 14% 높은 정확도를 기록했다. 관련성 분류 정확도는 0.912로 Weighted Majority Vote의 0.820과 Uniform Majority Vote의 0.804를 앞섰고, 독성 분류에서는 0.792 대 0.694와 0.695, 요약 평가에서는 0.806 대 0.737과 0.561이었다. 결과는 평가 항목과 평가자 수가 관계를 추정할 만큼 충분할 때, 표를 단순히 세는 것보다 공유된 행동을 모델링하는 편이 유리함을 보여준다.
10개 평가자 모델을 사용한 관련성, 독성, 요약 평가에서 의존성 인식 집계와 두 다수결 기준선의 정확도를 비교한다.
Chart관련성에서는 0.912, 독성에서는 0.792, 요약에서는 0.806으로 의존성 인식 방식이 각각 0.820·0.694·0.737의 Weighted Majority와 0.804·0.695·0.561의 Uniform Majority보다 높다. 세 과제의 수치는 평가자 간 관계를 반영하는 집계가 단순 투표보다 정확도 측면에서 유리했음을 직접 보여준다.
06
실무에서는 개별 평가자뿐 아니라 패널 전체의 통계적 다양성을 측정하고, 모델 계열이나 Architecture를 섞는 것보다 실제 오류 패턴이 달라지는지 확인해야 한다. 평가자 의존성 네트워크의 강한 군집은 공유된 Rubric, 모델 행동 또는 과제별 모호성을 드러낼 수 있으며, 중복 평가자를 추가하기 전에 감사 자료로 활용할 수 있다. 또한 상관된 10표를 독립적인 10표와 같은 확신으로 보고하지 않도록 최종 라벨과 함께 의존성을 반영한 불확실성을 제시해야 한다.
LLM 평가자 집계를 단순 다수결, 평가자 신뢰도 가중, 평가자 의존성 모델링의 세 단계로 구분한다.
Diagram그림은 패널의 문제가 단순한 표 계산에서 평가자 신뢰도 추정으로, 다시 평가자 간 관계 학습으로 확장되는 순서를 보여준다. 평가자 품질 차이만 중요할 때는 Weighted Majority Vote를 사용하고, 상관과 공유 편향이 보일 때는 Ising aggregation으로 이동하라는 실무 판단 기준을 담고 있다.
Provider A부터 Provider E까지 평가자 그룹을 묶고, 그룹 내부의 강한 결합과 그룹 간의 약한 결합을 네트워크로 표현한다.
Diagram같은 Provider 안의 평가자들이 강하게 연결되고 다른 Provider 사이에는 약한 연결이 나타나, 평가자 패널의 중복 구조를 감사할 수 있음을 보여준다. 특정 그룹에 평가자가 몰려 있으면 모델 수를 늘려도 새로운 정보보다 공유된 판단이 추가될 가능성이 있어, 패널 구성과 추가 평가자 선택에 활용할 수 있다.

용어 해설

LLM 평가자(LLM-as-a-judge)
LLM 평가자는 다른 모델의 출력이나 검색 결과를 정해진 기준에 따라 판정하는 시스템이다. 여러 평가자의 투표를 결합하면 단일 모델의 변동성을 줄일 수 있지만, 동일한 Prompt·학습 계보·모델 계열을 공유하면 같은 오류를 반복할 수 있다. 따라서 투표 수뿐 아니라 평가자 간 오류 의존성도 함께 추정해야 한다.
다수결 투표(Majority Vote)
다수결 투표는 각 평가자에게 동일한 한 표를 부여하고 가장 많은 표를 얻은 라벨을 최종 결과로 선택하는 집계 방식이다. Weighted Majority Vote는 과거 정확도가 높은 평가자에게 더 큰 가중치를 주지만, 평가자들이 독립적으로 오류를 낸다는 가정을 유지한다. 평가자 간 상관이 높으면 다수 의견이 실제로는 중복된 증거일 수 있다.
Ising 모델(Ising Model)
Ising 모델은 이진 변수 사이의 쌍별 의존성을 표현하는 통계 모델이다. 이 연구에서는 각 LLM 평가자의 개별 신뢰도와 평가자 쌍의 유사한 출력 패턴을 함께 학습하고, 관측된 투표에서 실제 라벨을 잠재 변수로 추론한다. 이를 통해 함께 발생한 오류를 독립적인 증거로 중복 집계하는 문제를 줄인다.
잠재 변수(Latent Variable)
잠재 변수는 직접 관측되지 않지만 관측된 데이터의 생성 과정을 설명하기 위해 추론하는 변수다. 연구의 비지도 설정에서는 사람이 부여한 참조 라벨 대신 각 항목의 실제 라벨을 잠재 변수로 두고 평가자 투표에서 그 확률을 추정한다. 이후 이 추정값을 이용해 평가자 신뢰도와 쌍별 의존성을 번갈아 갱신한다.
조건부 독립(Conditional Independence)
조건부 독립 가정은 실제 라벨이 주어졌을 때 여러 평가자의 오류가 서로 영향을 주지 않는다고 보는 방식이다. Uniform Majority Vote와 Weighted Majority Vote는 평가자별 표의 수나 신뢰도는 다르게 다루지만, 잘못된 판단이 함께 발생하는 관계는 모델링하지 않는다. 공유된 Rubric이나 모델 계보가 있는 LLM 패널에서는 이 가정이 투표의 확신을 실제보다 크게 만들 수 있다.

기술

  • LLM-as-a-judge
  • Ising models
  • Weighted Majority Vote
  • Uniform Majority Vote
  • temperature zero

활용 사례

  • 검색된 정보의 관련성 분류
  • 콘텐츠 독성 분류
  • 요약 품질 평가
  • LLM 평가 패널 감사
  • 중복 평가자 식별
  • 평가 로그 기반 불확실성 산정
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.