TL;DR
LLM을 답변 평가의 심판으로 사용하면 빠르고 저렴하게 규모를 키울 수 있지만, 증거보다 학습된 사전 지식에 따라 판정하는 편향이 생깁니다. 답변의 위치, 길이, 생성 모델과의 문체 유사성, 국가·기업·개인의 이름, 감정적 어조, 인용, 다수의 선호, 무관한 정보가 내용과 무관하게 점수를 바꿀 수 있으며, 올바른 결론 뒤의 잘못된 추론도 놓칠 수 있습니다. 이를 줄이려면 응답을 원자적 주장으로 분리하고 각 주장이 문서에 의해 뒷받침되는지 확인하는 Grounding 방식으로 평가 과제를 좁혀야 합니다. Lynx, MiniCheck 같은 근거성 평가 모델을 활용하고, Grounding이 어려운 경우에는 다양한 모델로 구성한 배심원과 사전 스트레스 테스트를 함께 사용해야 합니다.
섹션별 상세
- LLM 심판의 편향은 두 답변의 품질이 비슷할 때 승패를 결정하는 요인이 되기 쉽습니다. — Why judges are biased 절의 두 답변 품질 차이와 편향 영향에 관한 설명
- 답변 순서를 바꾸면 모델의 판정이 뒤집힐 수 있으며, 선택지가 늘어나면 순서 변경에 따른 승자 변동이 커집니다. — Position bias 절의 A·B 라벨 교체 실험과 세 개 또는 네 개 후보에 관한 설명
- 일부 모델의 자기 선호 편향은 약 16%까지 측정됐고, 가장 우수한 모델도 약 1~2% 수준의 차이를 보였습니다. — Self-preference bias 절의 measured self-inflation 수치
- 감정적 어조를 추가한 정확한 답변은 심판에게 약 70~75%의 비율로 거부됐습니다. — Entity and tone bias 절의 emotional tone 영향 수치
- 낮은 품질 답변에 가짜 URL을 붙이면 심판이 판정을 뒤집고 가짜 출처를 선택 이유로 들 수 있습니다. — Authority bias 절의 조작된 URL 실험 사례

용어 해설
- 위치 편향(Position Bias)
- — 답변의 내용이 같아도 입력 순서나 선택지 위치에 따라 LLM 판정이 달라지는 현상입니다. 모델이 프롬프트의 시작과 끝에 더 큰 가중치를 두고, 좋은 답이 특정 위치에 놓인다는 학습 데이터의 관습을 활용하면서 발생합니다.
- 근거성(Groundedness)
- — 모델의 답변이나 개별 주장이 주어진 문서와 증거에 의해 뒷받침되는 정도입니다. 자유로운 품질 판단 대신 문서가 주장을 지지하는지 확인하는 좁은 과제로 바꾸면 모델의 사전 지식과 인상에 따른 편향을 줄일 수 있습니다.
- 텍스트 함의(Textual Entailment)
- — 하나의 텍스트가 다른 문장이나 주장의 참을 뒷받침하는지 판별하는 작업입니다. LLM을 답변의 전반적 품질을 평가하는 심판으로 쓰는 대신, 특정 주장이 특정 문서에서 지지되는지만 확인하게 만드는 근거 평가의 핵심 방식입니다.
- 장황함 편향(Verbosity Bias)
- — 두 답변이 모두 정확해도 더 긴 답변을 더 높은 품질로 평가하는 경향입니다. 학습 데이터에서 길이와 노력·전문성이 함께 나타난 패턴을 모델이 답습하기 때문에 생기며, 불필요한 문장을 늘려 점수를 조작하거나 모델이 장황하게 답하도록 유도할 수 있습니다.
- 자기 선호 편향(Self-Preference Bias)
- — LLM이 다른 모델의 답변보다 자신이 생성한 답변과 비슷한 문체·리듬·구조를 가진 글에 더 높은 점수를 주는 현상입니다. 작성과 평가에 같은 모델을 사용하면 익숙한 표현을 품질로 오인할 수 있어, 두 작업을 서로 다른 모델로 분리해야 합니다.
- 권위 편향(Authority Bias)
- — 인용이나 참고문헌이 붙었다는 이유만으로 답변의 신뢰도와 평가 점수가 올라가는 현상입니다. 모델이 학습 데이터에서 참고문헌과 엄밀성이 함께 나타난 패턴을 익혔지만 출처의 실제 존재 여부를 확인하지 못하면서, 조작된 URL이나 유명인의 가짜 인용에도 영향을 받을 수 있습니다.
기술
- Large Language Models
- LLMs
- Lynx
- Llama-3-Instruct
- PubmedQA
- DROP
- FinanceBench
- GPT-4
- MiniCheck
- MiniCheck-FT5
- LLM-AggreFact
- Prometheus 2
- GLIDER
- Vectara HHEM
- Transformer
활용 사례
- 학생 코드와 과제 채점
- 연구 논문 순위 평가
- LLM 답변의 근거성 검증
- 실시간 환각 방지 가드레일
- 코드와 수학 풀이의 논리 과정 평가
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
