TL;DR
LLM 평가자가 같은 입력을 반복해서 다르게 판정하면서, 변경하지 않은 파이프라인이 5점에서 2점으로 떨어지는 거짓 회귀가 발생했습니다. 글쓴이는 승인 버전을 사례별로 다섯 번 실행해 최솟값과 최댓값을 참조 밴드로 저장하고, 새 점수가 그 범위를 벗어날 때만 노이즈를 넘은 회귀로 집계하는 방식을 채택했습니다. 실제 재현 실험에서는 precision 하락은 참조 밴드를 벗어났지만 accuracy 하락은 밴드 안에 있어 회귀로 세지 않았고, pass에서 fail로 바뀐 개별 사례는 항상 별도로 보고했습니다. 별도 파이프라인에서는 프롬프트 변경 두 건이 회귀를 일으켰고 Sonnet 5로의 변경은 비용이 7.5배 늘었지만 누락 사례를 되찾아 승인됐습니다. 다만 다섯 번의 최솟값과 최댓값은 신뢰구간이 아니며, LLM 평가자의 판단이 옳은지까지 보장하지는 않습니다.
섹션별 상세
$ digline compare --suite suite.py --run 2026-09-03T06-18-43승인된 기준 실행과 현재 실행을 비교해 평가 항목별 회귀와 노이즈 안의 변화를 출력하는 명령입니다.

용어 해설
- LLM 평가자(LLM-as-judge)
- — LLM 평가자는 다른 LLM의 출력물을 미리 정한 기준과 비교해 점수나 통과 여부를 판정하는 방식입니다. 같은 입력과 프롬프트를 사용해도 모델의 판단이 매번 달라질 수 있어, 단일 실행 결과만으로 회귀를 확정하면 거짓 경보가 발생할 수 있습니다.
- 노이즈 바닥(Noise Floor)
- — 노이즈 바닥은 시스템을 변경하지 않아도 측정값이 자연스럽게 흔들리는 범위입니다. 이 글에서는 승인된 버전을 다섯 번 실행해 각 평가 항목의 최솟값과 최댓값을 기록하고, 새 점수가 그 범위를 벗어났을 때만 실제 회귀로 집계합니다.
- 참조 밴드(Reference Band)
- — 참조 밴드는 승인된 기준 버전에서 반복 측정한 점수의 최솟값과 최댓값으로 만든 구간입니다. 현재 실행 결과가 이 구간 안에 있으면 점수 하락을 보고하되 노이즈 안의 변화로 분류하고, 기준 버전의 측정 이력을 근거로 판단합니다.
- 회귀 테스트(Regression Testing)
- — 회귀 테스트는 코드나 모델 설정을 바꾼 뒤 기존 동작이 깨지지 않았는지 고정된 사례로 확인하는 절차입니다. LLM 애플리케이션에서는 출력 자체가 확률적으로 달라질 수 있으므로, 변경 전후 점수뿐 아니라 변경하지 않았을 때의 변동 폭도 함께 측정해야 합니다.
- 카나리 케이스(Canary Case)
- — 카나리 케이스는 정답이 명확한 고정 입력을 별도로 두고 모델이나 제공자 변경 여부를 감시하는 평가 사례입니다. 품질 점수의 회귀를 판정하기보다 이 사례의 결과와 밴드가 움직였는지 확인해, 개별 사례를 쫓기 전에 전체 기준선을 다시 잡을지 결정하는 데 사용합니다.
기술
- Python
- digline
- Claude
- Haiku 4.5
- Sonnet 5
활용 사례
- RSS 기반 AI 뉴스 브리핑 평가
- Reddit 게시물의 댓글 가치 판정
- LLM 애플리케이션 변경 전후 회귀 테스트
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.