본문으로 건너뛰기
r/LLMDevs조회 2

단일 시험이 만든 LLM 비교의 착시

Haiku 4.5와 Sonnet 5를 29문제씩 5회 비교하자 한 문제 차이는 사라지고, 두 모델의 치명적 오류는 모두 0회였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 주문 파싱 LLM을 29개 질문으로 한 번 비교했을 때 값비싼 Sonnet 5가 Haiku 4.5보다 한 문제 앞섰지만, 그 차이가 단일 실행의 우연일 수 있다는 지적을 받아 각 모델을 5회씩 다시 실행했습니다. 총 145회씩 측정한 결과 두 모델 모두 치명적 오류는 0회였고, 무오류 실행은 Haiku 4.5가 140회, Sonnet 5가 139회로 사실상 동률이었습니다. 원래 승패를 가른 PET 병과 뚜껑 주문도 반복 실행에서는 답변이 뒤집혔으며, 두 모델 모두 판단 불가능한 질문에서 한 번씩 위험한 확인을 냈습니다. 반복 실행은 이 29개 질문의 안정성은 확인하지만 새로운 질문에 대한 일반화까지 보장하지 않으므로, 모델 비교에는 반복 횟수와 새 질문 수를 함께 늘려야 합니다.

실용적 조언

  • 소규모 시험으로 LLM을 비교할 때는 동일한 질문 세트를 한 번만 실행하지 말고 최소 5회 반복해 질문별 답변 변동과 위험한 확인을 따로 집계하는 편이 좋습니다.
  • 치명적 오류와 전체 정답 수만 합산하지 말고, 정답이 하나로 정해진 질문과 사람 확인이 필요한 판단 불가능한 질문을 분리해 평가해야 합니다. 모호한 입력에서 임의로 확인하는지, 추가 정보를 요청하는지에 따라 실제 운영 위험이 달라집니다.
  • 반복 실행으로 기존 시험의 안정성을 확인한 뒤에는 새로운 질문 유형을 추가해야 합니다. 같은 항목의 재실행은 측정 안정성을 높이지만 미관측 주문 유형에 대한 일반화 근거를 늘리지 못합니다.

섹션별 상세

01
작성자는 주문 파싱 LLM을 29문제로 한 차례 시험한 결과 Sonnet 5가 Haiku 4.5보다 정확히 한 문제 더 맞았다고 발표했지만, 한 번의 실행만으로는 모델의 오류율을 판단하기 어렵다는 지적을 받았습니다. 실패 확률이 10%인 모델도 29회 연속 성공할 수 있으므로, 단일 결과가 실제 우열이 아니라 운 좋은 표본일 가능성이 있습니다. 이에 따라 Temperature 설정을 바꾸지 않고 각 모델에 같은 시험을 5회씩 적용해 답변의 변동 자체를 측정했습니다.
02
총 290개 답변에서 두 모델의 치명적 오류는 각각 0/145였고, 모호한 내용을 확인해 버린 위험한 시도는 각각 1회였습니다. 무오류 실행은 Haiku 4.5가 140/145, Sonnet 5가 139/145였으며, 실행별 정답 수는 Haiku 4.5가 29, 28, 27, 28, 28, Sonnet 5가 28, 28, 28, 28, 27로 엇갈렸습니다. 어느 한 번의 실행만 골라도 승자가 달라질 수 있어, 원래의 한 문제 차이는 모델 간 성능 격차가 아니라 분포에서 뽑힌 단일 표본에 가까웠습니다.
03
원래 비교를 결정한 주문은 PET 300병과 white lids였고, 카탈로그에는 300-neck와 500-neck 뚜껑이 모두 있었습니다. 첫 실행에서는 Sonnet 5가 병목에 맞는 300 뚜껑이라고 추론해 확인했지만 Haiku 4.5는 어떤 뚜껑인지 되물었고, 반복 실행에서는 Sonnet 5가 다섯 번 모두 되물은 반면 Haiku 4.5가 같은 확인 답변을 한 번 냈습니다. 이 사례는 단일 실행에서 나온 성공 답변 하나가 모델의 일관된 능력처럼 보일 수 있음을 구체적으로 드러냅니다.
04
29개 질문은 정보만으로 정답을 하나로 좁힐 수 있는 유형과, 사람에게 확인을 요청해야 하는 판단 불가능한 유형으로 나뉘었습니다. 첫 유형에서 반복에 따른 답변 변화는 더 자주 확인을 요청하는 안전한 방향으로만 나타났고, 위험한 변화인 임의 확인은 두 번째 유형에서 모델별로 145회 중 한 번씩 발생했습니다. 따라서 치명적 오류가 없다는 결과와 함께, 어떤 질문 유형에서 불확실성을 안전하게 처리했는지도 분리해 측정해야 합니다.
05
댓글에서 나온 핵심 한계는 같은 29개 질문을 다섯 번 반복했을 뿐 145개의 서로 다른 질문을 시험한 것은 아니라는 점입니다. 이번 재실행은 기존 시험 항목이 반복될 때 안정적인지를 알려주지만, 모델이 보지 못한 새로운 주문 유형에 대한 성능이나 일반화까지 넓혀 주지는 않습니다. 새로운 질문에 대한 신뢰도를 높이려면 반복 횟수만 늘릴 것이 아니라 질문의 종류 자체를 추가해야 합니다.

용어 해설

Temperature
LLM이 같은 입력에 대해 서로 다른 답을 낼 가능성을 조절하는 생성 설정입니다. 값을 고정하거나 낮추면 출력 변동이 줄고, 그대로 둔 채 반복 실행하면 모델의 답변 안정성과 위험한 변동을 측정할 수 있습니다.
치명적 오류(Fatal Error)
주문 처리 결과가 실제 업무에서 허용할 수 없는 수준으로 잘못된 경우를 뜻합니다. 이 글에서는 145회 실행 중 그런 오류가 한 번이라도 발생했는지를 모델별 위험성 비교의 핵심 지표로 사용했습니다.
무오류 실행(Clean Sheet)
29개 질문을 한 번 실행하는 동안 치명적 오류나 위험한 확인 없이 모든 처리가 안전하게 끝난 실행입니다. 145회 실행 중 무오류 실행 횟수를 비교해 단일 시험의 우연한 승패를 보완했습니다.
이상치(Outlier)
반복 측정에서 일반적인 분포와 다르게 나타난 단일 결과입니다. 한 번만 시험하면 이런 우연한 답변이 모델 간 우열처럼 보일 수 있어, 같은 시험을 여러 차례 반복해야 순위 왜곡을 줄일 수 있습니다.
판단 불가능한 질문(Undecidable Question)
주어진 주문·카탈로그 정보만으로 하나의 정답을 확정할 수 없는 질문입니다. 이런 경우 모델이 임의로 확인하는 대신 사람에게 추가 확인을 요청하는 것이 안전한 처리로 간주됩니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 08. 31.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.