본문으로 건너뛰기
r/LLMDevs조회 3

LLM 주문 매핑의 치명적 오류를 막은 시험 설계

Haiku 4.5의 치명적 오류를 잡아낸 시험에서 정답표와 채점기의 허점, LLM Judge의 교차 검증 효과가 드러났습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

실제 고객 주문을 상품 코드로 변환하는 파이프라인에서 배송 사고를 막기 위해 29개 테스트 문장과 정답표, 자동 채점기를 구축했습니다. Haiku 4.5는 치명적 오류를 내지 않았지만, 시험 작성자는 정답표에서 세 번, 채점 코드에서 두 번 실수했습니다. 작성자는 원점수 대신 사람이 되돌릴 수 있는지를 기준으로 Fatal, Risky, Missed, Harmless 등급을 적용하고 Fatal이 하나라도 있으면 배포하지 않는 규칙을 사용했습니다. Sonnet은 같은 답안을 재채점해 채점기의 두 버그를 찾아냈지만, LLM이 만든 50개 시험은 지정된 구성 밖의 실패 모드를 한 번도 포착하지 못해 사람의 적대적 테스트 설계가 여전히 필요했습니다.

실용적 조언

  • 상품 코드 매핑 시험을 만들 때 정답률 하나만 기록하지 말고 Fatal, Risky, Missed, Harmless처럼 복구 가능성을 반영한 등급을 별도로 기록해야 합니다.
  • 배포 규칙에는 Fatal 오류 허용 개수를 명시하고, 원점수가 높아도 Fatal이 있으면 배포를 중단하는 조건을 넣어야 합니다.
  • 모델 답안을 자동 채점한 뒤 Sonnet 같은 별도의 LLM으로 같은 정답표와 기준을 적용해 재채점하면 정답표와 채점 코드의 불일치를 확인할 수 있습니다.
  • LLM이 만든 시험 문항을 그대로 신뢰하지 말고 사람이 상품 카탈로그의 모호성, 입력 형식의 변형, 주문이 아닌 문장 등 새로운 실패 모드를 추가해야 합니다.

섹션별 상세

01
고객의 KakaoTalk 주문 문장을 상품 코드로 바꾸는 작은 파이프라인에서 잘못된 매핑은 실제 상품이 고객에게 배송되는 치명적 오류로 이어질 수 있습니다. 작성자는 29개 테스트 문장과 정답표, 자동 채점기를 만들고 상품 카탈로그에 폭이 다른 tape 두 종류와 이름이 250으로 시작하는 상품 다섯 개, 주문처럼 보이는 질문을 넣었습니다. Haiku 4.5는 되돌릴 수 없는 오류를 한 번도 내지 않았고, 유일한 실질적 오답은 추론 가능한 주문에 확인을 요청한 보수적 대응이었습니다.
02
단순 정답률 대신 사람이 오류를 되돌릴 수 있는지를 기준으로 Fatal, Risky, Missed, Harmless 네 등급을 적용했습니다. Fatal이 하나라도 있으면 전체 점수가 높아도 배포하지 않는 규칙을 두어, 원점수보다 실제 배송 사고 가능성을 우선했습니다. 이 기준에서는 더 높은 점수보다 치명적 오류가 없는 모델을 선택하는 판단이 가능해집니다.
03
작성자가 만든 자동 채점기는 두 답안에서 모델이 추측하지 않고 확인을 요청한 행동을 감점했지만, Sonnet이 같은 29개 답안과 같은 평가 기준으로 재채점하면서 두 판정을 문제 삼았습니다. 두 사례 모두 Sonnet의 판단이 맞았고, 오류의 원인은 모델이 아니라 채점 코드였습니다. 따라서 LLM을 결과 생성에만 쓰지 않고 평가 파이프라인의 독립적인 검사자로 배치하면 사람이 작성한 채점 규칙의 결함도 찾을 수 있습니다.
04
LLM을 시험 문제 작성자로 사용한 실험에서는 50개 문항이 사실 오류 없이 생성됐지만, 작성자가 지정한 구성에서 한 번도 벗어나지 않았습니다. 모델은 정해진 범위 안에서 촘촘한 문제를 만들었지만, 실제 운영에서 발생할 새로운 실패 조건을 스스로 발굴하지는 못했습니다. 그래서 시험의 기본 문항 생성은 LLM에 맡기더라도 예상 밖의 실패 모드를 찾는 역할은 사람이 계속 맡아야 합니다.

용어 해설

심각도 기반 평가(Severity Grading)
모델의 응답을 단순한 정답률로 나누지 않고 실제 피해 가능성에 따라 Fatal, Risky, Missed, Harmless로 분류하는 방식입니다. 사람이 되돌릴 수 없는 오류를 별도로 관리해 배포 여부를 결정합니다.
LLM 심사자(LLM Judge)
한 LLM이 다른 모델의 답안을 미리 정한 기준에 따라 다시 평가하는 구조입니다. 자동 채점 코드의 누락이나 잘못된 판정을 찾아내는 보조 검증 단계로 활용됩니다.
자동 채점기(Auto-grader)
테스트 입력에 대한 모델의 상품 코드 선택과 확인 요청 여부를 정답표 및 규칙과 비교해 점수화하는 프로그램입니다. 이 사례에서는 정답표와 채점 코드 자체의 오류도 함께 드러났습니다.
실패 모드(Failure Modes)
모델이 어떤 조건에서 잘못된 상품을 선택하거나 불필요하게 확인을 요청하는지 나타내는 오류 유형입니다. 사람이 예상하지 못한 실패 모드를 시험에 넣어야 실제 운영 위험을 측정할 수 있습니다.

언급된 도구

llm-test-harness중립링크

주문 메시지와 상품 코드 매핑을 검증하기 위한 MIT 라이선스 저장소입니다. 코드와 29개 테스트 사례, LLM Judge 스크립트가 포함되어 있습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.