본문으로 건너뛰기

LLM 64% 신뢰도 수치를 200문항으로 재검증한 벤치마크

634개 추론 문항에서 나온 LLM 64% 신뢰도 수치를 200문항 재구성판으로 다시 평가했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Luc Julia가 LLM의 일반적 신뢰도로 인용해 온 64%는 수백만 개의 사실 검증 결과가 아니라 2022년 12월 ChatGPT 스냅샷을 634개 추론 질문으로 평가한 Bang et al. (2023)의 63.41%에서 비롯됐습니다. GitHub 저장소는 원 논문의 추출 코드와 프롬프트를 바탕으로 연역·귀납·수학·공간·상식 등 열 가지 범주를 200문항으로 축소하고, 답변을 의미 기반 이진 채점으로 재현할 절차를 제공합니다. 같은 세트에서 GPT-5.6 Sol은 96.50%, Claude Opus 5는 98.50%를 기록해 후속 모델이 GPT-3.5의 63.41%를 크게 웃돌았지만, 이 결과 역시 특정 질문 세트에 대한 정확도일 뿐 LLM 전반의 신뢰도는 아닙니다. 원 논문의 표본 배정과 데이터 라벨에 불일치가 있고 평가 설정의 일부가 기록되지 않았다는 점도 함께 남아 있습니다.

섹션별 상세

01
Luc Julia가 여러 해 동안 대규모 언어 모델의 일반적인 신뢰도처럼 인용한 64% 수치는 Bang et al. (2023)의 한 문장에서 출발했습니다. 실제 평가는 2022년 12월 ChatGPT 스냅샷에 634개의 수작업 선별 질문을 제시한 추론 실험이었으며, 수백만 개의 사실을 참·거짓으로 판별한 검증 실험은 아니었습니다. 저장소는 이 차이를 분리해 63.41%라는 원래 수치가 특정 질문 세트와 평가 절차에 귀속된다는 점을 재검증합니다.
02
원 논문의 634회 시행은 연역·귀납·귀추·수학·시간·공간·상식·인과·다중 홉·유추 추론으로 구성됩니다. 최종 집계는 30문항 시리즈 17개, 32문항 SpaRTQA 시리즈 2개, 20문항 StepGame 진단 3개를 합친 17×30 + 2×32 + 3×20 = 634입니다. 다만 Mathematics Dataset의 표와 본문이 7/30과 13/30으로 엇갈리고, StepGame 추출 함수가 잘못된 정답 라벨을 가진 항목 하나를 제거하는 등 출판물만으로는 수치를 완전히 재생성하기 어렵습니다.
03
재구성판은 원 추출 코드와 프롬프트를 최대한 유지하면서 200개 행으로 평가 규모를 줄였습니다. 대부분의 30문항 시리즈에서는 9개를 뽑고, MATH는 여섯 모듈에서 2개씩, SpaRTQA는 네 질문 유형에서 3개씩, StepGame 진단은 6개씩 배정해 단순하고 추적 가능한 표본 구성을 만들었습니다. data.csv와 열 개의 part_*.csv 파일에 질문과 정답이 들어 있어 동일한 입력을 여러 모델에 적용할 수 있습니다.
04
재구성 결과는 GPT-3.5 63.41%, GPT-5.6 Sol 96.50%, Claude Opus 5 98.50%로 나타났습니다. 이는 후속 모델이 GPT-3.5가 평가받은 동일한 추론 세트에서 더 높은 점수를 얻었다는 뜻이며, 오늘날 모델의 일반적 신뢰도를 증명하는 수치는 아닙니다. 저장소가 검증하는 범위는 63.41% 수치 뒤에 있는 고정 과제의 현재 모델 성능이지 모든 사실 판단이나 환각 발생률이 아닙니다.
GPT-3.5, GPT-5.6 Sol, Claude Opus 5의 재구성 벤치마크 점수를 비교한 막대그래프입니다.
Chart그래프는 GPT-3.5가 63.4%, Luc Julia의 현재 추정치가 약 61%, GPT-5.6 Sol이 96.5%, Claude Opus 5가 98.5%임을 보여줍니다. 본문 표의 GPT-3.5 63.41%와 두 후속 모델의 재구성 결과를 시각적으로 비교하며, 최신 모델 점수가 해당 고정 질문 세트에서 더 높다는 핵심 결과와 연결됩니다.
05
평가 절차는 모델별로 새 대화 하나씩을 열고 각 part 파일의 Your answer 열만 채우게 한 뒤, 원래 행과 열을 보존해 병합하는 방식입니다. 채점자는 의미가 분명한 정답 표현과 선택지 라벨을 서로 바꿔 인정하지만, bAbI의 복수 하위 질문은 모든 답이 맞아야 행 전체를 정답으로 처리합니다. TimeDial은 두 개의 허용 정답 중 하나를 인정하고 SpaRTQA는 필요한 관계를 모두 포함하면서 모순된 관계를 추가하지 않아야 합니다.

용어 해설

추론 벤치마크(Reasoning Benchmark)
모델이 주어진 질문을 얼마나 정확하게 해결하는지 측정하는 평가 세트입니다. 이 저장소는 연역·귀납·수학·공간·상식 등 열 가지 추론 범주에서 선별한 질문과 정답을 사용해 모델의 답변을 채점합니다. 점수는 특정 모델과 고정된 질문 세트의 조합에 대한 결과이므로 일반적인 신뢰도와 동일하지 않습니다.
제로샷 평가(Zero-shot Evaluation)
모델에 별도 예시나 추가 학습을 제공하지 않고 질문을 바로 풀게 하는 평가 방식입니다. 원 논문은 2022년 12월 15일 ChatGPT 스냅샷에 공개 인터페이스로 질문을 입력하고 답변을 수작업으로 판정했습니다. 따라서 프롬프트 형식과 대화 설정이 결과에 직접 영향을 줍니다.
수작업 채점(Manual Grading)
모델의 답변을 정답과 의미적으로 비교해 사람이 맞고 틀림을 판정하는 방식입니다. 재구성판은 정답 의미가 명확하면 표현이나 선택지 라벨이 달라도 정답으로 인정하고, 여러 하위 질문은 모든 답이 맞아야 해당 행을 정답 처리합니다. 이 규칙은 이진 정확도를 재현 가능하게 만드는 핵심 조건입니다.
bAbI 과제(bAbI)
간단한 사실과 질문으로 모델의 추론 능력을 평가하는 데이터셋 계열입니다. 이 평가에서는 task 15를 연역 추론에, task 16을 귀납 추론에 사용하며 원문 프롬프트와 프롬프트 엔지니어링 버전을 별도 시행으로 계산합니다. 저장소는 두 과제의 라벨 혼동을 바로잡아 Appendix와 추출 코드의 처리를 따릅니다.
공간 추론(Spatial Reasoning)
객체 사이의 방향·거리·접촉 관계를 문장으로부터 추론하는 능력입니다. SpaRTQA와 StepGame은 위·아래·좌·우·대각선·시계 방향 같은 관계를 입력하고 하나 이상의 공간 관계를 답하게 합니다. 재구성판은 질문 유형과 진단 세트를 나눠 200문항 안에 균형 있게 포함합니다.

기술

  • ChatGPT
  • Python
  • CSV
  • bAbI
  • CLUTRR
  • alphaNLI
  • TimeDial
  • SpaRTQA
  • StepGame
  • CommonsenseQA
  • PIQA
  • PEP-3k
  • E-CARE
  • HotpotQA

활용 사례

  • 동일한 추론 질문 세트로 여러 LLM의 성능 비교
  • 공개 벤치마크 결과의 재현성 점검
  • 모델 답변을 의미 기반 이진 정확도로 수작업 채점
  • 벤치마크 수치가 일반적 신뢰도로 과대 해석되는지 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.