TL;DR
Luc Julia가 LLM의 일반적 신뢰도로 인용해 온 64%는 수백만 개의 사실 검증 결과가 아니라 2022년 12월 ChatGPT 스냅샷을 634개 추론 질문으로 평가한 Bang et al. (2023)의 63.41%에서 비롯됐습니다. GitHub 저장소는 원 논문의 추출 코드와 프롬프트를 바탕으로 연역·귀납·수학·공간·상식 등 열 가지 범주를 200문항으로 축소하고, 답변을 의미 기반 이진 채점으로 재현할 절차를 제공합니다. 같은 세트에서 GPT-5.6 Sol은 96.50%, Claude Opus 5는 98.50%를 기록해 후속 모델이 GPT-3.5의 63.41%를 크게 웃돌았지만, 이 결과 역시 특정 질문 세트에 대한 정확도일 뿐 LLM 전반의 신뢰도는 아닙니다. 원 논문의 표본 배정과 데이터 라벨에 불일치가 있고 평가 설정의 일부가 기록되지 않았다는 점도 함께 남아 있습니다.
섹션별 상세

용어 해설
- 추론 벤치마크(Reasoning Benchmark)
- — 모델이 주어진 질문을 얼마나 정확하게 해결하는지 측정하는 평가 세트입니다. 이 저장소는 연역·귀납·수학·공간·상식 등 열 가지 추론 범주에서 선별한 질문과 정답을 사용해 모델의 답변을 채점합니다. 점수는 특정 모델과 고정된 질문 세트의 조합에 대한 결과이므로 일반적인 신뢰도와 동일하지 않습니다.
- 제로샷 평가(Zero-shot Evaluation)
- — 모델에 별도 예시나 추가 학습을 제공하지 않고 질문을 바로 풀게 하는 평가 방식입니다. 원 논문은 2022년 12월 15일 ChatGPT 스냅샷에 공개 인터페이스로 질문을 입력하고 답변을 수작업으로 판정했습니다. 따라서 프롬프트 형식과 대화 설정이 결과에 직접 영향을 줍니다.
- 수작업 채점(Manual Grading)
- — 모델의 답변을 정답과 의미적으로 비교해 사람이 맞고 틀림을 판정하는 방식입니다. 재구성판은 정답 의미가 명확하면 표현이나 선택지 라벨이 달라도 정답으로 인정하고, 여러 하위 질문은 모든 답이 맞아야 해당 행을 정답 처리합니다. 이 규칙은 이진 정확도를 재현 가능하게 만드는 핵심 조건입니다.
- bAbI 과제(bAbI)
- — 간단한 사실과 질문으로 모델의 추론 능력을 평가하는 데이터셋 계열입니다. 이 평가에서는 task 15를 연역 추론에, task 16을 귀납 추론에 사용하며 원문 프롬프트와 프롬프트 엔지니어링 버전을 별도 시행으로 계산합니다. 저장소는 두 과제의 라벨 혼동을 바로잡아 Appendix와 추출 코드의 처리를 따릅니다.
- 공간 추론(Spatial Reasoning)
- — 객체 사이의 방향·거리·접촉 관계를 문장으로부터 추론하는 능력입니다. SpaRTQA와 StepGame은 위·아래·좌·우·대각선·시계 방향 같은 관계를 입력하고 하나 이상의 공간 관계를 답하게 합니다. 재구성판은 질문 유형과 진단 세트를 나눠 200문항 안에 균형 있게 포함합니다.
기술
- ChatGPT
- Python
- CSV
- bAbI
- CLUTRR
- alphaNLI
- TimeDial
- SpaRTQA
- StepGame
- CommonsenseQA
- PIQA
- PEP-3k
- E-CARE
- HotpotQA
활용 사례
- 동일한 추론 질문 세트로 여러 LLM의 성능 비교
- 공개 벤치마크 결과의 재현성 점검
- 모델 답변을 의미 기반 이진 정확도로 수작업 채점
- 벤치마크 수치가 일반적 신뢰도로 과대 해석되는지 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.