본문으로 건너뛰기

MMLU 점수는 왜 바로 비교할 수 없는가

같은 MMLU 이름의 0.781과 0.79도 평가 프레임이 다르면 유효한 차이로 계산할 수 없습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

MMLU라는 같은 benchmark 이름 아래에서 한 모델 계열의 build 42는 accuracy 0.781, build 44는 0.79를 기록했지만, 두 값의 단순한 차이인 +0.009는 비교 가능한 결과로 인정되지 않습니다. MMLU 이름만으로는 데이터 split, 실행 구현, prompt 형식, grader, runner의 네트워크 접근 여부가 고정되지 않으며, 실제 측정에서는 이 조건들이 점수와 순위를 크게 바꿉니다. APL AI-Eval profile은 평가 절차와 범위를 content-addressed frame으로 만들고 claim에 그 해시를 연결하지만, 두 frame이 다를 때 score-delta를 허용하려면 별도의 유효한 bridge가 필요합니다. apl-valid는 기록 구조와 frame 연결이 올바르다는 뜻일 뿐 점수의 정확성이나 데이터셋 실행의 진실성을 보증하지 않으며, 이 사례의 verifier는 두 결과를 incomparable로 반환합니다.

섹션별 상세

01
build 42의 MMLU accuracy 0.781과 build 44의 0.79는 같은 provider와 model family, metric, unit을 공유하지만 서로 다른 artifact와 frame을 가리킵니다. 두 JSON 값의 산술 차이는 +0.009이지만, score-delta 관계는 두 측정이 같은 절차와 범위를 참조할 때만 의미를 갖습니다. 따라서 benchmark 이름과 숫자 형식이 같다는 사실만으로 모델 build 사이의 성능 차이를 확정할 수 없습니다.
json
{"apl":{"version":"0.1","claim":{"kind":"observation","subject":{"type":"model-build","id":"model:acme-gpt-7b-build-42","build_id":"42","artifact_digest":"sha256:4242424242424242424242424242424242424242424242424242424242424242","provider":"acme","model_family":"acme-gpt-7b"},"aspect_refs":["accuracy"],"statement":{"predicate":"score","content":{"benchmark_id":"mmlu","metric_id":"accuracy","value":0.781,"unit":"fraction"}}},"frame_ref":{"hash":"sha256:c7b88426f2676f3653db0fad0bdbd689318f16d589d14a315bdd4cc454bca1ab"}}}

MMLU accuracy 0.781을 기록한 build 42의 관측 claim이며, 모델 artifact와 평가 프레임의 SHA-256 해시를 함께 연결합니다.

json
{"apl":{"version":"0.1","claim":{"kind":"observation","subject":{"type":"model-build","id":"model:acme-gpt-7b-build-44","build_id":"44","artifact_digest":"sha256:4444444444444444444444444444444444444444444444444444444444444444","provider":"acme","model_family":"acme-gpt-7b"},"aspect_refs":["accuracy"],"statement":{"predicate":"score","content":{"benchmark_id":"mmlu","metric_id":"accuracy","value":0.79,"unit":"fraction"}}},"frame_ref":{"hash":"sha256:c93a9c55422ddbd2158a5336caa3a251641cf3937f451fb13387a5f54f0d998e"}}}

같은 모델 계열의 build 44가 MMLU accuracy 0.79를 기록한 claim이며, build 42와 다른 평가 프레임을 가리킵니다.

02
MMLU라는 benchmark_id는 데이터 split과 실행 조건을 완전히 지정하지 않습니다. 원 논문의 test는 14,079개, Hugging Face의 cais/mmlu config all은 test 14,042개로 보고되며, 글의 두 frame은 각각 dev 285개와 공개 artifact가 확인되지 않은 test-lite를 사용합니다. HELM·Eleuther harness·original code의 구현도 llama-65b에서 0.637·0.488·0.636을 내놓았고 순위까지 바꾸었으므로, 데이터셋 이름을 고정해도 입력 범위와 scoring target이 달라집니다.
03
MMLU 점수는 prompt 형식, 정답 위치, grader, runner의 접근 권한에도 좌우됩니다. Anthropic 자료는 option label이나 괄호 같은 formatting만으로 accuracy가 약 5% 움직일 수 있다고 보고했고, Zheng et al.은 정답 위치를 D로 옮겼을 때 gpt-3.5-turbo가 67.2에서 60.9로 낮아지고 llama-30b는 A 배치에서 15.2포인트 상승했다고 보고했습니다. 또한 llm judge의 위치 편향과 네트워크 접근에 따른 오염된 문항 검색은 평가 절차가 숫자 뒤에 숨은 입력·채점·환경 조건까지 기록해야 하는 이유를 뒷받침합니다.
04
비교 가능성은 숫자의 모양이 아니라 공통 reference로 이어지는 traceability에 붙습니다. APL AI-Eval profile은 runner_id, grader_id, prompt_protocol, benchmark variant, dataset split, subset을 frame에 넣고 RFC 8785 canonical bytes의 SHA-256을 claim에 연결해 절차와 범위를 식별합니다. Frame A의 subset "all"과 Frame B의 누락된 subset key도 canonical bytes 기준으로 서로 다른 scope이므로, 사람이 같은 기본값으로 읽을 것이라는 기대만으로 정규화되지 않습니다.
05
apl-ai-eval verifier는 구조 검증과 관계 평가를 별도 축으로 처리합니다. 각 claim만 검증하면 apl-valid가 나오지만, 두 claim에 score-delta를 요청하고 bridge를 주지 않으면 apl-cross-frame과 apl-bridge-not-found를 함께 내며 relation_outcome은 incomparable이 됩니다. aspect family가 accuracy와 judge-score처럼 다르면 bridge가 있어도 거부되며, 반대로 같은 grader와 scope에서 runner만 다른 score-delta용 bridge가 적용되면 bridged-comparable이 나오지만 그 결과도 bridge의 가정과 손실 범위 안에서만 해석해야 합니다.
json
{"core_outcome":"apl-valid","relation_outcome":"relation-not-evaluated","failure_classes":[],"diagnostics":["carrier-valid","apl-present","apl-frame-bound","apl-valid","same-frame","transformation-missing"]}

단일 claim을 검증한 결과로, 구조와 프레임 연결은 유효하지만 두 결과의 관계 계산은 요청되지 않았음을 나타냅니다.

json
{"left":{"core_outcome":"apl-valid","failure_classes":[]},"right":{"core_outcome":"apl-valid","failure_classes":[]},"relation_outcome":"incomparable","diagnostics":["apl-cross-frame","apl-bridge-not-found"]}

두 MMLU claim에 score-delta를 적용했을 때 프레임이 다르고 비교를 허가하는 bridge가 없어 incomparable을 반환한 결과입니다.

06
frame이 유효하다는 판정은 점수가 맞거나 평가가 실제로 선언된 조건대로 실행됐다는 증거가 아닙니다. MMLU-Redux는 MMLU 문항의 6.49%에 오류가 있다고 추정했고, AI-Eval v0.1은 dataset digest, sample_count, uncertainty, threshold 선택 시점 같은 정보를 요구하지 않습니다. 그러므로 frame은 어떤 조건의 관측인지 추적하는 계약을 제공하지만, 데이터 동일성·실행 신뢰성·측정 불확실성까지 자동으로 해결하지는 않습니다.

용어 해설

콘텐츠 주소 지정 객체(Content-Addressed Object)
객체의 내용에서 계산한 해시를 식별자로 사용하는 데이터 구조입니다. APL에서는 평가 프레임을 객체로 저장하고 그 해시를 claim에 연결해, 절차와 범위를 변경 불가능한 참조로 묶습니다.
추적성(Traceability)
측정 결과를 공통 기준이나 참조 절차까지 연결할 수 있는 성질입니다. 같은 숫자를 비교하려면 값 자체가 아니라 어떤 데이터·절차·채점 조건에서 나온 결과인지 추적되어야 합니다.
정규 직렬화(Canonical Serialization)
동일한 구조를 항상 같은 바이트열로 변환하는 규칙입니다. 이 글의 APL 프레임은 RFC 8785 방식으로 정규화한 바이트에 SHA-256을 적용하므로 공백이나 들여쓰기가 해시에 영향을 주지 않습니다.
측정 호환성(Measurement Compatibility)
두 측정값의 차이가 그 차이의 불확실성에 비해 작은지 판단하는 개념입니다. 공통 참조에 연결됐는지를 뜻하는 comparability와 달라, 숫자를 바로 빼도 된다는 근거가 되지 않습니다.
Few-Shot 평가(Few-Shot Evaluation)
소수의 예시를 프롬프트에 넣은 뒤 모델 성능을 측정하는 평가 방식입니다. MMLU에서는 5-shot 예시가 데이터셋 자체의 고정 속성이 아니라 실행 명령이나 프레임에 기록해야 하는 조건으로 취급됩니다.

기술

  • MMLU
  • cais/mmlu
  • HELM
  • lm-evaluation-harness
  • APL AI-Eval profile
  • apl-ai-eval
  • Rust
  • RFC 8785
  • SHA-256
  • SWE-bench Verified
  • MMLU-Redux

활용 사례

  • 서로 다른 팀이나 vendor가 제출한 benchmark 결과 비교
  • 분기별 모델 build 성능 변화 추적
  • 평가 로그와 claim의 재현성 검증
  • benchmark 결과에 대한 score-delta 관계 판정
  • bridge를 통한 제한적 cross-frame 비교
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.