TL;DR
MMLU라는 같은 benchmark 이름 아래에서 한 모델 계열의 build 42는 accuracy 0.781, build 44는 0.79를 기록했지만, 두 값의 단순한 차이인 +0.009는 비교 가능한 결과로 인정되지 않습니다. MMLU 이름만으로는 데이터 split, 실행 구현, prompt 형식, grader, runner의 네트워크 접근 여부가 고정되지 않으며, 실제 측정에서는 이 조건들이 점수와 순위를 크게 바꿉니다. APL AI-Eval profile은 평가 절차와 범위를 content-addressed frame으로 만들고 claim에 그 해시를 연결하지만, 두 frame이 다를 때 score-delta를 허용하려면 별도의 유효한 bridge가 필요합니다. apl-valid는 기록 구조와 frame 연결이 올바르다는 뜻일 뿐 점수의 정확성이나 데이터셋 실행의 진실성을 보증하지 않으며, 이 사례의 verifier는 두 결과를 incomparable로 반환합니다.
섹션별 상세
{"apl":{"version":"0.1","claim":{"kind":"observation","subject":{"type":"model-build","id":"model:acme-gpt-7b-build-42","build_id":"42","artifact_digest":"sha256:4242424242424242424242424242424242424242424242424242424242424242","provider":"acme","model_family":"acme-gpt-7b"},"aspect_refs":["accuracy"],"statement":{"predicate":"score","content":{"benchmark_id":"mmlu","metric_id":"accuracy","value":0.781,"unit":"fraction"}}},"frame_ref":{"hash":"sha256:c7b88426f2676f3653db0fad0bdbd689318f16d589d14a315bdd4cc454bca1ab"}}}MMLU accuracy 0.781을 기록한 build 42의 관측 claim이며, 모델 artifact와 평가 프레임의 SHA-256 해시를 함께 연결합니다.
{"apl":{"version":"0.1","claim":{"kind":"observation","subject":{"type":"model-build","id":"model:acme-gpt-7b-build-44","build_id":"44","artifact_digest":"sha256:4444444444444444444444444444444444444444444444444444444444444444","provider":"acme","model_family":"acme-gpt-7b"},"aspect_refs":["accuracy"],"statement":{"predicate":"score","content":{"benchmark_id":"mmlu","metric_id":"accuracy","value":0.79,"unit":"fraction"}}},"frame_ref":{"hash":"sha256:c93a9c55422ddbd2158a5336caa3a251641cf3937f451fb13387a5f54f0d998e"}}}같은 모델 계열의 build 44가 MMLU accuracy 0.79를 기록한 claim이며, build 42와 다른 평가 프레임을 가리킵니다.
{"core_outcome":"apl-valid","relation_outcome":"relation-not-evaluated","failure_classes":[],"diagnostics":["carrier-valid","apl-present","apl-frame-bound","apl-valid","same-frame","transformation-missing"]}단일 claim을 검증한 결과로, 구조와 프레임 연결은 유효하지만 두 결과의 관계 계산은 요청되지 않았음을 나타냅니다.
{"left":{"core_outcome":"apl-valid","failure_classes":[]},"right":{"core_outcome":"apl-valid","failure_classes":[]},"relation_outcome":"incomparable","diagnostics":["apl-cross-frame","apl-bridge-not-found"]}두 MMLU claim에 score-delta를 적용했을 때 프레임이 다르고 비교를 허가하는 bridge가 없어 incomparable을 반환한 결과입니다.
용어 해설
- 콘텐츠 주소 지정 객체(Content-Addressed Object)
- — 객체의 내용에서 계산한 해시를 식별자로 사용하는 데이터 구조입니다. APL에서는 평가 프레임을 객체로 저장하고 그 해시를 claim에 연결해, 절차와 범위를 변경 불가능한 참조로 묶습니다.
- 추적성(Traceability)
- — 측정 결과를 공통 기준이나 참조 절차까지 연결할 수 있는 성질입니다. 같은 숫자를 비교하려면 값 자체가 아니라 어떤 데이터·절차·채점 조건에서 나온 결과인지 추적되어야 합니다.
- 정규 직렬화(Canonical Serialization)
- — 동일한 구조를 항상 같은 바이트열로 변환하는 규칙입니다. 이 글의 APL 프레임은 RFC 8785 방식으로 정규화한 바이트에 SHA-256을 적용하므로 공백이나 들여쓰기가 해시에 영향을 주지 않습니다.
- 측정 호환성(Measurement Compatibility)
- — 두 측정값의 차이가 그 차이의 불확실성에 비해 작은지 판단하는 개념입니다. 공통 참조에 연결됐는지를 뜻하는 comparability와 달라, 숫자를 바로 빼도 된다는 근거가 되지 않습니다.
- Few-Shot 평가(Few-Shot Evaluation)
- — 소수의 예시를 프롬프트에 넣은 뒤 모델 성능을 측정하는 평가 방식입니다. MMLU에서는 5-shot 예시가 데이터셋 자체의 고정 속성이 아니라 실행 명령이나 프레임에 기록해야 하는 조건으로 취급됩니다.
기술
- MMLU
- cais/mmlu
- HELM
- lm-evaluation-harness
- APL AI-Eval profile
- apl-ai-eval
- Rust
- RFC 8785
- SHA-256
- SWE-bench Verified
- MMLU-Redux
활용 사례
- 서로 다른 팀이나 vendor가 제출한 benchmark 결과 비교
- 분기별 모델 build 성능 변화 추적
- 평가 로그와 claim의 재현성 검증
- benchmark 결과에 대한 score-delta 관계 판정
- bridge를 통한 제한적 cross-frame 비교
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
