클로즈드북 벤치마크
외부 문서나 검색을 허용하지 않고 모델의 내재적 지식만으로 문제를 푸는 평가 방식으로, 모델의 암기·추론 능력을 시험한다. 글에서는 AA-Omniscience라는 클로즈드북 벤치에서 Opus 5가 Opus 4.8보다 약 11% 높은 정확도를 보였다는 수치가 제시됐다. 클로즈드북 평가는 검색 보조 없이 모델 자체의 응답 품질을 비교할 때 사용된다.