프론티어 벤치마크
프론티어 벤치마크는 최신 대형 모델들의 최상위 능력을 비교하기 위해 설계된 평가 모음으로서 언어 이해·추론·생성 품질을 포함하여 모델 간 미세한 성능 차이를 드러낸다. 입력 텍스트를 처리하고 생성 결과를 채점·집계하는 방식으로 작동하며 보통 여러 데이터셋과 인간 평가를 결합한다. 이 글에서는 Artificial Analysis와 Arena.ai 같은 독립 업체의 결과로 Kimi K3가 특정 프론티어 벤치에서 Opus 4.8을 앞섰다는 점이 논쟁의 출발점이다.