본문으로 건너뛰기

GLM-5.3 벤치마크 결과

GLM-5.3이 두 벤치마크 목록에서 47.1%와 33.3%를 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 GLM-5.3을 벤치마크의 전체 36문제에 실행해 약 $200를 지출했고, 모델이 아직 어떤 문제도 완전히 해결하지 못했다고 적었다. Opus 보고서의 17 checkpoint 목록에서는 8개를 통과해 47.1%를 기록했으며, 비교 대상인 DeepSeek V4 Flash 0731·Opus 5·Qwen3.8-27B보다 높았다. Fable·Sol·Kimi 보고서의 30 checkpoint 목록에서는 10개, 33.3%로 Fable 5와 GPT-5.6 Sol에 동률이었다. 문제 난도가 높아질수록 배정 비용과 필요한 token output이 증가하는 경향도 함께 관찰됐다.

섹션별 상세

작성자는 GLM-5.3을 아직 포화되지 않은 벤치마크에서 평가하기 위해 평소의 9문제가 아니라 전체 36문제를 실행했다. 그 결과 실행 비용으로 약 $200가 발생했으며, 특정 모델이 벤치마크를 완전히 해결한 사례는 아직 없다고 적었다. 전체 문제를 사용한 실험이라 기존 결과보다 더 넓은 범위에서 모델 성능을 비교할 수 있다는 점이 핵심이다.
Opus 5 보고서의 3문제·17 checkpoint 목록에서 GLM-5.3 · pi는 17개 중 8개를 엄격 기준으로 통과해 47.1%를 기록했다. 같은 목록에서 DeepSeek V4 Flash 0731 · pi B는 5개로 29.4%, Opus 5 · Claude Code는 4개로 23.5%, Qwen3.8-27B · pi는 3개로 17.6%였다. 이 비교에서 GLM-5.3은 표에 포함된 시스템 중 가장 높은 점수를 냈다.
Fable·Sol·Kimi 보고서의 6문제·30 checkpoint 목록에서는 GLM-5.3이 10개를 통과해 33.3%를 기록했다. 같은 엄격 기준에서 Fable 5 · Claude Code와 GPT-5.6 Sol · Codex도 각각 10개로 동률이었고, Kimi K3는 실행 환경에 따라 8개 또는 7개를 기록했다. 글쓴이는 문제 난도가 높아질수록 배정 비용과 해결에 필요한 토큰 출력량이 함께 증가하는 경향도 관찰했다.

용어 해설

엄격 기준(Strict threshold)
벤치마크의 각 문제를 부분적으로 해결했는지가 아니라, 정해진 checkpoint를 모두 통과했는지를 기준으로 점수를 계산하는 방식이다. 이 글에서는 Opus 목록 17개와 Fable·Sol·Kimi 목록 30개에 적용됐다.
검증 지점(Checkpoint)
한 문제의 풀이가 요구사항을 충족하는지 확인하는 개별 검증 항목이다. 문제 수보다 checkpoint 수가 많을 수 있으며, 이 글의 점수는 통과한 검증 지점 수를 전체와 비교해 계산됐다.
토큰 출력량(Token output)
모델이 문제를 해결하는 과정에서 생성하는 텍스트 토큰의 양이다. 글쓴이는 난도가 높은 문제일수록 더 많은 비용이 배정되고, 해결에 필요한 출력 토큰도 늘어나는 경향이 있다고 관찰했다.

언급된 도구

Claude Code중립

모델을 실행해 Slopcodebench 결과를 산출하는 코딩 에이전트 환경으로 표에 포함됐다.

Codex중립

GPT-5.6 Sol의 벤치마크 실행 환경으로 표에 포함됐다.

OpenCode중립

DeepSeek V4 Flash와 Kimi K3를 평가한 실행 환경으로 표에 포함됐다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.