TL;DR
smevals는 eval 디렉터리와 YAML로 태스크와 설정을 정의하고 uvx 커맨드로 실행·채점·리포트를 만드는 소규모 평가 도구입니다. 실행(run)과 채점(grade)을 분리해 재채점이나 기준 변경을 비용 적게 반복할 수 있으며, 체크 시스템은 단순 문자열 검사부터 다른 모델을 호출하는 복잡한 검사까지 허용합니다. 로컬 serve와 정적 HTML build를 통해 결과를 시각화하고 공유할 수 있어 모델 비교와 실험 반복에 적합합니다.
섹션별 상세
이미지 분석

스크린샷은 하이쿠 평가 결과를 정리한 대시보드를 보여주며 리더보드(예: gpt-5.5 0.972, gpt-4.1-mini 0.864, gpt-5.4-nano 0.764), 최근 실행 목록과 최근 채점 점수(예: 0.97, 0.76 등)를 포함한다. 화면 하단에는 grader 설정으로 보이는 'pass threshold 0.8' 텍스트가 보이며, 이는 빌트인 리포트가 합격 기준과 세부 점수를 모두 노출함을 의미한다. 이 UI는 run·grade 결과를 직관적으로 비교하고 실패 사례를 추적하는 데 유용한 정보를 제공한다.
smevals 데모 리포트 스크린샷
용어 해설
- 평가(evaluation)(eval)
- — 특정 모델의 능력을 묻기 위해 구성한 도전 과제들의 집합으로, 여러 과제(tasks)와 설정(config)을 모아 동일한 질문에 대해 모델 성능을 비교·측정하도록 구성한다.
- 태스크(task)
- — eval을 구성하는 개별 도전 과제로서 구체적인 입력과 기대 동작을 가진 단위이며, 예컨대 '펠리컨에 대한 하이쿠 생성'처럼 하나의 검증 항목으로 실행된다.
- 설정(config)(config)
- — 어떤 모델과 추가 매개변수(system prompt, 모델 파라미터, 에이전트 하니스 등)를 사용해 태스크를 실행할지 규정하는 파일이며, 동일 태스크에 대해 여러 config로 비교 실험을 수행한다.
- 런(run)(run)
- — 특정 config로 특정 태스크를 실행해 생성된 출력과 메타데이터를 기록한 단위로, 이후 grading에서 이 기록을 근거로 채점하거나 재평가할 수 있다.
- 그레이더(grader)(grader)
- — 수집된 run 결과를 평가하는 구성 요소로 일련의 체크(checks)를 실행해 점수를 산출하며, 간단한 문자열 검사부터 외부 스크립트·다른 모델 호출로 이루어진 복합 검사까지 포함할 수 있다.
코드 예제
uvx smevals docs로컬 커맨드로 smevals의 README를 출력해 도구 사용법과 예제를 확인한다. 이 명령은 사용자가 평가를 시작하기 전에 요구되는 파일 구조와 기본 커맨드를 빠르게 확인하도록 돕는다. 문서 출력을 바탕으로 eval 디렉터리와 YAML을 준비하게 된다.
uvx smevals build path-to-eval/지정한 eval 디렉터리를 정적 HTML 리포트로 변환해 어디서든 호스팅할 수 있는 결과물을 생성한다. 빌드 과정은 이미 수행된 run과 grade 결과를 수집해 보기 쉬운 대시보드 형태의 페이지로 정리한다. 정적 리포트는 외부 공유나 아카이빙에 유용하다.
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6지정한 eval을 여러 모델(config)로 실행해 run 기록을 생성한다. 각 -m 옵션은 서로 다른 config를 가리키며, 결과는 개별 run 파일로 남겨 이후 grading이나 비교에 사용된다. 모델별로 반복 실행해 다양한 설정을 수집할 때 유용하다.
uvx smevals grade path-to-eval/이미 수집된 run들에 대해 정의한 grader를 실행해 점수와 체크 결과를 생성한다. grading은 run 생성과 분리되어 있어 재채점만으로 기준을 조정하거나 새로운 체크를 적용할 수 있다. 이 방식은 비용이 큰 재실행을 피하면서 평가 기준을 반복 실험하게 한다.
uvx smevals serve path-to-eval/로컬 웹서버를 띄워 빌드하지 않아도 브라우저로 결과를 탐색할 수 있게 한다. serve는 run과 grade의 요약, 리더보드, 최근 실행 목록 등을 인터랙티브하게 보여주므로 분석과 디버깅에 편리하다. 개발 중 빠른 반복 확인에 적합하다.
근거 모음
- run(실행)과 grading(채점) 작업은 분리되어 있어 이미 수집된 run을 재채점할 수 있다. — 본문에 있는 'Runs are treated separately from grading operations'와 'uvx smevals run' 및 'uvx smevals grade' 명령 예시.
- 정적 HTML 리포트를 생성해 어디서든 호스트할 수 있다. — 본문의 'smevals build command to build that report as static HTML' 관련 문장과 빌드 커맨드 예시.
- grader는 단순 문자열 검사에서부터 다른 모델을 호출하는 복합 검사까지 체크를 실행할 수 있다. — 본문의 'These can be simple operations... or using other models to answer questions about the run' 구절.
기술
- uvx smevals 커맨드
- gpt-5.5
- claude-opus-4.6
- YAML
활용 사례
- 다양한 모델·프롬프트·하니스 설정을 동일 태스크로 비교할 때
- 반복 실행 결과를 재채점해 채점 기준을 조정할 때
- 정적 HTML 리포트로 평가 결과를 공유하거나 아카이빙할 때
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
