섹션별 상세
에이전트 평가는 단일 턴 질의응답과 달리 도구 사용, 상태 변경, 중간 결과에 따른 적응 과정을 포함하는 다중 턴 루프를 검증해야 한다.

평가 체계는 입력과 성공 기준이 정의된 태스크, 실행 기록인 트랜스크립트, 환경의 최종 상태인 아웃컴으로 구성되며 이를 실행하는 평가 하네스가 필요하다.

채점 방식은 속도가 빠른 코드 기반(결정론적 테스트), 유연한 모델 기반(LLM 루브릭), 골드 표준인 인간 기반 채점자를 목적에 맞게 혼합하여 사용한다.
코딩 에이전트는 단위 테스트와 정적 분석을 통해 결정론적으로 평가하며, 대화형 에이전트는 사용자 시뮬레이터를 도입하여 상호작용의 품질과 최종 목표 달성 여부를 측정한다.
yaml
task:
id: "fix-auth-bypass_1"
desc: "Fix authentication bypass when password field is empty and ..."
graders:
- type: deterministic_tests
required: [test_empty_pw_rejected.py, test_null_pw_rejected.py]
- type: llm_rubric
rubric: prompts/code_quality.md
- type: static_analysis
commands: [ruff, mypy, bandit]
- type: state_check
expect:
security_logs: {event_type: "auth_blocked"}
- type: tool_calls
required:
- {tool: read_file, params: {path: "src/auth/*"}}
- {tool: edit_file}
- {tool: run_tests}
tracked_metrics:
- type: transcript
metrics: [n_turns, n_toolcalls, n_total_tokens]
- type: latency
metrics: [time_to_first_token, output_tokens_per_sec, time_to_last_token]코딩 에이전트의 보안 취약점 수정 태스크를 정의하고 결정론적 테스트, LLM 루브릭, 정적 분석 등 다양한 채점자와 지표를 설정하는 예시
에이전트의 성능 지표로 k번 시도 중 한 번이라도 성공하는 Pass@k와 k번 모두 성공해야 하는 Pass^k를 구분하여 신뢰성과 일관성을 동시에 파악한다.

평가 로드맵은 수동 테스트로 시작하여 명확한 태스크 작성, 견고한 하네스 구축, 트랜스크립트 분석을 통한 채점자 보정 순으로 진행하며 장기적인 유지보수 체계를 갖춘다.

자동화된 평가는 개발 속도를 높이지만, 실제 사용자 환경에서의 예외 사례를 잡기 위해 프로덕션 모니터링 및 수동 트랜스크립트 리뷰와 병행해야 한다.

용어 해설
- 평가 하네스(Evaluation Harness)
- — AI 모델이나 에이전트를 자동으로 실행하고 결과를 기록하며 채점 로직을 적용하는 테스트 인프라이다. 태스크를 병렬로 실행하고 트랜스크립트를 저장하며 최종 점수를 집계하는 역할을 수행하여 개발자가 반복적으로 성능을 측정할 수 있게 돕는다.
- Pass@k
- — 모델이 동일한 태스크에 대해 k번 시도했을 때 최소 한 번이라도 성공할 확률을 나타내는 지표이다. 에이전트의 잠재적인 문제 해결 능력을 측정하는 데 유용하며, k값이 커질수록 성공 확률이 100%에 수렴하는 경향을 보인다.
- 트랜스크립트(Transcript)
- — 에이전트가 태스크를 수행하는 동안 발생한 모든 메시지, 도구 호출, 추론 과정, 중간 결과의 전체 기록이다. 단순히 최종 결과만 보는 것이 아니라 에이전트가 어떤 경로로 정답에 도달했는지 또는 어디서 실패했는지 분석하는 핵심 데이터로 활용된다.
- LLM 판사(LLM-as-a-Judge)
- — 다른 AI 모델의 출력물을 평가하기 위해 고성능 LLM을 채점자로 사용하는 기법이다. 정해진 루브릭(평가 기준)에 따라 정성적인 답변의 품질이나 상호작용의 적절성을 평가하며, 인간의 판단과 높은 상관관계를 보이도록 튜닝하여 사용한다.
- 회귀 테스트(Regression Testing)
- — 새로운 코드 변경이나 모델 업데이트가 기존에 잘 작동하던 기능을 망가뜨리지 않았는지 확인하는 테스트이다. 에이전트 평가에서는 과거에 성공했던 태스크들을 다시 실행하여 성능 저하 여부를 100%에 가까운 통과율 기준으로 검증한다.
기술
- Claude API
- Harbor
- Promptfoo
- Braintrust
- LangSmith
- Langfuse
활용 사례
- Coding Agents
- Conversational Agents
- Research Agents
- Computer Use Agents
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 09.수집 2026. 03. 06.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
