본문으로 건너뛰기

Amazon Bedrock AgentCore에서 커스텀 코드 기반 평가기 구축하기

Amazon Bedrock AgentCore에서 AWS Lambda를 활용해 스키마 검증, 수치 정확도, PII 탐지 등 결정론적 코드 기반 평가기를 구축하고 운영하는 방법을 설명합니다.

섹션별 상세

01
에이전트의 출력은 JSON 스키마 준수, 수치 정확도, PII 보호 등 엄격한 비즈니스 규칙을 요구한다. 코드 기반 평가기는 LLM이 처리하기 어려운 결정론적 검증을 AWS Lambda를 통해 수행하여 에이전트의 신뢰성을 보장한다.
02
평가기는 TRACE, TOOL_CALL, SESSION 세 가지 레벨로 등록되어 에이전트의 생명주기 전반을 모니터링한다. TRACE 레벨은 개별 응답 검증, SESSION 레벨은 전체 대화의 워크플로 준수 여부를 확인하는 데 적합하다.
TRACE, TOOL_CALL, SESSION 레벨의 Lambda 호출 패턴 비교 다이어그램.
Diagram에이전트 아키텍처에서 평가기가 적용되는 세 가지 레벨을 시각화한다. 각 레벨별로 Lambda가 어떻게 호출되는지(요청당 1회, 툴 호출당 1회, 세션당 1회)를 보여주어 평가 전략 수립을 돕는다.
03
온디맨드 평가 모드는 개발 반복, 회귀 테스트, CI/CD 배포 게이트로 활용된다. 특정 세션을 동기적으로 평가하여 프롬프트나 툴 정의 변경이 에이전트 성능에 미치는 영향을 즉각적으로 확인한다.
온라인 평가와 온디맨드 평가의 흐름 비교.
Diagram지속적인 모니터링을 위한 온라인 평가와 CI/CD 및 개발을 위한 온디맨드 평가의 차이를 설명한다. 데이터 소스부터 평가기 호출, 결과 발행까지의 전체 파이프라인을 명확히 보여준다.
04
온라인 평가 모드는 프로덕션 트래픽을 주기적으로 샘플링하여 CloudWatch 메트릭으로 결과를 발행한다. 이를 통해 품질 저하를 실시간으로 감지하고, 임계값 위반 시 알람을 설정하여 운영 안정성을 확보한다.
CloudWatch 대시보드상의 코드 기반 평가 결과.
ScreenshotPII 탐지, 스키마 검증, 주가 드리프트 등 다양한 평가 지표가 CloudWatch 대시보드에 시각화된 모습이다. 평가 결과가 메트릭으로 어떻게 변환되어 모니터링되는지 보여준다.

이미지 분석

Market Trends Agent의 아키텍처 다이어그램.
Diagram

AgentCore Runtime, Memory, Browser tools, Amazon Bedrock LLMs 간의 상호작용을 보여준다. 에이전트가 어떻게 도구를 사용하고 메모리를 관리하는지 구조적으로 이해할 수 있다.

Market Trends Agent의 아키텍처 다이어그램.

용어 해설

LLM 기반 평가(LLM-as-a-Judge)
LLM을 사용하여 다른 모델의 출력물이나 에이전트의 응답 품질을 평가하는 기법. 정성적인 답변의 유용성, 톤, 논리적 일관성을 판단하는 데 주로 사용된다.
오픈텔레메트리(OpenTelemetry)
소프트웨어의 성능과 동작을 관측하기 위한 표준화된 프레임워크. 에이전트의 실행 과정에서 발생하는 스팬(span) 데이터를 수집하여 추적 및 분석을 가능하게 한다.
개인식별정보(PII)
이름, 주민등록번호, 연락처 등 개인을 식별할 수 있는 정보. 에이전트가 응답 과정에서 이를 노출하지 않도록 탐지하고 차단하는 것이 보안 및 규정 준수의 핵심이다.

기술

  • Amazon Bedrock
  • AWS Lambda
  • LangGraph
  • Amazon Comprehend
  • OpenTelemetry

활용 사례

  • 금융 시장 인텔리전스 에이전트
  • PII 데이터 유출 방지
  • CI/CD 배포 품질 게이트
  • 에이전트 워크플로 준수 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.