섹션별 상세
기존의 단발성 평가 방식은 사용자의 피드백이나 목표 변경과 같은 동적인 대화 흐름을 검증하는 데 한계가 있다. ActorSimulator는 고정된 입출력 쌍 대신 LLM 기반의 가상 사용자를 투입해 에이전트와 실시간으로 대화하며 이 간극을 메운다.

가상 사용자는 일관된 페르소나와 명확한 목표를 유지하며 에이전트의 반응에 따라 유연하게 대화를 이어간다. 에이전트가 불충분한 답변을 제공하면 추가 질문을 던지고, 대화가 산으로 가면 원래 목표로 유도하는 등 실제 사용자다운 행동을 재현한다.
ActorSimulator는 대화의 각 단계에서 가상 사용자의 내부 추론 과정을 구조화된 데이터로 제공한다. 개발자는 이를 통해 에이전트가 왜 특정 지점에서 실패했는지, 혹은 어떤 페르소나에게 취약한지를 상세히 분석할 수 있다.
python
from strands import Agent
from strands_evals import ActorSimulator, Case, Experiment
# Define your test case
case = Case(
input="I want to plan a trip to Tokyo with hotel and activities",
metadata={"task_description": "Complete travel package arranged"}
)
# Create user simulator from test case
user_sim = ActorSimulator.from_case_for_user_simulator(
case=case,
max_turns=5
)
# Run the multi-turn conversation
user_message = case.input
conversation_history = []
while user_sim.has_next():
agent_response = agent(user_message)
agent_message = str(agent_response)
// ...(중략)
user_result = user_sim.act(agent_message)
user_message = str(user_result.structured_output.message)ActorSimulator를 사용하여 가상 사용자와 에이전트 간의 다회차 대화 루프를 구현하는 기본 예시

OpenTelemetry와 통합되어 대화 전체의 트레이스 데이터를 수집하고 이를 세션 단위로 매핑하여 평가 파이프라인에 전달한다. HelpfulnessEvaluator나 GoalSuccessRateEvaluator를 통해 대화 전체의 성공률과 유용성을 수치화된 리포트로 확인할 수 있다.

용어 해설
- 다회차 평가(Multi-turn Evaluation)
- — AI 에이전트와 사용자 간에 여러 번의 질문과 답변이 오가는 대화 전체를 평가하는 방식이다. 단발성 응답의 정확도를 넘어 대화의 맥락 유지, 목표 달성 여부, 사용자의 의도 변화에 대한 대응력을 측정하는 데 필수적이다.
- 페르소나 일관성(Persona Consistency)
- — 시뮬레이션된 사용자가 대화 내내 동일한 성격, 전문 지식 수준, 말투를 유지하는 특성이다. 평가 데이터의 신뢰성을 확보하기 위해 가상 사용자가 한 대화 안에서 태도나 지식 수준을 급격히 바꾸지 않도록 제어하는 것이 중요하다.
- 목표 지향적 행동(Goal-driven Behavior)
- — 가상 사용자가 특정 목적을 달성할 때까지 대화를 지속하고, 목적이 달성되었는지 스스로 판단하여 종료하는 메커니즘이다. 무의미한 대화 반복을 방지하고 실제 사용자의 문제 해결 과정을 재현하기 위해 사용된다.
- 트레이스 데이터(Trace Data)
- — 분산 시스템에서 요청이 처리되는 전체 경로를 기록한 데이터이다. AI 에이전트 평가에서는 도구 호출, 모델 실행 시간, 내부 로직 흐름 등을 포함하여 대화의 각 단계에서 발생한 상세 실행 내역을 분석하는 데 활용된다.
기술
- Strands Evaluation SDK
- Python
- OpenTelemetry
- Amazon Bedrock
활용 사례
- 여행 예약 에이전트의 다회차 대화 검증
- 고객 지원 챗봇의 목표 달성률 측정
- 다양한 사용자 페르소나에 대한 에이전트 대응력 테스트
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 03.수집 2026. 04. 03.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.