섹션별 상세
기존 Setup 메뉴에 분리되어 있던 Testing Center를 Agentforce Studio 내부의 전용 탭으로 통합하여 접근성을 개선했다. 개발자는 Agent Builder에서 에이전트를 구축한 즉시 동일한 화면에서 테스트를 시작하고 실행 이력을 조회하여 성능 변화를 추적할 수 있다. 이를 통해 에이전트 개발과 검증 사이의 문맥 전환 비용을 줄이고 디버깅 역량을 강화했다.
단일 질의응답 방식에서 벗어나 전체 대화 흐름을 검증하는 Conversation-level testing 기능을 도입했다. '불만 있는 고객'이나 '주의가 산만한 사용자'와 같은 사전 정의된 페르소나를 선택하면 시스템이 에이전트와 여러 차례 대화를 주고받으며 과업 완수 여부를 자동으로 채점한다. 특히 음성 에이전트의 경우 AI가 생성한 음성 대화를 직접 재생하여 품질을 확인할 수 있다.
사용자가 직접 자연어로 평가 기준을 정의할 수 있는 Custom evaluations 기능을 추가하여 비즈니스 특화 지표 측정을 지원한다. 예를 들어 '에이전트의 응답이 얼마나 정중한지 0~5점 척도로 평가하라'는 지침을 입력하면 LLM Judge가 이를 기반으로 점수와 근거를 산출한다. 생성된 맞춤형 지표는 테스트 그리드에 새로운 열로 추가되어 기본 지표와 함께 한눈에 비교할 수 있다.
테스트 케이스를 수정하기 위해 CSV 파일을 다운로드하고 다시 업로드해야 했던 번거로움을 해결하기 위해 Inline editing 기능을 구현했다. 그리드 인터페이스에서 예상 응답값이나 테스트 데이터를 직접 클릭하여 수정할 수 있으며 변경 사항이 즉시 반영된다. 또한 상세 JSON 뷰어를 통해 각 단계별 지연 시간, LLM의 추론 과정, 실행 트레이스 등 심층적인 데이터를 제공한다.
CLI 기반의 ADLC Skills를 통해 브라우저를 열지 않고도 터미널이나 IDE에서 에이전트 테스트를 제어할 수 있는 환경을 구축했다. 개발자는 sf agent run test 명령어로 테스트를 실행하고 결과를 조회할 수 있으며 이는 Cursor나 Claude Code 같은 AI 코드 에디터와도 연동된다. 특히 CI/CD 파이프라인에 통합하여 테스트 통과 시에만 배포를 허용하는 품질 게이트를 설정할 수 있다.
근거 모음
근거
- 지난해 4분기 Agentforce 고객들은 20조 개 이상의 토큰을 소비했으며 이는 전년 대비 400% 증가한 수치이다. — 아티클 도입부 첫 문장
- Agentblazers는 4분기에 17억 9천만 개의 에이전트 작업 단위(AWU)를 기록했다. — 아티클 도입부 두 번째 문장
기술
- Agentforce Studio
- Agentforce Testing Center
- ADLC Skills
- Salesforce CLI
- LLM Judge
활용 사례
- 고객 서비스 에이전트의 대화 품질 시뮬레이션
- 에이전트 배포 전 자동화된 품질 게이트 구축
- 맞춤형 비즈니스 지표 기반의 에이전트 성능 벤치마킹
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 15.수집 2026. 04. 15.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

