섹션별 상세
Polly는 이제 LangSmith의 모든 워크플로에서 하단 오른쪽 아이콘을 통해 상시 접근 가능하며, 페이지 이동 시에도 이전 대화 맥락을 유지하여 작업 흐름의 단절을 방지한다.
단순한 질의응답을 넘어 프롬프트 업데이트, 실패한 실행 기반의 데이터셋 생성, 프로젝트 뷰 필터링, 평가기 코드 작성 등 개발자가 직접 수행하던 액션을 자동화한다.
복잡한 대화 스레드 분석 기능을 통해 사용자의 불만 여부, 문제 해결 상태, 주요 대화 주제 등을 파악하여 에이전트의 성능과 사용자 경험을 정량적으로 진단한다.

평가기(Evaluator) 작성 및 개선 기능을 지원하여 환각 체크나 엣지 케이스 처리를 위한 로직을 생성하고 개발자와 협업하여 검증 정확도를 높인다.

다양한 실험 결과를 데이터 기반으로 비교 분석하여 어떤 프롬프트나 모델 변경이 실제로 성능 향상을 이끌어냈는지에 대한 구체적인 권장 사항을 제시한다.

용어 해설
- 트레이스(Trace)
- — LLM 애플리케이션의 실행 과정을 단계별로 기록한 로그 데이터이다. 각 단계의 입력, 출력, 소요 시간, 토큰 사용량 등을 포함하며 복잡한 에이전트의 실패 원인을 파악하는 디버깅의 핵심 도구로 활용된다.
- 평가기(Evaluator)
- — LLM의 응답 품질을 자동으로 측정하기 위한 로직이나 모델이다. 정확성, 관련성, 환각 여부 등을 사전에 정의된 기준에 따라 점수화하여 모델의 성능을 객관적으로 판단할 수 있게 돕는다.
- 스레드(Thread)
- — 사용자와 AI 에이전트 간에 발생하는 일련의 연속된 대화 묶음이다. 단일 메시지 분석보다 넓은 맥락에서 사용자의 의도, 감정 상태, 문제 해결 여부를 파악하는 데 중요한 단위가 된다.
- 실험(Experiment)
- — 서로 다른 프롬프트, 모델 버전, 아키텍처 설정을 동일한 데이터셋에 적용하여 결과를 비교하는 과정이다. 어떤 변경 사항이 실제 성능 향상에 기여했는지 데이터 기반으로 검증하기 위해 수행한다.
기술
- LangSmith
- LangChain
- Python
- JavaScript
활용 사례
- 복잡한 에이전트 트레이스 디버깅
- 사용자 대화 감성 및 결과 분석
- 자동화된 평가기 코드 생성
- 실험 결과 비교 및 모델 선정
언급된 리소스
API DocsPolly Documentation
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 19.수집 2026. 03. 19.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

