섹션별 상세
비결정론적인 LLM 응답으로 인해 발생하는 에이전트의 불확실한 동작을 제어해야 한다. Litmus는 litmus run 명령어로 에이전트 실행을 감싸 모든 HTTP 호출을 가로채고 트레이스 파일로 기록한다. 재현 모드에서는 실제 API 호출 없이 기록된 데이터를 순차적으로 제공하여 동일한 코드 경로를 강제한다. 이를 통해 API 비용 부담 없이 복잡한 에이전트 로직의 버그를 결정론적으로 추적할 수 있다.
bash
litmus run python my_agent.py에이전트 실행을 감싸 모든 LLM API 호출을 기록하는 명령어
bash
litmus run --replay ./traces/lt-abc123.trace.json python my_agent.py실제 API 호출 없이 기록된 트레이스 파일을 사용하여 결정론적으로 재현하는 명령어

프로덕션 환경에서 발생하는 간헐적인 API 장애나 모델의 거부 응답은 테스트하기 매우 까다롭다. --fault 파라미터를 사용해 특정 단계에서 llm_refuse, llm_timeout, llm_error 등을 인위적으로 발생시킨다. 개발자는 실제 장애가 발생하기 전에 에이전트가 이러한 예외 상황에 어떻게 반응하는지 확인하고 대응 로직을 보완하여 시스템의 회복탄력성을 높일 수 있다.
bash
litmus run --replay trace.json --fault llm_refuse:step=0 python my_agent.py특정 단계에서 LLM이 응답을 거부하도록 장애를 주입하여 재현하는 명령어
에이전트 업데이트가 기존의 정상적인 동작을 해치지 않는지 보장하는 자동화된 절차가 필요하다. litmus ci 명령어는 저장된 트레이스 뭉치를 기반으로 정확성, 회복탄력성, 효율성 점수를 계산한다. 설정된 임계값 미달 시 프로세스를 종료하여 불안정한 에이전트의 배포를 사전에 차단함으로써 프로덕션 환경의 품질 저하를 방지한다.
bash
litmus ci ./traces --threshold 85트레이스 점수가 85점 미만일 경우 배포를 차단하도록 설정하는 CI 명령어
용어 해설
- 결정론적 재현(Deterministic Replay)
- — 비결정론적인 시스템의 실행 과정을 기록한 후, 동일한 순서와 데이터를 제공하여 매번 같은 결과를 얻도록 다시 실행하는 기법이다. AI 에이전트의 무작위적인 응답을 고정하여 버그를 추적하는 데 필수적이다.
- 장애 주입(Fault Injection)
- — 시스템의 견고함을 테스트하기 위해 의도적으로 오류나 지연을 발생시키는 소프트웨어 테스트 기법이다. LLM API의 타임아웃이나 거부 응답 상황을 인위적으로 만들어 에이전트의 예외 처리 능력을 검증한다.
- 몽키 패칭(Monkey Patching)
- — 런타임에 기존 코드의 동작을 동적으로 변경하거나 확장하는 기술이다. Litmus는 SDK의 통신 계층을 패칭하여 소스 코드 수정 없이도 API 호출을 가로채고 기록한다.
- 지속적 통합 게이팅(CI Gating)
- — 자동화된 테스트 결과가 특정 기준을 충족하지 못할 경우 코드 배포를 자동으로 차단하는 프로세스이다. 에이전트의 신뢰성 점수가 임계값 미만이면 배포를 막아 품질을 유지한다.
기술
- Litmus
- Python
- Anthropic SDK
- OpenAI SDK
- httpx
활용 사례
- 에이전트 프로덕션 장애 재현
- LLM API 장애 대응 테스트
- CI/CD 배포 자동 승인 게이트
- 비용 없는 에이전트 로직 검증
언급된 리소스
GitHubLitmus GitHub Repository
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 25.수집 2026. 03. 25.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
