TL;DR
에이전트가 컴퓨터 환경과 직접 상호작용하며 복잡한 작업을 수행함에 따라, 단순 텍스트 기반 평가 방식은 한계에 도달했다. Harbor는 에이전트가 파일 읽기, 스크립트 실행 등을 수행할 수 있는 격리된 샌드박스 환경을 제공하여 재현 가능한 평가를 가능하게 하는 오픈소스 프레임워크이다. Deep Agent와 같은 상태 유지형 에이전트를 Harbor의 독립적인 컨테이너 환경에서 실행하고, 최종 환경 상태를 결정론적으로 체크함으로써 평가의 정확도를 높일 수 있다. 이 모든 과정은 LangSmith와 통합되어 에이전트의 추론 과정과 실험 결과를 대시보드에서 시각적으로 추적하고 관리할 수 있는 워크플로를 완성한다.
챕터별 상세
에이전트 평가 방식의 변화 필요성
출력값 중심에서 실제 환경 중심으로의 전환
Docker 컨테이너는 애플리케이션과 그 실행에 필요한 모든 환경을 패키징하여 어디서나 동일하게 실행되도록 보장하는 기술이다.
Deep Agent의 정의와 특징
딥 리서치 에이전트 구축 및 시연
Harbor 프레임워크의 핵심 기능
데이터셋 구성과 성공 조건 설정
Deep Agent와 Harbor의 기술적 통합
LangSmith를 통한 결과 분석 및 시각화
용어 해설
- 에이전트 평가(Agent Evaluation)
- — AI 에이전트가 주어진 목표를 얼마나 잘 수행했는지 측정하는 프로세스이다. 단순한 텍스트 응답의 정확도를 넘어, 에이전트가 파일 시스템을 수정하거나 코드를 실행하는 등 실제 환경에 미친 영향을 검증하는 것이 핵심이다.
- 샌드박스(Sandbox)
- — 외부 시스템에 영향을 주지 않고 안전하게 코드를 실행하거나 파일을 조작할 수 있는 격리된 가상 환경이다. 에이전트 평가 시 매번 깨끗한 상태에서 테스트를 반복하고 재현성을 확보하기 위해 필수적이다.
- 상태 유지형 에이전트(Stateful Agent)
- — 작업 수행 과정에서 과거의 행동이나 환경의 변화를 기억하고 이를 다음 단계의 의사결정에 반영하는 에이전트이다. 장시간 실행되는 복잡한 워크플로를 처리할 때 상태 관리가 중요해진다.
- 결정론적 검증(Deterministic Check)
- — 에이전트의 출력이 모호한 자연어가 아니라, 특정 파일의 존재 여부나 데이터베이스의 값처럼 명확하게 확인 가능한 결과물인지 체크하는 방식이다. 평가의 객관성과 자동화 수준을 높이는 데 기여한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




