TL;DR
이 글은 에이전트 시스템을 구축할 때 Human Steering, Context Poisoning, Agentic Search, Non-determinism, Domain Verifiability, Behavioral Evals, Context Erosion, Provenance, Autonomy levels를 구분해 문제를 체계적으로 표현하자고 제안합니다. 인간 개입을 어디서 제거할지 판단하려면 에이전트 오류와 인간 오류의 위험을 비교해야 하며, 컨텍스트는 양보다 관련성과 최신성이 중요합니다. 정답을 측정하기 어려운 업무에서는 결과 대신 절차와 행동을 평가하고, 변화하는 환경에서는 정확도 하락과 출처를 지속적으로 추적해야 합니다. 자율성은 이진값이 아니라 맡은 업무 범위와 인간 개입 수준에 따라 단계적으로 평가해야 합니다.
실용적 조언
- 에이전트의 자동화 범위를 A에서 D까지 한 번에 정하지 말고, A에서 B와 B에서 C처럼 사람이 개입하는 지점을 먼저 분리해 오류 위험과 자동화 이득을 비교해야 합니다.
- RAG 컨텍스트를 무조건 많이 주입하기보다 문서의 최신성, 시나리오 적합성, embedding 매칭 품질을 확인하고, 필요하면 에이전트가 검색 도구로 관련 정보를 직접 찾도록 구성해야 합니다.
- 정답을 판별하기 어려운 업무에서는 최종 결과만 채점하지 말고 절차 준수, 행동 선택, 추론 경로를 평가하는 Behavioral Evals 기준을 별도로 마련해야 합니다.
- 환경과 지식 기반이 계속 바뀌는 시스템은 초기 정확도만 기록하지 말고 시간이 지나면서 x%에서 x-delta%로 떨어지는지 추적하며, 응답의 근거와 출처를 함께 저장해야 합니다.
- 에이전트의 자율성을 L0부터 L4까지 단일 숫자로 과장하지 말고, 실제로 맡긴 업무 범위와 인간 개입 지점을 기준으로 현재 수준을 평가해야 합니다.
섹션별 상세
용어 해설
- 인간 조정(Human Steering)
- — 에이전트가 작업 시작부터 종료까지 사람의 실시간 입력이나 중단 승인 없이 진행하는 정도를 뜻합니다. A에서 B까지만 자동화하고 B에서 C를 사람이 처리하는지, A에서 D까지 연결하는지를 구분해 자동화의 가치와 오류 위험을 함께 판단합니다.
- 컨텍스트 오염(Context Poisoning)
- — 에이전트의 작업 컨텍스트에 무관하거나 오래된 정보가 섞여 원래 작업에서 벗어나는 현상입니다. 문서 속 다른 시나리오의 지시문, 낡은 프로세스, 잘못 매칭된 Vector Search 결과가 원인이 될 수 있습니다.
- 에이전틱 검색(Agentic Search)
- — 시스템이 필요한 컨텍스트를 미리 RAG로 주입받는 대신 검색 도구를 사용해 지식 기반을 스스로 탐색하고 적절한 정보를 찾는 방식입니다. 정보가 쉽게 발견되도록 구성된 지식 저장소가 전제입니다.
- 도메인 검증 가능성(Domain Verifiability)
- — 에이전트의 결과가 정답 또는 오답으로 결정적으로 판별되는지, 아니면 맥락과 주관성이 개입되는지를 뜻합니다. 결과가 결정적이어도 사람이 수작업으로 처리하는 시간과 비슷하다면 자동화의 실익이 줄어듭니다.
- 행동 평가(Behavioral Evals)
- — 정답 자체를 측정하기 어려운 도메인에서 에이전트가 올바른 절차를 따랐는지, 적절한 행동을 했는지, 타당한 추론 경로를 거쳤는지를 평가하는 방법입니다. 결과보다 과정의 적절성을 평가 대상으로 둡니다.
- 컨텍스트 침식(Context Erosion)
- — 에이전트가 작동하는 환경과 정보가 계속 바뀌면서 시스템 변경이 없어도 답변 정확도가 시간이 지나 하락하는 현상입니다. 초기 정확도를 유지하려면 변화하는 환경을 지속적으로 관찰해야 한다는 문제를 담고 있습니다.
- 출처 추적성(Provenance)
- — 에이전트의 최종 응답이 사실과 연결되거나 근거로 사용한 출처를 인용할 수 있는 정도입니다. 출처와 가정을 추적할 수 있으면 결과가 어떤 정보에 기반했는지 확인하기 쉬워집니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



