TL;DR
AI 에이전트의 가드레일은 일괄적인 켜기·끄기가 아니라 데이터 접근, 도구 권한, 실행 결과의 영향도에 맞춰 등급화해야 합니다. 모든 에이전트에는 사용자 요청뿐 아니라 검색 문서, API 응답, 도구 결과처럼 실행 중 유입되는 외부 정보와 최종 출력에 대한 검사가 필요합니다. 시스템 기록 변경, 금융 거래, 코드 실행, 외부 통신처럼 영향이 크고 되돌리기 어려운 작업에는 권한·거래 한도·허용 대상·승인 요건을 모델 밖의 결정적 정책으로 확인하고 필요하면 사람의 승인을 거쳐야 합니다. 새 도구나 권한, 데이터 소스, 자율성이 추가되면 모델과 프롬프트가 그대로여도 위험 등급을 다시 판단하고, 실제 도구 호출과 정책 판정 및 하위 시스템 변경을 감사 가능한 기록으로 남겨야 합니다.
섹션별 상세
용어 해설
- 가드레일 위험 등급화(Guardrail Risk Tiering)
- — AI 에이전트의 데이터 접근 범위, 도구 권한, 실행 권한, 실패 영향도를 기준으로 런타임 통제 수준과 적용 위치를 정하는 방식입니다. 모든 에이전트에 공통 입력·출력 검사를 적용한 뒤, 민감한 데이터나 되돌리기 어려운 작업에 결정적 정책 검사와 승인을 추가합니다. 이를 통해 권한과 감독의 비례성을 기록하고 설명할 수 있습니다.
- 간접 프롬프트 인젝션(Indirect Prompt Injection)
- — 사용자 프롬프트가 아닌 검색 문서, 웹 페이지, API 응답, 도구 결과, 다른 에이전트의 메시지에 포함된 악성 지시가 에이전트의 실행을 바꾸는 공격입니다. 에이전트가 외부 정보를 검색하고 도구에 전달하는 과정에서 입력 경계가 확장되므로, 실행 전에 각 결과를 검사해야 합니다. 이는 검색 증강과 도구 사용이 결합된 워크플로의 주요 위험 표면입니다.
- 결정적 정책 집행(Deterministic Policy Enforcement)
- — 모델의 해석에 맡기지 않고 권한, 거래 한도, 승인된 수신자, 필수 입력값, 데이터 분류, 허용 목록 같은 규칙을 외부 정책 계층에서 판정하는 방식입니다. 모델은 실행할 작업을 제안하지만, 정책 엔진이 해당 작업의 허용 여부를 결정합니다. 금융 거래나 시스템 변경처럼 실패를 되돌리기 어려운 작업에 적합합니다.
- 에이전트 관측 가능성(Agent Observability)
- — 에이전트 실행 과정의 도구 호출, 사용자 신원과 권한 맥락, 정책 판정, 하위 시스템 변경, 예외와 사람의 개입을 추적하는 능력입니다. 단순히 어떤 통제가 있어야 하는지 기록하는 데 그치지 않고 실제로 어떤 권한으로 어떤 결정과 변경이 발생했는지 보존합니다. 감사나 사고 조사에서 실행 경로를 재구성하는 근거가 됩니다.
기술
- Role-Based Access Control (RBAC)
- OAuth
- Model Context Protocol (MCP)
활용 사례
- 승인된 내부 문서를 검색하는 읽기 전용 에이전트
- 고객 기록을 수정하는 업무 자동화 에이전트
- 외부 고객에게 메시지를 보내는 에이전트
- 금융 거래를 시작하거나 시스템 기록을 변경하는 에이전트
- 코드 실행 권한을 가진 에이전트
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
