TL;DR
에이전트가 모델 응답에 포함된 도구 호출을 자동 실행하는 특성 때문에 응답을 변조할 수 있는 프록시는 단순히 메시지를 읽는 수준을 넘는 공격자가 될 수 있다; 와이어 포맷을 통해 첫 응답에 '.env' 읽기 호출을 주입하자 세 가지 서로 다른 에이전트 구현에서 기밀이 승인 절차 없이 유출되었고 일부 런타임에서는 악의적 명령이 무단 실행되었다. 이러한 결과는 네트워크·쓰기 차단만으로는 충분하지 않음을 보여주며 에이전트 안전성은 모델이 아니라 런타임 하니스와 그 기본 설정에 의해 좌우된다는 점이 확인되었다. 따라서 신뢰할 수 없는 엔드포인트를 사용하지 않는 것이 기본 방어이며 추가로 런타임 격리, 자격증명 분리, 최소 권한 및 egress 정책 같은 실행 시점의 강제 규칙이 필요하다.
주요 논점
프록시가 에이전트 응답에 도구 호출을 주입하면 에이전트의 자동 실행 루프가 기밀 유출과 명령 실행을 초래할 수 있다고 주장되며 이 주장은 세 에이전트를 대상으로 한 재현 실험으로 뒷받침되었다.
에이전트의 안전성은 모델 자체가 아니라 런타임 하니스의 구성에 좌우되므로 격리와 최소 권한, 런타임 정책 집행이 실무적 해결책으로 제시되었다.
합의점 vs 논쟁점
합의점
- 에이전트가 모델 응답을 신뢰하여 도구 호출을 실행하는 설계가 존재하며 이 설계가 공격 표면을 제공한다.
- 네트워크 차단이나 쓰기 제한 같은 전통적 샌드박스는 작업 공간 내부 읽기 데이터의 유출을 막지 못하는 경우가 잦다.
- 런타임 수준에서의 정책 집행과 자격증명 분리는 실무적으로 필요한 방어 수단이다.
논쟁점
- 편의성 때문에 권한 프롬프트를 비활성화하거나 허용리스트를 넓히는 설정을 사용할 때 보안 리스크를 수용할 것인지 여부가 논쟁적이다.
- 어떤 수준의 자동화와 무인 실행(CI·headless)이 허용 가능한지에 대한 운영적 기준이 분열되어 있다.
실용적 조언
- 신뢰할 수 없는 모델 공급자를 통해 에이전트 트래픽을 라우팅하지 말고 공급자 도메인과 엔드포인트를 사전에 검증할 것.
- 런타임에서 도구 호출별 권한을 강제하는 정책을 적용하고 작업 공간 파일 접근, 네트워크 egress, 외부 쓰기 권한을 분리해서 최소 권한 원칙을 구현할 것.
- CI나 무인(headless) 실행 환경에서는 권한 프롬프트를 허용하지 않거나 별도의 검증 계층을 추가해 자동 실행을 차단할 것.
- 민감한 자격증명이나 비밀은 에이전트가 접근 가능한 작업 디렉토리에 두지 않고 별도 비밀 관리 시스템을 통해 런타임 시 안전하게 주입할 것.
섹션별 상세


용어 해설
- Wire Format
- — 에이전트와 모델 프로바이더 간에 주고받는 메시지의 직렬화 규격으로, 요청과 응답에서 도구 호출, 도구 결과, 메타데이터가 어떤 필드에 들어가는지와 승인 흐름을 규정한다. 와이어 포맷은 중간자(프록시)가 응답을 조작하거나 도구 호출을 주입할 수 있는 지점을 제공하며 에이전트의 자동 실행 루프에 직접 영향을 준다.
- Coding Agent
- — 모델의 응답을 바탕으로 파일 읽기, 쉘 실행 같은 도구를 자동으로 호출하고 그 결과를 다시 모델에 피드백하는 루프를 수행하는 실행 엔진으로, 응답에 포함된 도구 호출을 신뢰하고 자동으로 실행하도록 설계되어 있다. 에이전트의 자동화 특성 때문에 외부 엔드포인트가 반환하는 내용이 곧바로 권한 있는 작업으로 이어질 수 있다.
- Seatbelt Sandbox
- — 작업 실행을 제한하기 위해 프로세스 수준에서 시스템 호출을 제어하는 런타임 격리 계층으로, 네트워크 접근·파일 쓰기 등 특정 소콜 호출을 차단하여 탈출 시도를 막는다. 샌드박스는 탈출에 대한 방어에는 유효하지만 에이전트가 합법적으로 접근 가능한 파일을 읽어 모델 채널로 유출하는 문제는 차단하지 못하는 경우가 있다.
언급된 도구
코딩 에이전트 런타임
명령형 코딩 에이전트로 작업 실행과 샌드박스 기반 제어 제공
채팅/코드 에이전트 런타임
에이전트 격리와 런타임 정책 집행을 목표로 한 오픈소스 런타임
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.