본문으로 건너뛰기

당신의 에이전트, 그들의 자산: OpenClaw에 대한 실세계 안전성 분석

개인용 AI 에이전트가 이메일, 결제 시스템 등 민감한 권한을 가지게 되면서 보안 위험이 급증하고 있다. 이 논문은 에이전트가 학습하고 적응하기 위해 유지하는 '영구적 상태' 자체가 치명적인 공격 표면이 될 수 있음을 입증하며, 기존의 샌드박스 평가를 넘어선 실질적인 보안 가이드라인을 제시한다.

용어 해설

상태 오염(State Poisoning)
AI 에이전트가 시간이 지나도 유지하는 영구적인 데이터(메모리, 설정, 스킬 등)에 악의적인 정보를 주입하여 에이전트의 행동을 왜곡하는 공격 기법이다. 한 번 주입된 오염된 정보는 이후 모든 세션에 영향을 미치며 에이전트의 판단 기준을 근본적으로 바꾼다.
간접 프롬프트 주입(Indirect Prompt Injection)
사용자가 직접 입력하는 프롬프트가 아닌, 에이전트가 읽어들이는 외부 문서나 웹 페이지 등에 악성 지시문을 숨겨두어 에이전트가 이를 실행하게 만드는 공격 방식이다. 에이전트가 자율적으로 외부 데이터를 처리할 때 발생할 수 있는 주요 보안 취약점이다.
백본 모델(Backbone Model)
AI 에이전트의 두뇌 역할을 하는 핵심 대형 언어 모델(LLM)을 의미한다. 에이전트는 이 모델의 추론 능력을 바탕으로 사용자의 명령을 이해하고 도구를 호출하며 행동을 결정한다.
공격 성공률(ASR)
Attack Success Rate의 약자로, 수행된 전체 공격 시도 중 공격자가 의도한 유해한 결과(데이터 유출, 무단 결제 등)가 실제로 발생한 비율을 나타내는 지표다. 보안 평가에서 모델의 취약성을 정량화하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 06.수집 2026. 04. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.