왜 중요한가
컴퓨터 사용 에이전트(CUA)는 여러 애플리케이션 상태를 결합해 사용자를 대신해 메시지 전송·요약·일정 생성 같은 외부 행동을 수행한다. 단일 애플리케이션의 정보가 다른 문맥에서는 부적절할 수 있으므로, 에이전트가 '어떤 정보를 누구에게' 공유할지를 판별하지 못하면 실질적 프라이버시 위험이 발생한다.
관련 Figure

이 그림은 논문이 다루는 핵심 위험을 직관적으로 제시한다: 동일한 UI 상태에서 에이전트가 작업-관련 항목과 근접한 개인 정보를 함께 포함해 수신자에게 전달할 수 있음을 시각적으로 보여준다. 실험 설계에서 V_share와 V_leak의 구분을 명확히 하고, 수신자-민감도에 따라 정보 흐름 적합성이 달라지는 점을 강조한다.
CUA가 작업 대상 항목과 함께 개인적 항목을 부적절하게 노출하는 예시를 보여주는 다이어그램이다.
핵심 기여
Agent CI Bench: 재실행 가능한 문맥 무결성 평가 하니스
시나리오-서피싱 엔진(MCTS 기반), OpenApps 렌더러, 혼합 채점기(정형 매처 + LLM 판정)를 포함하는 재생성 가능한 벤치마크 파이프라인을 공개했다. 시나리오마다 V_share(반드시 공유할 항목)와 V_leak(반드시 제외할 항목)를 명시해 객관적 이진 점수를 산출한다.
15개 최첨단 에이전트의 공개형 평가
Claude, GPT, Gemini, Grok, Qwen 등 15개 에이전트를 117개 시나리오에서 평가해 12/15 에이전트가 시나리오의 절반 이상에서 누출을 보였고 평균 누출률이 67.9%임을 보고했다. 또한 작업 완수율(utility)과 누출률의 상관이 약함(Pearson r=0.49)을 확인했다.
엔드투엔드 UI 실행에서의 누출 전이 실증
OpenApps UI에서 두 에이전트를 브라우저 수준으로 작동시킨 실험에서, 상태-기반(state-grounded) 결과가 라이브 UI에서도 유지되거나 증가함을 관찰했다(예: Opus: state 14.0% → UI 42.9% 등).
경량 프롬프트 방어의 실효성 검증
Restrictive, Rubric-informed, Recipient-typed 세 가지 시스템 프롬프트 개입을 시험해 참여 조건 누출(engaged leakage)을 평균 33–36 포인트 감소시키고, 동시에 평균 utility를 15.7–23.1 포인트 향상시켰다.
핵심 아이디어 이해하기
컴퓨터 사용 에이전트가 수행하는 핵심 작업은 여러 앱 상태(이메일, 캘린더, 할일 등)에 노출된 항목들 중에서 '작업에 적합한(subset selection)' 정보를 선택해 외부로 전달하는 것이다. 이 선택은 분류(classification) 문제로 볼 수 있다: 주어진 상태와 수신자 정보를 입력으로 받아, 각 항목을 '공유' 또는 '비공유'로 분류해야 한다. 기존 능력 평가는 주로 '작업 완수 여부'를 측정해 분류의 정확성(utility)을 평가하지만, CI 관점에서는 동일 항목이 수신자에 따라 적절성(label)이 달라지는 점이 핵심이다.
방법론
Agent CI Bench는 세 구성요소로 작동한다. 첫째, 시나리오-서피싱 엔진은 소수의 시드(일상적 개인비서 요청)를 시작점으로 MCTS(Monte Carlo Tree Search)를 통해 작업 지시, 수신자, 앱 상태, V_share와 V_leak를 변형해 후보 시나리오를 생성한다. 둘째, OpenApps는 각 시나리오를 여섯 개 앱( Messenger, Calendar, Maps, ToDo, Code Editor, Shop )으로 구성된 렌더된 개인 작업공간으로 인스턴스화해 에이전트가 동일한 UI 또는 구조화된 상태를 관찰하도록 한다. 셋째, 혼합 채점기(hybrid scorer)는 정형 매처(정확·근사 문자열 매칭)와 LLM 판정자를 결합해 V_share 포함 여부(u)와 V_leak 포함 여부(ℓ)를 이진으로 결정한다.
관련 Figure

이 다이어그램은 시나리오-서피싱 엔진의 구조와 작동 흐름을 기술적으로 보강한다. 시드 기반 초기화, CI-타깃 변이자(mutator), 프록시 롤아웃에 대한 보상 산정(R = u × CI_Violation), 중복 제거 및 큐레이션 단계를 연결해 벤치마크가 어떻게 스트레스-테스트 시나리오를 생성하는지 설명한다.
MCTS 기반 시나리오 생성 파이프라인(시드 → MCTS 확장 → 프록시 모델 롤아웃 → 후보 정제)을 도식화한 그림이다.
주요 결과
상태-기반 평가(117 시나리오, 15개 에이전트)에서 12/15 에이전트가 >50% 시나리오에서 누출을 보였고 군집 평균 누출률은 67.9%였다. utility 평균은 68.8%였다. 고유 패턴으로, 높은 utility를 보이는 에이전트들 간에도 참여 조건 누출(L_eng)은 14.0%에서 98.3%까지 84포인트에 달해 작업 완수가 누출 안전성을 보장하지 못했다. 엔드투엔드 UI 실행(50 시나리오, 두 에이전트)에서 상태 기반 누출 패턴이 전이되거나 악화되었다(예: Claude-Opus-4.7의 engaged leakage: state 14.0% → UI 42.9%). 세 가지 프롬프트 방어(Restrictive, Rubric-informed, Recipient-typed)는 engaged leakage를 평균 33–36 포인트 감소시키고 동시에 평균 utility를 15.7–23.1 포인트 상승시켰다.
기술 상세
전체 아키텍처는 시나리오 생성기(MCTS) → OpenApps 환경 인스턴스화 → 에이전트 평가(상태-기반 또는 UI-기반) → 혼합 채점의 파이프라인으로 구성된다. MCTS는 UCB1 선택과 프롬프트 기반 변이(mutator)로 노드를 확장하고, 프록시 에이전트 롤아웃과 LLM 판정으로 보상을 산출한다. 보상 R는 R = u × CI_Violation로 정의된다. 여기서 u(작업 완료)는 0/1이며 CI_Violation은 판정자가 부여하는 1~5의 심각도 점수다; 검색 단계에서는 이 심각도 점수를 평균해 탐색 보상을 계산하되, 최종 결과 보고에는 이진 누출 ℓ를 사용한다.
한계점
OpenApps는 제어된 6개 앱 워크스페이스로 실제 사용자 설치 환경을 완전히 대표하지 않는다. 시나리오 풀은 MCTS로 생성되어 스트레스 테스트 성격이 강하므로 절대 누출율을 현실 추정치로 해석해서는 안 된다. 엔드투엔드 실험은 두 에이전트에 국한된 50시나리오 집합으로 확장성이 제한된다. 방어 실험은 세 가지 프롬프트 개입과 세 개 모델만을 포함하므로 모든 모델·인터벤션에 일반화할 수 없다.
실무 활용
Agent CI Bench는 배포 전 CUA의 문맥 무결성 준수 여부를 자동으로 검사하는 도구로 활용 가능하다. 프롬프트 기반 방어는 재학습 없이도 누출을 크게 줄이며 실제 운영 환경에 빠르게 적용할 수 있다.
- 사전 배포 검증: CUA를 배포하기 전 Agent CI Bench로 누출 민감도를 평가해 위험 모델을 분류
- 회귀 테스트: 모델/프롬프트 변경 시 시나리오 풀을 재생해 누출 회귀 여부 확인
- 시스템 프롬프트 설계: Recipient-typed 등 검증된 프롬프트 템플릿을 시스템 레벨에 적용해 실시간 공유 정책 강화
- 제품 정책 감사: 특정 수신자·작업 유형에서의 누출 경향을 문서화해 정책 통제 포인트 설계
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 문맥 무결성(Contextual Integrity)
- — 정보 흐름이 정보를 공유한 문맥의 규범(수신자, 전송원칙, 콘텐츠 형태)을 따를 때 프라이버시가 보존된다는 이론이다. 본문에서는 특정 수신자와 작업에 적합한 정보만 공유해야 하는지 여부를 판단하는 평가 렌즈로 사용된다.
- 컴퓨터 사용 에이전트(Computer-Use Agent (CUA))
- — 사용자의 이메일, 캘린더, 메모, 할일 등 여러 애플리케이션을 읽고 대화·요약·전송 같은 외부 행동을 수행하는 에이전트다. 본문에서는 여러 앱 상태를 종합해 적절한 정보만 외부로 노출하는지 평가 대상이 된다.
- 시각적 동위치(Visual Co-location)
- — UI에서 작업 대상 항목 옆에 나란히 놓인 민감한 항목이 에이전트 출력에 포함되는 실패 모드다. 본문에서는 에이전트가 공간적 근접성에 따라 필터링하는지를 시험한다.
- 작업 모호성 과다공유(Task-Ambiguity Overshare (TAO))
- — 사용자의 지시가 불명확할 때 에이전트가 필요한 범위를 추정하지 않고 모든 가용 상태를 덤프해 과다하게 공유하는 실패 모드다. 본문에서는 미지정 범위 요청에 대한 전송원칙 판단을 평가한다.
- 수신자 불일치(Recipient Misalignment (RMA))
- — 동일한 정보가 한 수신자에게는 적절하지만 다른 수신자에게는 부적절할 때, 에이전트가 수신자 특성(역할·관계)에 따라 공유 범위를 조절하지 못하는 실패 모드다.
- 참여 조건 누출률(Engagement-Conditioned Leakage)
- — 에이전트가 실제로 작업을 수행(거부하지 않고 산출물 생성)한 실행들에서의 누출 비율이다. 본문에서는 거부율에 의한 저위험 은닉을 제거하기 위해 이 값을 주된 누출 지표로 사용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.