왜 중요한가
AI 에이전트가 앱 경계를 넘나들며 작업을 자동화할수록 기존 앱 중심 OS는 실행 지연과 민감 데이터 노출 리스크를 유발한다. AOHP는 Android 기반에서 에이전트를 OS 1급 행위자로 취급해 개인화된 서비스 인터페이스, 에이전트 친화적 실행 경로, 운영체제 수준의 정보 흐름 통제를 제공한다. 벤치마크에서 작업 완료율과 토큰 효율 면에서 유의미한 개선을 보였다.
핵심 기여
Agent-Native OS 아키텍처
운영체제를 에이전트 중심으로 재구성해 서비스 능력을 인터페이스 중립적 컴포넌트로 재정의하고, 시스템 메모리에서 개인화·작업 상태·정책 결정을 관리한다. 이 구조는 앱 경계를 넘어선 서비스 합성과 감사 가능성을 운영체제 레벨로 이동시킨다.
AOHP 구현( AOSP 기반 )
Android Open Source Project를 포크해 AOHP를 구현했다. 세 가지 핵심 메커니즘을 추가했다: (1) personalized service composition으로 작업별 'generated entrance' 생성, (2) efficient agent interfaces로 parallel virtual displays·structured UI·event streams·native sandbox 제공, (3) secure information flow로 민감원본을 플레이스홀더로 대체하고 vault·taint 추적·정책 검사 수행.
효율·보안 실험 검증
OpenClaw 에이전트를 사용한 30개 실제 모바일 작업 벤치마크에서 AOHP가 stock Android 대비 평균 완료율을 54.44%→75.56%로 개선(+21.12), LLM 토큰 사용을 7.10M→3.44M으로 절감(-51.55%), 실행 시간은 33.94min→18.93min으로 단축(-44.21%)함을 보고했다.
민감 데이터 흐름 통제
민감 소스를 시스템 차원에서 탐지·정제(plaintext→typed placeholder)하고, 트러스트드 볼트에서 민감 연산·전송을 대리 수행하며 taint metadata로 전파 경로를 기록해 출구 검사 및 감사 체인을 유지한다.
핵심 아이디어 이해하기
에이전트 기반 상호작용은 LLM 중심의 텍스트-기반 플래너가 앱 상태와 UI를 연속적인 관찰(observation)과 도구 호출(tool call) 형태로 처리하는 워크플로를 따른다. 이때 각 관찰과 호출은 LLM의 입력-출력 토큰으로 누적되며, 실행 단계가 많아지면 컨텍스트 크기와 토큰 비용이 선형·그 이상으로 증가한다. 스크린샷 같은 픽셀 기반 관찰은 정보 밀도가 낮아 토큰 대비 효율이 떨어지고, 단발성 UI 이벤트는 폴링으로 쉽게 누락된다.
방법론
전체 접근은 운영체제 계층에서 에이전트 실행과 데이터 흐름을 재설계하는 것이다. 구조는 수직 4층(Android 생태계, Unified Interaction Interface, AOHP Capabilities, Personalized Service Composition)과 수평 2개 횡단 메커니즘(효율적 에이전트 인터페이스, Secure Information Flow)으로 구성된다.
핵심 메커니즘 상세: (1) Generated Service Entrance는 task schema, service graph, presentation policy로 구성된다. Task schema는 사용자의 고수준 목표를 규정하고, service graph는 API/CLI/GUI 능력을 매핑하며, presentation policy는 어떤 중간 결과를 사용자에게 노출할지 결정한다. (2) Unified Interaction Interface는 API, CLI, Structured UI, Rendered GUI 네 가지 호출 모드를 제공해 에이전트가 가능한 한 구조적 경로(API/CLI/Structured UI)를 선택하고 필요 시 렌더된 GUI로 폴백하도록 한다.
에이전트 실행·입출력 최적화: Parallel Background Interaction을 위해 가벼운 virtual display를 추가해 화면에 얽매이지 않는 병렬 작업을 허용한다. Structured UI는 렌더링 세부를 제외한 의미적 요소(XML/스크립트 같은 구조)를 제공해 불필요한 중복을 제거한다. Native Sandbox Runtime은 에이전트의 로컬 계산·도구 호스팅을 운영체제 관리 샌드박스에서 수행하게 해 중간 결과를 에이전트 컨텍스트에 노출하지 않고 처리한다. Unified File Shortcut은 GUI 파일 조작 결과를 구조화된 파일 관찰로 반영해 교차 앱 파일 핸드오프를 통합한다. Event Stream Abstraction은 transient 알림과 센서 스트림을 버퍼/구독 가능한 스트림으로 노출한다.
보안 메커니즘: Sensitive Source Sanitization은 민감 원문을 type:uuid 형태의 플레이스홀더로 대체하고, 데이터는 트러스트드 볼트에 저장된다. Trusted Vault Executor는 플레이스홀더 기반 의도를 받아 정책 검사·사용자 승인·민감 연산(포맷·비교·전송)을 수행하고 민감 결과는 다시 플레이스홀더로 반환한다. Data-Flow Taint Tracking은 민감 값에 taint 메타데이터를 붙여 복제·변형·전송 과정에서 출처를 유지하고 시스템 출구에서 taint 검사로 정책을 집행한다.
주요 결과
벤치마크는 30개의 실제 모바일 작업을 포함하는 평가 세트를 사용했고 OpenClaw 에이전트를 stock Android와 AOHP 상에서 비교했다. 전체 평균 완료율은 stock Android에서 54.44%였고 AOHP에서 75.56%로 21.12 포인트 상승했다(완전 성공(task fully solved): stock 13→AOHP 20). (Section 7, Figure 3)
효율성 측정은 양쪽 설정에서 모두 완전 해결한 11개 작업의 집합에 대해 집계했다. stock Android 합계는 tool calls 233회, duration 33.94분, tokens 7,103,192, LLM requests 273회였고 AOHP는 tool calls 129회, duration 18.93분, tokens 3,441,759, LLM requests 143회였다. 상대적 감소율은 tool calls -44.64%, duration -44.21%, tokens -51.55%, LLM requests -47.62%다(Table 1).
정보 흐름 보안 실험은 주석이 달린 결제 애플리케이션을 사용한 케이스별 검사로 수행됐다. 다섯 가지 주요 검사(민감 표시, 일반 동작 허용, 민감 동작 승인 요구, 지원되지 않는 접근 실패-클로즈, 민감 이벤트의 리다크션 및 taint 보존)를 모두 통과했다(Table 2).
기술 상세
전체 아키텍처는 수직 계층(하단: Android 생태계→중앙: Unified Interaction Interface→AOHP Capabilities→상단: Personalized Service Composition)과 수평 메커니즘(효율적 인터페이스, 보안 정보 흐름)으로 구성된다. Unified Interaction Interface는 API/CLI/Structured UI/Rendered GUI 네 가지 호출 모드를 정형화해 에이전트가 가능한 구조적 경로를 우선 사용하게 만든다.
Generated Service Entrance는 세 구성요소(task schema, service graph, presentation policy)를 사용해 OS가 작업별 진입점을 생성한다. task schema가 목표와 필요한 데이터 요소를 규정하면 service discovery가 각 앱·서비스의 capability(입력/출력 스키마·부작용·정책 라벨)를 찾아 service graph를 구성하고, presentation policy가 사용자에게 노출할 중간 결과를 결정한다. 이 과정은 개발자 제공 메타데이터와 GUI 추출(legacy apps)을 모두 허용한다.
효율화 메커니즘의 알고리즘적 근거는 '단계 수 감소 → 컨텍스트 토큰 감소'의 단순한 비용 모델에 기반한다. 각 에이전트 도구 호출(tool call)과 관찰(observation)이 LLM 입력·출력 토큰을 증가시키므로, 구조적 관찰(Structured UI)·병렬 실행(virtual displays)·이벤트 스트림 구독은 필요한 단계 수를 줄여 총 토큰 비용을 감소시킨다. 예: 동일 작업을 수행하는 데 필요한 도구 호출이 N에서 0.56N으로 줄면 토큰 수와 LLM 요청 수도 대체로 비례해 감소한다(Table 1).
보안 메커니즘은 세 단계로 동작한다. 민감 입력 지점에서 Sanitization(plaintext→typed placeholder)을 수행하고 데이터는 Vault에 저장한다. 에이전트가 민감 연산을 요청하면 Trusted Vault Executor가 해당 플레이스홀더를 받아 정책 검사·사용자 승인·연산을 수행하고 반환값을 플레이스홀더로 유지한다. 동시에 모든 민감값은 taint metadata를 부착해 시스템 전반의 복제·변환 경로를 추적하고 최종 sink에서 정책 검사를 적용한다.
구현 세부사항: AOHP는 AOSP를 포크해 시스템 서비스·프레임워크·UI 스택을 수정했다. Event Stream은 알림 버퍼와 센서 스트리밍 API로 구현되며, virtual display는 가벼운 화면 세션을 생성해 백그라운드 실행을 허용한다. 실험은 OpenClaw 에이전트를 동일 설정으로 stock Android와 AOHP에서 비교했고 실행 비용(도구 호출·시간), 토큰·LLM 요청 수, 정책 준수 케이스를 측정했다.
한계점
논문에서 명시한 향후 과제는 다음과 같다: (1) 호환성 범위 확대 — 앱의 커스텀 렌더링·반자동화 방지·문서화되지 않은 동작에 대한 대응 강화, (2) 능력 발견(capability discovery) 자동화 — 개발자 메타데이터와 자동 추론 결합, (3) 리소스 스케줄링 — virtual display·샌드박스 런타임·이벤트 스트림의 자원·열 관리, (4) 정책 사용성 — 사용자 승인 UI와 정책 설명 개선.
실무 활용
AOHP는 Android 생태계를 유지하면서 에이전트 중심의 상호작용을 운영체제 레벨에서 제공하므로 개인 비서형 자동화, 민감 데이터가 개입하는 모바일 워크플로, 자동화 테스트와 같은 실무 시나리오 적용 가능성이 높다.
- 개인화된 모바일 어시스턴트: 여러 쇼핑·메시지·캘린더 앱을 통합한 task-level 쇼핑·예약 합성
- 민감 결제 워크플로: 결제 자격증명을 트러스트드 볼트로 처리해 에이전트가 민감 데이터를 직접 보지 않고 결제 수행
- 자동화 테스트·QA: virtual display와 structured UI를 활용해 백그라운드 자동화 테스트 수행
- 기업용 모바일 오케스트레이션: 정책 기반 데이터 흐름 제어로 규정 준수 환경에서 에이전트 자동화 운영
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 에이전트-네이티브 운영체제(Agent-Native OS)
- — 에이전트-네이티브 운영체제는 에이전트를 OS의 1급 행위자로 취급해 서비스 탐색, 실행, 상태 관리, 정책 집행을 운영체제 수준에서 수행하도록 하는 설계 접근이다. AOHP는 Android 기반에서 이 개념을 적용해 서비스 합성, 에이전트 전용 인터페이스, 정보 흐름 제어를 운영체제 계층으로 옮긴다.
- 구조화된 UI(Structured UI)
- — 구조화된 UI는 화면 렌더링 대신 입력/출력 스키마와 계층적 요소 정보를 제공해 에이전트가 시각적 픽셀 대신 의미적 토큰으로 UI를 해석하고 조작하게 하는 표현 방식이다. AOHP는 이를 통해 시각 처리 오버헤드를 줄이고 정확도를 높인다.
- 이벤트 스트림 추상화(Event Stream Abstraction)
- — 이벤트 스트림 추상화는 운영체제의 비동기 알림(Toast, 푸시, 타이머 완료 등)과 하드웨어 센서 데이터를 구독 가능한 스트림으로 노출해 에이전트가 반복 폴링 없이 실시간으로 반응하도록 만드는 메커니즘이다. AOHP는 이를 통해 단발성 UI 이벤트를 놓치지 않고 처리한다.
- 트러스트드 볼트(Trusted Vault)
- — Trusted Vault는 민감한 원문 값을 운영체제 내부 안전 구역에 저장하고 플레이스홀더(<payment-card:uuid> 등)만 에이전트에 노출하는 구성요소다. 에이전트의 민감 데이터 사용 요청은 vault 실행기로 전달되어 정책 검사·승인·대체 동작이 시스템 경계에서 수행된다.
- 흔적(taint) 추적(Taint Tracking)
- — Taint Tracking은 민감 데이터에 메타데이터를 붙여 복사·변형·전송 전 과정에서 출처와 전파 경로를 유지하는 기법이다. AOHP는 taint 정보를 사용해 민감 값이 시스템 출구로 넘어갈 때 정책 검사를 수행하고 감사용 체인을 제공한다.
- 서비스 합성(Service Composition)
- — Service Composition은 여러 앱·API·CLI·GUI 능력을 연결해 사용자의 고수준 목표(예: 쇼핑 비교)를 수행할 수 있는 작업 그래프를 생성하는 과정이다. AOHP는 OS가 이런 합성을 생성된 'entrance'로 노출해 사용자 경험을 개인화한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.