TL;DR
마이크로소프트 연구팀은 컴퓨터 사용 에이전트 훈련을 위해 실제 애플리케이션 동작을 충실히 재현한 열두 개의 고충실도 월드를 설계했다. 같은 환경에서 학습한 9B 모델은 점수를 36.5%에서 67.1%로 올려 GPT-5.4와의 격차를 크게 줄였고, 특히 달력과 중첩 필터 같은 까다로운 UI 컨트롤을 다양한 형태로 집중 학습시키면 다른 도메인으로의 일반화가 가능했다. 또한 그라운디드 검증기를 보상으로 한 RL은 홀드아웃 성능을 추가로 개선했으며, 연구진은 네 개의 월드와 코드·데이터·검증기를 공개해 후속 연구를 지원한다.
섹션별 상세
이미지 분석

이미지는 모델이 환경(World)과 상호작용하고 Graded run으로 결과를 채점한 뒤 채점 결과와 환경 정보를 다시 모델로 되돌려 학습 루프를 형성하는 구조를 시각적으로 표현한다. 화살표와 피드백 루프는 검사기(Grader)와 환경 개선이 모델 학습에 보상 신호와 데이터로 돌아가며 공동 진화가 일어나는 메커니즘을 암시한다. 이 도식은 본문에서 주장하는 '모델·월드·검증기의 공동 진화'와 RL 보상 사용을 한눈에 보여준다.
Model, World, Graded run의 순환 구조를 보여주는 다이어그램
용어 해설
- 고충실도 시뮬레이션(High-fidelity simulation)
- — 고충실도 시뮬레이션은 실제 애플리케이션 동작을 세밀하게 재현해 에이전트가 현실적인 입력과 상태 변화를 경험하도록 만든다. 이 글에서는 화면 간 상태 일관성, 현실적 데이터 시드, 다양한 위젯 표현을 포함해 사용자 인터페이스의 동작을 그대로 복제하는 방식으로 구현한다. 이렇게 구현된 환경은 단순한 동작 모방을 넘어 모델의 일반화 능력과 상호작용 정책 학습에 기여한다.
- 컴퓨터 사용 에이전트(computer-use agents)
- — 컴퓨터 사용 에이전트는 GUI 기반 애플리케이션을 조작해 목표를 달성하도록 설계된 모델이다. 문맥에서는 웹앱의 폼, 필터, 달력 등 실제 UI 컨트롤을 조작하는 작업을 수행하도록 학습시킨다. 이런 에이전트는 환경의 상태를 관찰하고 일련의 조작으로 작업 완료를 목표로 삼는다.
- 그라운디드 검증기(Grounded verifier)
- — 그라운디드 검증기는 에이전트의 수행 결과를 환경 상태와 목표 기준에 따라 자동으로 채점하는 구성요소다. 본 연구에서는 이 검증기를 보상 신호로 사용해 RL 학습에서 목표 달성 여부를 측정하고 보상을 계산한다. 검증기가 정확해질수록 RL 보상이 더 신뢰할 수 있어 학습 효율이 개선된다.
- 심층 도메인 월드(Deep domain worlds)
- — 심층 도메인 월드는 특정 응용 도메인에서 복잡한 상호작용과 상태를 충분히 포함하도록 설계된 훈련 환경이다. 글에서는 동일 사이트의 얕은 빌드와 대비해 깊이(depth)를 높인 월드를 만들어 상태 유지와 다양한 입력 조합을 반복적으로 연습하게 한다. 심층 월드는 에이전트가 도메인 특화 작업을 더 안정적으로 해결하도록 돕는다.
- 사용자 인터페이스 컨트롤(UI controls)
- — 사용자 인터페이스 컨트롤은 달력 날짜 선택기, 중첩 필터 같은 상호작용 요소들을 가리킨다. 연구에서는 이런 컨트롤이 에이전트에게 자주 어려움을 주므로 다양한 형태로 반복해서 훈련시켜 조작 방법을 일반화하게 만든다. 특정 컨트롤을 깊게 드릴하면 학습한 조작이 훈련에 포함되지 않은 도메인으로도 이전된다.
근거 모음
- 열두 개 월드로 훈련한 9B 모델의 점수가 36.5%에서 67.1%로 개선되어 GPT-5.4와 14포인트 이내 차이를 보였다. — 원문 요약 문단의 수치(36.5% → 67.1%, 14포인트)를 근거로 하는 실험 결과 진술.
- 그라운디드 검증기를 보상으로 사용하는 RL은 홀드아웃 성능을 올리고 목표까지 필요한 단계 수를 줄였다. — 원문에서 RL 적용 효과(홀드아웃 성능 상승 및 단계 축소)를 관찰한 실험적 결과 진술.
기술
- GPT-5.4
- 9B 모델
- 그라운디드 검증기
- Echoverse
활용 사례
- 웹앱과 데스크톱 애플리케이션의 UI 조작 자동화 에이전트 연구
- 고충실도 시뮬레이션을 활용한 에이전트 훈련과 RL 보상 설계 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
