Edge·Copilot UI에서 TSR을 39.8%에서 82.9%로 끌어올린 4B GUI 에이전트
LoRA로 파인튜닝된 4B GUI 에이전트가 Edge와 Copilot UI 궤적을 학습해 Task Success Rate를 39.8%에서 82.9%로 향상시켰다.
TL;DR
GELab-Zero-4B-preview-Sico-Evolution은 GELab-Zero-4B-preview를 기반으로 LoRA로 파인튜닝된 4B 규모의 GUI 에이전트로서 Microsoft Edge와 Copilot UI 궤적을 학습 데이터로 사용해 실작업 기반으로 성능을 향상시켰다. Sico의 모델 진화 파이프라인은 라운드별 실사용 궤적 수집과 평가를 반복해 Task Success Rate를 직접 최적화하는 구조를 채택했고 그 결과 TSR이 39.8%에서 82.9%로 상승하며 +43.1%p의 절대 개선을 기록했다. README에 명시된 비교에서는 Sico-Evolution이 일부 폐쇄형 경쟁 모델보다 높은 TSR을 달성한 것으로 보고되어 도메인 특화 파인튜닝과 반복적 진화가 GUI 자동화 작업의 실효성을 크게 개선함이 확인되었다. 다만 공개된 수치는 Edge/Copilot 테스트셋에서의 결과로, 다른 앱·데이터셋으로의 일반화 범위는 추가 검증이 필요하다.
핵심 역량
- 스크린샷 기반으로 현재 UI 상태를 해석하고 다음 액션(클릭, 입력, 스크롤 등)을 텍스트 지시로 생성할 수 있다. 이 과정에서 요소 식별과 순차적 플래닝을 결합해 다단계 GUI 작업을 완료하는 행동 시퀀스를 출력한다. 결과는 테스트 케이스 기반의 Task Success Rate 향상으로 검증되었다.
- 사용자 대화형 인터페이스로부터 질문을 받아 관련 UI 작업을 수행하거나 작업 절차를 설명하는 응답을 생성할 수 있다. 모델 출력은 명령형 액션과 자연어 설명을 병행할 수 있어 자동화·보조 작업에 모두 활용 가능하다. 영어와 중국어 입력을 처리할 수 있도록 언어 태그가 포함되어 있다.
- 모바일·데스크톱 GUI 모두에 전이 가능한 정책을 목표로 학습되었으며 GUI 앱 전반에 재사용 가능한 행동 패턴을 학습했다. Sico의 진화 파이프라인으로 다양한 앱 궤적을 통합해 일반화 능력을 개선하도록 설계되었다. 이로 인해 새로운 GUI에 대한 초기 적응 비용이 줄어들도록 구성되었다.
- 대규모 파인튜닝 대신 LoRA 어댑터를 사용해 파라미터 업데이트 범위를 제한함으로써 효율적인 재학습이 가능하다. 이 접근은 GPU 메모리와 계산 비용을 낮추면서도 특정 UI 궤적에 대한 맞춤 성능을 높이는 데 기여한다. 따라서 반복적 모델 업데이트 과정에서 자원 소모를 통제할 수 있었다.
강점
- 공개된 결과에서 Task Success Rate가 82.9%로 보고되어 동일 계열의 base 모델(39.8%) 대비 절대치로 크게 향상된 성능을 보였다. 이 수치는 README에 명시된 라인에서 확인되며 실작업 궤적 기반 최적화의 효과를 반영한다. 향상 폭(+43.1%p)은 Sico 진화 파이프라인과 LoRA 기반 튜닝의 결합이 GUI 작업 성능에 실질적 이득을 주었음을 시사한다.
- README는 Sico-Evolution이 gpt-5.4(79.7%), claude-opus-4.6(81.3%), claude-opus-4.7(82.1%) 등 공개된 비교 대상보다 상위 점수를 기록했다고 명시해 동급의 폐쇄형 모델을 능가하는 결과를 주장한다. 이 비교는 동일한 Edge/Copilot 테스트셋에서의 TSR 값으로 이루어졌고 경쟁 모델 대비 우위를 수치로 보이고 있다. 따라서 공개 벤치마크 표기 기준에서는 상업적 SOTA와 직접 비교 가능한 수준의 성능 표집이 이루어졌다.
훈련 방식
기반 모델은 GELab-Zero-4B-preview이며 LoRA 방식으로 파인튜닝하여 전체 가중치 대신 저순위 어댑터만 학습시켰다. 학습 데이터로는 Microsoft Edge와 Copilot UI에서 수집한 실제 사용자-에이전트 궤적을 사용했고 라운드 단위로 평가 지표를 반영해 모델을 반복 고도화하는 Sico 모델 진화 파이프라인을 적용했다. 이 과정은 Task Success Rate를 직접 최적화 목표로 삼아 실사용 시나리오에서의 행동 완성도를 지속적으로 끌어올리는 방식으로 운영되었다.
알아두면 좋은 것
- 이 모델은 Sico 오픈소스 플랫폼의 일부로서 실작업 기반의 에이전트 진화 파이프라인을 통해 반복적으로 성능을 향상시키는 워크플로를 채택했다.
- GELab-Zero-4B-preview를 기반으로 LoRA 파인튜닝을 적용했고 학습 데이터로 Microsoft Edge와 Copilot의 UI 궤적이 사용되었다.
- 주요 성과로 Task Success Rate가 39.8%에서 82.9%로 상승했고 이 수치는 README의 핵심 성능 지표로 보고되었다.
- 모델 라이선스는 Apache-2.0으로 공개되어 있으며 transformers 라이브러리로 배포되어 있다.
기술적 특징
- LoRA 어댑터를 사용해 기반 모델의 전체 가중치를 고정하고 저순위 행렬만 업데이트함으로써 파인튜닝 비용과 메모리 사용을 줄였다. 이 접근은 반복적 라운드 업데이트에서 자원 효율성을 보장하며 실제 작업 궤적을 빠르게 반영할 수 있게 했다. 결과적으로 모델 진화 사이클이 짧아져 실환경 피드백을 더 자주 반영할 수 있었다.
- Sico 모델 진화 파이프라인은 실제 UI 궤적 수집, 라운드별 평가(주로 Task Success Rate), 그리고 LoRA 기반 업데이트를 순환시키는 구조를 지닌다. 이 파이프라인은 무엇을 최적화해야 하는지(TSR)와 어떻게 데이터를 갱신할지(실제 작업 궤적)를 연결해 지속적 성능 향상을 구현했다. 파이프라인 구성은 새로운 앱으로의 전이 가능성을 유지하면서도 특정 UI 흐름에 특화된 개선을 가능하게 했다.
- 학습 데이터는 Microsoft Edge와 Copilot의 UI 트래젝토리로 구성되어 GUI 환경 특유의 상태 전이와 상호작용 패턴을 모델이 학습하도록 설계되었다. UI 스냅샷과 행동 라벨의 결합은 화면 인식과 행동 생성의 연계를 강화해 단일 프레임 기반의 의사결정이 아닌 연속적 플래닝을 수행하게 했다. 이 데이터 구성은 GUI 작업 성공률 직접 개선에 기여한 핵심 요소로 보고되었다.
- 모델은 이미지-텍스트 입력을 처리하도록 구성되어 vision-language 파이프라인에서 동작하며 transformers 라이브러리를 통해 배포된다. 이 구성은 기존 LLM 파이프라인과의 호환성을 유지하면서도 스크린샷 기반 문제 해결을 가능하게 했다. 결과적으로 엔드투엔드 GUI 작업 자동화를 위한 실용적 통합이 쉬워졌다.
차별점
- Sico 진화 파이프라인은 실작업 궤적을 반복적으로 통합해 라운드 단위로 모델을 향상시키는 워크플로를 채택했다. 이 방식은 단순한 일회성 파인튜닝 대신 실사용 성과를 중심으로 모델 업데이트를 지속적으로 수행하는 구조를 제공했다. 따라서 특정 GUI 테스트셋에서 측정 가능한 Task Success Rate 개선을 꾸준히 달성할 수 있었다.
- LoRA 기반 파인튜닝을 통해 전체 모델을 재학습하지 않고 저순위 어댑터만 갱신함으로써 자원 효율성과 반복적 학습 속도를 동시에 확보했다. 이로 인해 라운드별 업데이트 주기가 짧아지고 실환경 피드백을 더 빠르게 반영할 수 있는 운영적 장점이 생겼다. 특히 모바일·Edge 환경을 고려한 경량화된 업데이트 흐름이 중심이다.
- 학습 데이터 소스로 Microsoft Edge와 Copilot UI 궤적을 사용해 GUI 상호작용의 연속적 패턴을 직접 학습시켰다. 이 데이터 특화는 일반 텍스트-비전 모델과 달리 UI 상태 전이와 행동 시퀀스 완성도를 직접 최적화하는 결과를 낳았다. 따라서 UI 자동화 성능에서 도메인 특화 이득이 발생한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GELab-Zero-4B-preview-Sico-Evolution | TSR | 82.9% | vs base-model baseline (39.8%): +43.1% absolute |
| GELab-Zero-4B-preview base-model baseline | TSR | 39.8% | — |
| gpt-5.4 | TSR | 79.7% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 79.7%) |
| claude-opus-4.6 | TSR | 81.3% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 81.3%) |
| claude-opus-4.7 | TSR | 82.1% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 82.1%) |
| kimi-k2.6 | TSR | 62.6% | — |
| UI-Venus-1.5-30B | TSR | 61.0% | — |
이미지 분석

45
Likes
489
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.