microsoft/GELab-Zero-4B-preview-Sico-Evolution
LoRA로 파인튜닝된 4B GUI 에이전트가 Edge와 Copilot UI 궤적을 학습해 Task Success Rate를 39.8%에서 82.9%로 향상시켰다.
학습 방식 · 기반 모델은 GELab-Zero-4B-preview이며 LoRA 방식으로 파인튜닝하여 전체 가중치 대신 저순위 어댑터만 학습시켰다. 학습 데이터로는 Microsoft Edge와 Copilot UI에서 수집한 실제 사용자-에이전트 궤적을 사용했고 라운드 단위로 평가 지표를 반영해 모델을 반복 고도화하는 Sico 모델 진화 파이프라인을 적용했다. 이 과정은 Task Success Rate를 직접 최적화 목표로 삼아 실사용 시나리오에서의 행동 완성도를 지속적으로 끌어올리는 방식으로 운영되었다.
TL;DR
GELab-Zero-4B-preview-Sico-Evolution은 GELab-Zero-4B-preview를 기반으로 LoRA로 파인튜닝된 4B 규모의 GUI 에이전트로서 Microsoft Edge와 Copilot UI 궤적을 학습 데이터로 사용해 실작업 기반으로 성능을 향상시켰다. Sico의 모델 진화 파이프라인은 라운드별 실사용 궤적 수집과 평가를 반복해 Task Success Rate를 직접 최적화하는 구조를 채택했고 그 결과 TSR이 39.8%에서 82.9%로 상승하며 +43.1%p의 절대 개선을 기록했다. README에 명시된 비교에서는 Sico-Evolution이 일부 폐쇄형 경쟁 모델보다 높은 TSR을 달성한 것으로 보고되어 도메인 특화 파인튜닝과 반복적 진화가 GUI 자동화 작업의 실효성을 크게 개선함이 확인되었다. 다만 공개된 수치는 Edge/Copilot 테스트셋에서의 결과로, 다른 앱·데이터셋으로의 일반화 범위는 추가 검증이 필요하다.
핵심 포인트
- Sico 진화 파이프라인은 실작업 궤적을 반복적으로 통합해 라운드 단위로 모델을 향상시키는 워크플로를 채택했다. 이 방식은 단순한 일회성 파인튜닝 대신 실사용 성과를 중심으로 모델 업데이트를 지속적으로 수행하는 구조를 제공했다. 따라서 특정 GUI 테스트셋에서 측정 가능한 Task Success Rate 개선을 꾸준히 달성할 수 있었다.
- LoRA 기반 파인튜닝을 통해 전체 모델을 재학습하지 않고 저순위 어댑터만 갱신함으로써 자원 효율성과 반복적 학습 속도를 동시에 확보했다. 이로 인해 라운드별 업데이트 주기가 짧아지고 실환경 피드백을 더 빠르게 반영할 수 있는 운영적 장점이 생겼다. 특히 모바일·Edge 환경을 고려한 경량화된 업데이트 흐름이 중심이다.
- 학습 데이터 소스로 Microsoft Edge와 Copilot UI 궤적을 사용해 GUI 상호작용의 연속적 패턴을 직접 학습시켰다. 이 데이터 특화는 일반 텍스트-비전 모델과 달리 UI 상태 전이와 행동 시퀀스 완성도를 직접 최적화하는 결과를 낳았다. 따라서 UI 자동화 성능에서 도메인 특화 이득이 발생한다.
- 공개된 결과에서 Task Success Rate가 82.9%로 보고되어 동일 계열의 base 모델(39.8%) 대비 절대치로 크게 향상된 성능을 보였다. 이 수치는 README에 명시된 라인에서 확인되며 실작업 궤적 기반 최적화의 효과를 반영한다. 향상 폭(+43.1%p)은 Sico 진화 파이프라인과 LoRA 기반 튜닝의 결합이 GUI 작업 성능에 실질적 이득을 주었음을 시사한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GELab-Zero-4B-preview-Sico-Evolution | TSR | 82.9% | vs base-model baseline (39.8%): +43.1% absolute |
| GELab-Zero-4B-preview base-model baseline | TSR | 39.8% | — |
| gpt-5.4 | TSR | 79.7% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 79.7%) |
| claude-opus-4.6 | TSR | 81.3% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 81.3%) |
| claude-opus-4.7 | TSR | 82.1% | README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 82.1%) |
| kimi-k2.6 | TSR | 62.6% | — |
| UI-Venus-1.5-30B | TSR | 61.0% | — |
이미지 분석

45
LIKES
489
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.