본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/GELab-Zero-4B-preview-Sico-Evolution

이 모델은 이미지와 텍스트를 입력으로 받아 GUI 상호작용을 텍스트형 액션 또는 응답으로 생성하는 image-text-to-text 작업을 수행한다. 구체적으로 화면 스크린샷과 UI 상태를 해석해 클릭, 입력, 네비게이션 같은 연속적 조작 지시를 생성하며 단계별 수행 여부를 고려해 최종 목표를 달성하도록 설계되었다. 영어와 중국어를 지원하는 멀티언어 입력이 모델 태스크의 일부로 명시되어 있다.4Bapache-2.0

LoRA로 파인튜닝된 4B GUI 에이전트가 Edge와 Copilot UI 궤적을 학습해 Task Success Rate를 39.8%에서 82.9%로 향상시켰다.

학습 방식 · 기반 모델은 GELab-Zero-4B-preview이며 LoRA 방식으로 파인튜닝하여 전체 가중치 대신 저순위 어댑터만 학습시켰다. 학습 데이터로는 Microsoft Edge와 Copilot UI에서 수집한 실제 사용자-에이전트 궤적을 사용했고 라운드 단위로 평가 지표를 반영해 모델을 반복 고도화하는 Sico 모델 진화 파이프라인을 적용했다. 이 과정은 Task Success Rate를 직접 최적화 목표로 삼아 실사용 시나리오에서의 행동 완성도를 지속적으로 끌어올리는 방식으로 운영되었다.

TL;DR

GELab-Zero-4B-preview-Sico-Evolution은 GELab-Zero-4B-preview를 기반으로 LoRA로 파인튜닝된 4B 규모의 GUI 에이전트로서 Microsoft Edge와 Copilot UI 궤적을 학습 데이터로 사용해 실작업 기반으로 성능을 향상시켰다. Sico의 모델 진화 파이프라인은 라운드별 실사용 궤적 수집과 평가를 반복해 Task Success Rate를 직접 최적화하는 구조를 채택했고 그 결과 TSR이 39.8%에서 82.9%로 상승하며 +43.1%p의 절대 개선을 기록했다. README에 명시된 비교에서는 Sico-Evolution이 일부 폐쇄형 경쟁 모델보다 높은 TSR을 달성한 것으로 보고되어 도메인 특화 파인튜닝과 반복적 진화가 GUI 자동화 작업의 실효성을 크게 개선함이 확인되었다. 다만 공개된 수치는 Edge/Copilot 테스트셋에서의 결과로, 다른 앱·데이터셋으로의 일반화 범위는 추가 검증이 필요하다.

핵심 포인트

  • Sico 진화 파이프라인은 실작업 궤적을 반복적으로 통합해 라운드 단위로 모델을 향상시키는 워크플로를 채택했다. 이 방식은 단순한 일회성 파인튜닝 대신 실사용 성과를 중심으로 모델 업데이트를 지속적으로 수행하는 구조를 제공했다. 따라서 특정 GUI 테스트셋에서 측정 가능한 Task Success Rate 개선을 꾸준히 달성할 수 있었다.
  • LoRA 기반 파인튜닝을 통해 전체 모델을 재학습하지 않고 저순위 어댑터만 갱신함으로써 자원 효율성과 반복적 학습 속도를 동시에 확보했다. 이로 인해 라운드별 업데이트 주기가 짧아지고 실환경 피드백을 더 빠르게 반영할 수 있는 운영적 장점이 생겼다. 특히 모바일·Edge 환경을 고려한 경량화된 업데이트 흐름이 중심이다.
  • 학습 데이터 소스로 Microsoft Edge와 Copilot UI 궤적을 사용해 GUI 상호작용의 연속적 패턴을 직접 학습시켰다. 이 데이터 특화는 일반 텍스트-비전 모델과 달리 UI 상태 전이와 행동 시퀀스 완성도를 직접 최적화하는 결과를 낳았다. 따라서 UI 자동화 성능에서 도메인 특화 이득이 발생한다.
  • 공개된 결과에서 Task Success Rate가 82.9%로 보고되어 동일 계열의 base 모델(39.8%) 대비 절대치로 크게 향상된 성능을 보였다. 이 수치는 README에 명시된 라인에서 확인되며 실작업 궤적 기반 최적화의 효과를 반영한다. 향상 폭(+43.1%p)은 Sico 진화 파이프라인과 LoRA 기반 튜닝의 결합이 GUI 작업 성능에 실질적 이득을 주었음을 시사한다.

벤치마크

벤치마크지표비교
GELab-Zero-4B-preview-Sico-EvolutionTSR82.9%vs base-model baseline (39.8%): +43.1% absolute
GELab-Zero-4B-preview base-model baselineTSR39.8%
gpt-5.4TSR79.7%README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 79.7%)
claude-opus-4.6TSR81.3%README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 81.3%)
claude-opus-4.7TSR82.1%README에 따르면 Sico-Evolution이 더 높음 (82.9% vs 82.1%)
kimi-k2.6TSR62.6%
UI-Venus-1.5-30BTSR61.0%

이미지 분석

Edge 및 Copilot 테스트셋에 대한 모델별 Task Success Rate를 막대 그래프로 시각화한 차트이다.
그래프는 GELab-Zero-4B-preview-Sico-Evolution이 82.9%의 TSR을 기록해 동일 계열의 base 모델(39.8%) 대비 크게 높은 성능을 보였음을 수치로 보여준다. 차트 상에서 Sico-Evolution은 gpt-5.4(79.7%), claude-opus-4.6(81.3%), claude-opus-4.7(82.1%)보다 높은 막대를 형성해 README의 비교 서술을 시각적으로 뒷받침한다. 이 이미지는 모델 간 절대 TSR 비교와 Sico 파이프라인의 효과를 한눈에 확인할 수 있는 근거 시각자료 역할을 한다.

45

LIKES

489

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.