스크린샷으로 픽셀 단위 웹 자동화를 수행하는 27B 멀티모달 에이전트
Fara1.5-27B는 Qwen3.5-27B 기반으로 SFT된 멀티모달 에이전트로 스크린샷만으로 픽셀 좌표를 포함한 도구 호출을 생성해 브라우저 작업을 순차적으로 수행한다.
TL;DR
Fara1.5-27B는 Qwen3.5-27B를 기반으로 Supervised Fine-Tuning한 멀티모달 웹 자동화 에이전트로, 스크린샷과 사용자 목표를 입력받아 체인오브소트와 XML 형식의 도구 호출(픽셀 좌표 포함)을 생성해 연속적 웹 작업을 수행하도록 설계되었다. 데이터는 FaraGen1.5의 다중 에이전트 시뮬레이션으로 합성된 성공 궤적과 UI 그라운딩·OCR 같은 시각적 이해 데이터의 혼합으로 구성되어 장기 궤적 학습에 초점을 맞추었다. 262,144 토큰의 긴 컨텍스트와 좌표 그라운딩을 통해 멀티스크린샷 히스토리를 유지하면서 정밀한 클릭·입력 명령을 산출할 수 있으며, 실환경 위험을 줄이기 위해 MagenticLite 샌드박스와 critical-points 안전 규칙을 권장한다. 시각적 노이즈·렌더링 오류와 누적 오류로 인한 궤적 실패 가능성 및 영어 중심의 학습 데이터 한계는 운영상 유의해야 할 제약으로 남아 있다.
핵심 역량
- 스크린샷 기반으로 화면 요소를 인식하고 픽셀 좌표를 포함한 클릭·드래그 명령을 생성해 직접적인 브라우저 조작 명령을 출력할 수 있다.
- 사용자 목표를 받아 폼 작성·예약·장바구니 조작·검색과 같은 다단계 작업을 행동 시퀀스로 계획하고 차례로 수행할 수 있다.
- 체인오브소트 텍스트를 함께 생성해 의사결정 근거와 다음 행동의 인자를 제공하며, 도구 호출 블록은 XML/JSON 형식으로 샌드박스 실행과 연동되도록 설계되었다.
- 중요 단계에서 자동으로 중단하고 사용자 확인을 요구하는 critical-points 규칙을 적용해 개인정보 입력·결제·제출과 같은 되돌리기 어려운 행동을 제어한다.
강점
- 웹 자동화 전용 데이터 파이프라인(FaraGen1.5)으로 합성된 연속적 성공 궤적을 사용해 멀티스텝 행동 예측 성능이 개선되었다.
- 좌표 기반 그라운딩을 직접 산출하므로 별도의 위치 그라운딩 모델 없이도 도구 호출을 바로 실행 가능한 출력을 제공한다.
- 262K 토큰의 긴 컨텍스트와 27B 파라미터를 결합해 다중 스크린샷 히스토리를 유지하면서 단일 GPU(권장 A100/H100/B200) 환경에 맞는 배포 가능성을 제공한다.
훈련 방식
Qwen3.5-27B를 기반으로 한 Supervised Fine-Tuning 방식으로 학습했으며 데이터는 FaraGen1.5로 합성된 성공 궤적과 UI 그라운딩 데이터, OCR·캡셔닝 등 시각적 이해용 공개·큐레이션 데이터의 혼합으로 구성되었다. 학습 기간은 2026년 1월부터 4월까지이며 훈련은 64×NVIDIA B200에서 6일간 수행되어 대규모 스크린샷 기반 연속 행동을 학습했다. 안전성 강화용으로 거부 사례와 critical-points 규칙이 훈련 데이터에 포함되어 있다.
알아두면 좋은 것
- 모델은 Qwen3.5-27B를 기반으로 Supervised Fine-Tuning을 거쳤으며 학습 데이터는 FaraGen1.5로 합성한 웹 태스크 궤적을 주로 사용했다.
- 컨텍스트 길이는 262,144 토큰으로 멀티스크린샷과 전체 행동 이력을 포함한 장기 대화 추적이 가능하도록 설계되었다.
- 권장 배포는 MagenticLite로 샌드박스, 허용 목록, 감시 모드, 즉시 중단 기능을 제공해 실환경 위험을 줄이는 것이 핵심 권장사항이다.
기술적 특징
- 모델 아키텍처는 이미지와 텍스트를 함께 소비하는 멀티모달 디코더 전용 구조로, 입력된 스크린샷을 임베딩화한 뒤 텍스트 토큰과 결합해 연속적인 텍스트 출력과 XML 도구 호출을 생성한다. 이 설계는 시각적 장면 인식을 토큰 수준의 추론과 직접 연결해 행동 예측의 정합성을 높였다. 결과적으로 DOM 접근 없이도 시각적 정보만으로 행동을 결정할 수 있다.
- 좌표 그라운딩은 출력 포맷에 픽셀 좌표와 드래그 타깃을 포함시키는 방식으로 구현되어 별도 포스트프로세싱 없이 바로 실행 가능한 도구 호출을 만든다. 학습 시에는 스크린샷-행동 정합 데이터와 바운딩박스 라벨을 통해 좌표 예측을 직접 학습했다. 이로 인해 클릭·드래그 같은 정밀 조작이 가능해졌다.
- 데이터 생성은 FaraGen1.5의 다중 에이전트 시뮬레이션으로 이루어지며, 에이전트가 태스크를 시도하고 검증기를 통해 성공 궤적만 선별하는 파이프라인을 사용했다. 이 방식은 인간이 수집하기 어려운 다양한 실패·복구 시나리오와 장기 궤적을 대규모로 확보하는 데 기여했다. 검증 단계는 레이블 품질과 행동 일관성을 유지하는 핵심 메커니즘이다.
- 안전성 설계는 critical-points 규칙을 학습 과정과 실행 정책에 통합해 개인 정보 입력·결제·제출과 같은 되돌리기 어려운 작업 직전에 모델이 자동으로 멈추고 사용자 확인을 요구하도록 구성되었다. 이 규칙은 훈련 데이터의 거부 사례와 시스템 프롬프트에 명시된 조건으로 구체화되었다. 배포 권장 환경인 MagenticLite는 이러한 운영 규칙을 실행 시 보장하는 샌드박스 기능을 제공한다.
차별점
- 스크린샷만으로 작동하는 vision-only CUA 설계로 DOM 접근 없이 인간과 유사한 입력 모달리티를 사용한다.
- 출력에 픽셀 좌표를 포함하는 coordinate-grounding 방식으로 별도 그라운딩 모델 없이 정밀한 클릭·드래그를 산출한다.
- FaraGen1.5를 통한 합성·검증된 연속 행동 데이터로 멀티스텝 궤적 학습에 최적화되었다.
- critical-points 규칙과 MagenticLite 권장 배포를 결합해 자동화의 안전성과 운영 통제성을 함께 고려했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| WebVoyager | outcome success | 89.3 | — |
| Online-Mind2Web | outcome success | 72.3 | — |
| WebTailBench | outcome success | 40.2 | — |
222
Likes
2.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.