컴퓨터 화면을 보고 직접 조작하는 Qwen 3.5 MoE 기반 차세대 멀티모달 에이전트
이미지-텍스트 멀티모달 추론 및 GUI 액션 생성35Bapache-2.0
Qwen 3.5 MoE 35B 아키텍처를 기반으로 이미지와 텍스트를 동시에 처리하여 컴퓨터 GUI 환경에서 자율적인 액션을 수행하도록 설계된 멀티모달 에이전트 모델이다.
핵심 역량
- 멀티모달 이미지-텍스트 통합 추론
- 컴퓨터 GUI 화면 구성 요소 인식 및 분석
- 에이전트 실행을 위한 액션 시퀀스 생성
- 컴퓨터 사용(Computer Use) 자동화 워크플로우 수행
- 사용자 명령 기반의 멀티턴 대화 및 작업 수행
강점
- MoE 아키텍처를 통한 35B급 모델의 효율적인 추론 성능 제공
- 이미지 기반 GUI 조작 및 에이전트 기능에 특화된 멀티모달 성능
- Apache 2.0 라이선스로 제약 없는 상업적 활용 가능
훈련 방식
Qwen/Qwen3.5-35B-A3B 기반 파인튜닝, GUI 에이전트 및 Computer Use 액션 데이터셋 활용
알아두면 좋은 것
- Qwen 3.5 MoE 35B 기반의 고성능 오픈소스 아키텍처 활용
- GUI 에이전트 및 액션 수행(Action/Agent) 태스크에 특화된 메타데이터 구성
- Apache 2.0 라이선스를 적용하여 상업적 이용 및 수정이 자유로움
- Transformers 라이브러리와 호환되어 기존 ML 파이프라인에 즉시 통합 가능
269
Likes
2.7k
Downloads
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.