Tencent, 0.5B 규모로 로봇 제어와 시각 추론을 결합한 HY-Embodied 공개
이미지 및 텍스트 기반 행동 생성 및 추론0.5Bother
시각적 입력과 텍스트 명령을 결합하여 물리적 환경에서의 행동 제어 및 추론을 수행하는 0.5B 규모의 경량 임바디드 멀티모달 모델이다.
핵심 역량
- 시각 정보 기반 행동 계획 수립
- 멀티모달 대화 및 질의응답
- 이미지 내 객체 인식 및 상호작용 추론
- 다국어 텍스트 처리
강점
- 0.5B 규모로 모바일 및 로봇 엣지 환경에서 효율적인 추론 가능
- 시각적 이해와 행동 제어를 통합한 MoT 아키텍처 적용
훈련 방식
Hunyuan-VL-MoT 기반의 Mixture-of-Thought 기법을 적용한 엔드투엔드 멀티모달 학습
알아두면 좋은 것
- 0.5B 규모의 경량화된 파라미터 설계
- Hunyuan-VL-MoT 아키텍처 기반의 엔드투엔드 학습 방식 적용
- 임바디드 AI 및 로봇 공학 연구를 위한 특화 모델
- 다국어 지원 및 커스텀 코드 기반의 추론 로직 포함
901
Likes
2.5k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.