vhm-vlm
Hunyuan3D-VLM
Hunyuan3D-VLM은 구조(좌표·노멀)와 외형(RGB)을 병렬로 인코딩한 3D 비전-언어 모델로, VecSet 인코더와 Q-Former를 거쳐 고정 길이 토큰(512)으로 압축한 뒤 텍스트/이미지 토큰과 결합해 디코더형 Transformer로 자승적 출력(텍스트+박스 좌표)을 생성합니다. 3D 바운딩 박스 표현을 위해 133개 특수 토큰(박스 구분자·양자화 좌표)을 어휘에 추가해 명시적 그라운딩을 지원합니다.