hunyuan3d-vlm
Hunyuan3D-VLM(3D VLM)
Hunyuan3D-VLM은 3D 구조와 외형을 동시에 인코딩하는 Vision-Language Model로, VecSet/Q-Former로 포인트클라우드 토큰을 생성하고 512 토큰 길이로 압축해 텍스트·이미지와 결합한다. 바운딩박스 토큰과 파트 토큰을 추가해 3D 그라운딩·파트 질의·편집 지시를 처리한다.
Hunyuan3D-VLM(3D VLM)
Hunyuan3D-VLM은 3D 구조와 외형을 동시에 인코딩하는 Vision-Language Model로, VecSet/Q-Former로 포인트클라우드 토큰을 생성하고 512 토큰 길이로 압축해 텍스트·이미지와 결합한다. 바운딩박스 토큰과 파트 토큰을 추가해 3D 그라운딩·파트 질의·편집 지시를 처리한다.