이미지 한 장에서 PBR 텍스처와 복잡한 토폴로지의 3D 자산을 즉시 생성하는 4B 파라미터 모델
TRELLIS.2는 O-Voxel 기반의 희소 3D VAE와 흐름 모델을 결합해 이미지에서 고해상도 PBR 3D 자산을 빠르게 생성하는 오픈소스 4B 파라미터 모델이다.
TL;DR
TRELLIS.2는 O-Voxel이라는 필드-프리 희소 복셀 표현과 Sparse 3D VAE를 결합해 이미지에서 고해상도 PBR 3D 자산을 생성하는 오픈소스 연구 프로젝트로, 4B 파라미터 모델과 공개 체크포인트·데모·학습 코드를 함께 제공한다. 입력 이미지는 16× 다운샘플된 컴팩트 잠재로 인코딩되고 여러 단계의 흐름 모델이 형태와 텍스처를 생성한 뒤 O-Voxel로 변환되어 CUDA 가속 후처리로 GLB와 렌더 비디오를 출력한다. README에 제시된 H100 기준 성능에서 512³는 약 3초, 1024³는 약 17초, 1536³는 약 60초가 소요되며 O-Voxel은 열린 표면과 비다발성 구조를 손실 없이 처리하는 점이 차별점이다. 전용 라이브러리들과의 통합으로 프로덕션 파이프라인에서 실용적 추론 시간을 달성하는 것을 목표로 하지만 Linux와 NVIDIA 24GB급 GPU, CUDA 설치가 필요하다는 운영 제약이 있다.
주요 기능
- 고해상도 PBR 자산을 생성하고, 베이스 컬러·러프니스·메탈릭·투명도 같은 다중 표면 속성을 포함한 완전한 텍스처를 출력하여 렌더링 준비형 3D 결과물을 산출한다. 이 기능은 DiTs 계열의 생성 네트워크와 결합되어 텍스처·형상을 동시에 복원한다. 출력은 GLB로 내보낼 수 있어 기존 3D 워크플로로 이어지는 것이 가능하다.
- 희소 3D VAE로 자산을 16배 공간 다운샘플링한 컴팩트한 잠재 공간에 인코딩하여 메모리와 연산 효율을 확보한다. 이 인코딩은 구조적 흐름 모델과 결합되어 샘플링과 재구성 단계를 분리하고 고해상도 복원을 허용한다. 잠재 표현은 후처리에서 O-Voxel을 통해 메시로 즉시 변환된다.
- O-Voxel 표현을 통해 열린 표면, 비다발성 지오메트리, 내부 폐쇄 구조 같은 임의 토폴로지를 손실 없이 처리한다. 필드 기반 등고면으로는 포착하기 어려운 복잡한 형상을 보존하면서 텍스처 속성까지 유지한다. 이로 인해 의복·식물·중첩된 내부 구조 등 실제 자산의 다양성을 다룰 수 있다.
- CUDA 가속 라이브러리와 연동해 실용적 처리 시간을 확보하고, 리포지토리에서 제공하는 설치 스크립트로 FlexGEMM·CuMesh·nvdiffrast 같은 고성능 패키지를 함께 사용하도록 구성되어 있다. README의 벤치마크에서 H100 기준으로 512³ 렌더링 약 3초, 1024³ 약 17초를 보고했다. 또한 O-Voxel↔메시 변환은 CPU·CUDA 기준으로 매우 빠른 처리 시간을 목표로 설계되었다.
어떻게 동작하는가
TRELLIS.2는 입력 이미지를 조건으로 희소 구조 흐름(sparse-structure flow)과 단계적 잠재 샘플링을 통해 3D 형태와 텍스처를 생성한다. 입력 자산은 먼저 Sparse 3D VAE로 16배 다운샘플링된 컴팩트한 잠재로 인코딩되며, 이후 여러 단계의 흐름 모델(shape flow, texture flow)이 해당 잠재를 점진적으로 생성·정교화한다. 최종 결과는 O-Voxel 표현으로 변환되어 nvdiffrast/CuMesh 기반 후처리로 텍스처가 입은 메시(GLB)로 출력된다.
해결 문제
단일 이미지에서 복잡한 토폴로지와 완전한 PBR 재질을 가진 고해상도 3D 자산을 생성하는 문제를 해결한다. 기존 필드 기반 등고면 접근이 실패하거나 손실을 유발하던 열린 표면 및 비다발성 구조를 O-Voxel로 보존하면서 텍스처와 형상을 동시에 복원한다. 또한 대형 볼륨 표현의 메모리·연산 부담을 희소 VAE와 흐름 모델 설계로 경감하여 실용적인 추론 시간을 제공한다.
지금 주목받는 이유
arXiv에 게시된 논문과 Hugging Face에 공개된 4B 체크포인트, 그리고 Hugging Face Spaces 데모가 함께 제공되어 연구성과·모델·체험이 동시에 노출되었기 때문이다. 고해상도 PBR 자산을 단일 이미지로부터 빠르게 생성할 수 있다는 실용적 성격이 관심을 끌었다. 또한 Microsoft가 주도하는 공개 리포지토리로서 학습 코드와 체크포인트를 함께 배포한 점이 채택을 촉진했다.
차별점
- O-Voxel이라는 필드-프리 희소 복셀 표현을 사용해 열린 표면과 비다발성 구조, 내부 폐쇄 구조를 손실 없이 보존하면서 텍스처 속성까지 유지한다. 이 접근은 기존 등고면 기반 파이프라인이 변환 과정에서 유실하는 디테일을 회복하도록 설계되어 있다. 결과적으로 의복·식물·중첩된 내부 구조 같은 복잡한 자산을 더 정확하게 재현한다.
- 희소 3D VAE의 16배 공간 다운샘플링과 단계적 흐름 모델을 결합해 컴팩트한 잠재에서 고해상도 재구성을 수행함으로써 메모리·연산 효율을 확보한다. 이 설계는 단일 GPU에서의 실용적 추론 시간을 가능하게 하며, README에 제시된 H100 기준 해상도별 처리시간 근거를 통해 속도·품질 균형을 입증한다. 또한 CUDA 가속 도구들과 통합되어 전처리·후처리 성능을 극대화한다.
- 프로젝트는 모델·체크포인트·데모 및 전체 훈련 코드를 공개해 이미지→3D 추론뿐 아니라 스크래치부터의 학습과 파인튜닝까지 동일 코드베이스에서 수행할 수 있도록 구성되어 있다. 공개된 툴체인은 O-Voxel, FlexGEMM, CuMesh 같은 고성능 구성 요소와 연동되어 실무 적용 경로를 단축한다. 이로 인해 연구 재현성과 실무 적용 가능성이 동시에 확보된다.
사용 사례
- 게임·AR용 에셋 제작에서 단일 콘셉트 이미지로부터 PBR 텍스처가 포함된 고해상도 3D 모델을 빠르게 프로토타입하는 용도로 활용할 수 있다. 이 과정은 텍스처와 형상을 함께 얻어 3D 소프트웨어로 가져가 리터칭 또는 애셋 통합을 진행하는 워크플로우로 이어진다. O-Voxel은 열린 표면과 내부 구조를 보존하므로 의상이나 식물 같은 복잡한 객체 제작에 유리하다.
- 디지털 아카이빙·복원 프로젝트에서 사진 기반 복원물을 생성할 때 유용하며, 기존 사진 자료를 바탕으로 재질 정보를 포함한 3D 재현을 자동화할 수 있다. PBR 채널을 보존하므로 복원물의 시각적 충실도를 보장할 수 있다. 결과물은 GLB로 추출되어 웹·뷰어에서 바로 확인 가능하다.
- 연구용 대규모 데이터셋 제작 파이프라인에서 Objaverse-XL 같은 데이터와 결합해 형태·텍스처 쌍을 대량으로 합성하거나 파인튜닝 데이터로 활용할 수 있다. 제공된 학습 스크립트를 통해 shape/texture 흐름 모델을 재학습하거나 고해상도 파인튜닝을 수행할 수 있다. 이 과정은 희소 잠재 표현을 통해 저장·처리 비용을 낮춘 상태로 진행된다.
- 3D 자산 파이프라인의 자동화 단계에서 텍스처 생성·메시 후처리·GLB 내보내기 전 과정을 스크립트화해 서버 사이드 배치 작업으로 운영할 수 있다. README에 포함된 예제와 app.py 데모는 서버형 데모 또는 내부 툴로 통합하기 위한 출발점을 제공한다. CUDA 가속 및 후처리 도구 통합은 대량 처리 성능을 뒷받침한다.
시작하기
레포지토리를 클론한 뒤 제공된 setup.sh 스크립트로 의존성을 설치하고 새로운 conda 환경을 생성하면 기본 실행 환경이 구성된다. 예시 명령으로는 '. ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm'가 있으며 이 과정에서 CUDA_HOME 설정이나 ATTEN_BACKEND 변경과 같은 환경 변수 조정이 필요할 수 있다. 설치가 완료되면 Trellis2ImageTo3DPipeline.from_pretrained("microsoft/TRELLIS.2-4B") 호출로 모델을 불러와 최소 예제 스크립트를 실행하여 sample.mp4와 sample.glb를 생성할 수 있다.
요구사항
- 운영체제는 현재 Linux에서만 검증되어 있으며 Windows나 macOS에 대한 공식 지원은 제공되지 않는다.
- GPU는 최소 24GB 이상의 NVIDIA GPU가 필요하며 README에서는 A100과 H100에서 검증되었다.
- CUDA Toolkit 설치가 필요하며 권장 버전은 12.4이고, Conda로 종속성을 관리할 것을 권장하며 Python 3.8 이상을 사용해야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Resolution 512³ rendering time | Total Time | ~3s | Tested on NVIDIA H100 GPU |
| Resolution 1024³ rendering time | Total Time | ~17s | Tested on NVIDIA H100 GPU |
| Resolution 1536³ rendering time | Total Time | ~60s | Tested on NVIDIA H100 GPU |
9.7k
Stars
1.2k
Forks
+204
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.