왜 중요한가
3D 자산 제작은 이해·생성·편집이 별개로 발전해 왔고, 특히 기하적 일관성을 유지한 대규모 편집 데이터가 부족해 통합 학습이 어려웠습니다. 본 논문은 87M 샘플 규모의 멀티모달 코퍼스와 Nano3D-v2 자동화 파이프라인을 통해 편집용 페어를 대규모로 확보하고, 이해를 담당하는 VLM과 고충실도 합성을 담당하는 3D-DiT를 연결해 하나의 모델로 다중 3D 과제를 함께 다룹니다. 이 접근은 텍스트→3D 생성 성능을 강화하면서 편집과 파트 생성 능력도 동시 향상시키는 실증적 근거를 제시합니다.
핵심 기여
대규모 3D 멀티모달 코퍼스 구축
논문은 총 약 87M 샘플(25M 이해, 50M 텍스트→3D, 12M 편집 페어)을 자동화 파이프라인으로 생성하여 학습 데이터 병목을 완화했습니다. 특히 텍스트→3D 페어는 계층적 프롬프트 택소노미, 이미지→3D 자산 생성, 다중 뷰 렌더링, VLM 기반의 다계층 캡셔닝과 지오메트리 점수화로 정제됩니다. 이 데이터 규모와 품질이 모델의 생성·편집 성능 향상에 핵심 기여를 했습니다.
Nano3D-v2 편집 데이터 파이프라인
Nano3D-v2는 앵커 뷰 선택, 2D 편집 마스크→학습된 3D 지역 예측기, TRELLIS 기반의 볼셀 편집, LATTICE·NaTex를 통한 고해상 기하·텍스처 정밀화, VLM 기반 무결성 필터링·지시어 재주석의 일련 흐름을 통합했습니다. 소스 외곽은 잠금(frozen)하고 예측된 3D 박스 내부만 수정하는 설계로 아이덴티티 드리프트를 억제합니다. 이 자동화는 수백만 건의 기하 일관 편집 페어를 대규모로 생성 가능하게 했습니다.
Hunyuan3D-VLM과 3D-DiT의 결합
구조·외형 경로로부터 VecSet와 Q-Former를 거쳐 512 토큰으로 압축한 3D 표현을 VLM에서 생성·질의·그라운딩 작업에 사용하고, MLP-Connector로 VLM 히든을 3D-DiT 조건 공간에 투사해 디퓨전 합성에 연결했습니다. 편집과 파트 생성 시 소스 오브젝트 표현을 노이즈 잠재에 연결(attend/concat)해 미수정 영역 보존을 강화했습니다. 이 하이브리드 연결은 이해·생성·편집 간의 능력 이전을 가능하게 했습니다.
단일 아키텍처로 편집·파트 생성 통합
텍스트-그라운디드 파트 생성은 별도 파이프라인이 아닌 VLM의 지시어-따름 데이터로 처리되어 동일한 모델이 파트 분해·추출을 수행하게 했습니다. 편집·파트·텍스트→3D 데이터를 통합해 Omni 전학습을 진행한 뒤, 세 작업군을 분기해 계속학습함으로써 각 작업의 전이 효과를 확보했습니다. 결과적으로 생성 능력이 편집 성능을 개선하고, 이해 능력이 편집의 정밀도를 높이는 상호 보강 관계가 관찰되었습니다.
핵심 아이디어 이해하기
3D 작업군은 서로 보완적이며, 강한 생성(prior)과 정확한 3D 그라운딩이 편집 성능을 끌어올립니다. 본 논문은 3D 이해(VLM)로부터 추출한 정교한 의미·공간 조건을 3D-DiT에 주입하고, 편집 시에는 원본 오브젝트 표현을 디퓨전 입력에 함께 제공해 비편집 영역을 직접 참조하게 만듭니다. 이렇게 하면 텍스트 지시에 따른 국소적 변형은 가능하면서도 전역 구조와 미편집 부분의 일관성은 유지됩니다.
방법론
데이터 측면에서는 계층적 프롬프트 생성→이미지→3D 변환→다중 뷰 렌더→VLM 캡셔닝·지오메트리 스코어링→임계치 필터링으로 50M 규모의 텍스트→3D 코퍼스를 구축하고, Nano3D-v2로 12M 편집 페어를 자동 생성했습니다. 모델 아키텍처는 구조·외형 경로로 포인트클라우드를 VecSet로 인코딩하고 Q-Former로 압축한 뒤 VLM 디코더(autoregressive)로 텍스트·박스 출력을 합니다. 생성기는 Hunyuan3D-2.1에서 초기화한 3D-DiT를 사용하고, VLM 히든을 MLP-Connector로 매핑해 디퓨전 조건으로 교차-어텐션 또는 입력 결합을 수행합니다. 학습은 3단계(3D-VLM 사전학습 → 텍스트→3D 사전학습 → Omni 전학습)와 최종 분기(편집·생성·파트 전학습)를 통해 진행되며, 3D-DiT는 flow-matching 손실로 최적화됩니다.
관련 Figure

왼쪽에는 데이터 스케일과 편집 데이터 비교 그래프가 배치되어 대규모 코퍼스 구축이 핵심임을 시각적으로 전달합니다. 중앙과 오른쪽은 입력 모달리티에서 VLM을 거쳐 3D-DiT로 조건을 전달하는 파이프라인을 도식화해 아키텍처의 모듈 분리와 커넥터 역할을 명확히 합니다. 이 그림은 데이터·이해·생성 모듈의 상호작용과 통합 학습 목표를 빠르게 파악하는 데 유용합니다.
논문의 개요 그림으로, 87M 규모 데이터 구성(25M 이해, 50M 텍스트→3D, 12M 편집)과 Hunyuan3D-Buffalo 1.0 아키텍처(텍스트/이미지/메시 입력 → Hunyuan3D-VLM → 3D-DiT)를 한 페이지에 정리하고 있습니다.

프롬프트 택소노미(L0~L3)와 속성 샘플링, 이미지→3D 자동화, VLM에 의한 캡션·스코어링 과정이 단계적으로 정리되어 있어 대규모 데이터 확보 방법과 품질 통제 지점을 이해할 수 있습니다. 특히 캡션의 6단계 티어와 geometry_quality 점수(0~10)를 도입한 점이 데이터 정제의 핵심임을 강조합니다.
텍스트→3D 데이터 구축 파이프라인 도식으로, 계층적 프롬프트 생성→이미지→3D 변환→렌더링→다계층 캡셔닝→지오메트리 점수링·필터링으로 이어지는 다단계 처리 흐름을 제시합니다.
주요 결과
사람 평가에서 Hunyuan3D-Buffalo 1.0은 텍스트 정합성(55.2%), 기하 품질(57.1%), 전체 선호(56.6%)에서 기존 베이스라인(Omni123, TRELLIS 등)을 크게 앞섰습니다. 편집 벤치(Edit3D-Bench)에서는 3D-VLM 조건 모델의 평균 Chamfer Distance가 0.0091로 Omni123의 0.0684에서 약 86.7% 상대 감소를 기록했고, F1은 0.6515로 Steer3D의 0.2729 대비 2.39배 향상했습니다. 또한 텍스트→3D 데이터 규모(3M→15M→50M)에 따른 절대적 성능 향상을 실험으로 보여 데이터 스케일의 중요성을 정량적으로 입증했습니다.
관련 Figure

여러 샘플에서 모델이 원본 형상 유지와 지시어 기반 변형을 어떻게 처리하는지 비교 관찰이 가능하며, 편집 예시에서는 소스의 비편집 영역 보존과 편집 부위의 자연스러운 병합을 강조합니다. 이 이미지는 정성적 품질을 확인하고 편집 파이프라인(Nano3D-v2)의 효과를 시각적으로 검토하는 데 도움이 됩니다.
티저 이미지 집합으로 텍스트→3D 생성, 편집, 파트 생성 등 모델의 다양한 결과 예시(시드별 생성, 부분 교체·장착, 파트 분리)를 배열해 모델 적용 범위와 출력 품질을 직관적으로 보여줍니다.

같은 입력 문장에 대한 모델별 결과를 나란히 보여주어 형태적 정밀도와 파트 표현의 차이를 직접 비교할 수 있습니다. 이 이미지는 사람 평가에서 보고한 선호도 및 기하 품질 우위를 직관적으로 뒷받침하는 자료로 활용됩니다.
텍스트→3D 정성 비교 그림으로, Ours, Omni123, Universe3D, Trellis 등 여러 모델의 출력이 나란히 배치되어 품질 차이를 시각화합니다.
기술 상세
3D 입력은 컬러 표면 포인트클라우드(xyz, rgb, normal)로 받아 구조 경로와 외형 경로를 병렬 인코딩한 뒤 VecSet→Q-Former로 512 길이 토큰 시퀀스로 압축합니다. VLM 어휘에는 /와 128개 양자화 좌표 토큰을 포함한 133개 특수 토큰을 추가해 박스 기반 그라운딩을 텍스트 시퀀스 출력으로 통합했습니다. 생성기는 Hunyuan3D-2.1로 초기화한 3D-DiT이며, VLM 히든을 MLP-Connector로 투사해 DiT의 cross-attention 조건으로 주입하거나 소스 표현을 노이즈 잠재에 concatenate해 편집 시 원본 참조를 제공합니다. 3D-DiT 학습은 flow-matching 손실을 사용하며, 전학습 단계에서 텍스트→3D와 편집·파트 데이터의 샘플링 비율을 1:1로 맞추고 편집·파트 데이터는 반복 샘플링(×4)으로 균형을 맞춥니다. 훈련 전략은 VLM 정렬 후 DiT 결합, Omni 전학습, 이어서 태스크별 계속학습의 네 단계로 구성됩니다.
관련 Figure

각 단계에서 입력·출력·사용 모델(예: Qwen-Image, TRELLIS, LATTICE, NaTex, VLM 필터링)을 명시해 파이프라인의 모듈별 역할과 데이터 흐름을 분명히 합니다. 편집 계획 단계에서 2D 마스크→3D 박스 예측을 학습하는 설계와, 편집 경계에서의 알파 블렌딩 적용 같은 구현 세부가 드러나 있어 자동화의 핵심 기법을 파악하는 데 유용합니다.
Nano3D-v2 편집 파이프라인의 세부 단계(앵커 뷰 선택, 편집 계획, 볼셀 편집, 정밀 편집, 주석·검증)를 플로우 차트로 정리한 그림입니다.
한계점
단일 스테이지에서 고품질 기하 표현을 얻는 문제는 아직 해결되지 않아 논문은 다단계 DiT 파이프라인에 의존합니다. 텍스트→3D 자산 캡셔닝에 외부 VLM(Gemini)을 사용한 과정에서 생성된 묘사는 때때로 모호하거나 과도하게 일반화되어 데이터 노이즈를 유발할 수 있습니다. 텍스처 편집 분야는 적은 데이터와 복잡한 표현 때문에 본 연구에서 상대적으로 취약하며, Nano3D-v2 내부에서도 편집 마스크 내부의 비편집 영역 일관성 유지가 어려운 경우가 존재합니다.
실무 활용
Hunyuan3D-Buffalo 1.0은 3D 이해·생성·편집을 하나의 모델에서 다루므로 콘텐츠 제작 파이프라인에서 프롬프트 기반 모델링, 자동 파트 추출, 언어 지시형 편집 워크플로우를 한 번에 도입할 수 있습니다. 특히 텍스트에서 시작해 스케치 수준의 요구를 충족하는 3D 자산을 생성하고, 생성된 결과를 자연어로 구체적으로 편집하거나 부분을 분리하는 작업에 적합합니다. 대규모 학습이 필요한 만큼 실제 적용 시에는 사전학습 모델을 서비스화해 인터랙티브 편집 도구에 연결하는 방식이 현실적입니다.
- 게임·애니메이션에서 콘셉트 문구로 초기 3D 모델을 자동 생성하고 이어서 언어로 세부 편집을 수행하는 파이프라인
- 디자인 검증에서 제품의 부분별 분해·교체를 텍스트로 지시해 부품별 프로토타입을 빠르게 생성하는 사례
- 대규모 3D 에셋 마켓플레이스에서 텍스트 검색어로 관련 파트를 추출하고 재조립해 맞춤형 자산을 제공하는 서비스
코드 공개 여부: 미확인
키워드
용어 해설
- 3D-DiT
- — 3D-DiT는 diffusion transformer 계열의 3D 생성 백본으로, 3D 잠재맵에서 노이즈-정제 과정(denoising)을 학습해 텍스트 조건 하에 구조적이고 다중뷰 일관한 3D 자산을 합성합니다. 논문에서는 Hunyuan3D-2.1에서 초기화한 3D-DiT를 사용해 텍스트→3D 사전학습을 수행하고, VLM의 히든 상태를 MLP-Connector로 매핑해 디퓨전 조건으로 주입합니다. 최적화는 flow-matching 계열 목적함수로 진행되어 Gaussian prior에서 목표 3D 잠재분포로의 변환 벨로시티를 예측합니다.
- Hunyuan3D-VLM
- — Hunyuan3D-VLM은 구조(좌표·노멀)와 외형(RGB)을 병렬로 인코딩한 3D 비전-언어 모델로, VecSet 인코더와 Q-Former를 거쳐 고정 길이 토큰(512)으로 압축한 뒤 텍스트/이미지 토큰과 결합해 디코더형 Transformer로 자승적 출력(텍스트+박스 좌표)을 생성합니다. 3D 바운딩 박스 표현을 위해 133개 특수 토큰(박스 구분자·양자화 좌표)을 어휘에 추가해 명시적 그라운딩을 지원합니다.
- Nano3D-v2
- — Nano3D-v2는 대규모 3D 편집 페어를 자동 생성하기 위한 파이프라인으로, 앵커 뷰 선택→2D 편집 마스크 생성→학습된 3D 지역 예측기(Editing Planning)→볼셀이디팅(TRELLIS 기반 FlowEdit)→LATTICE/NaTex로 정밀 기하·텍스처 보정하고 VLM으로 필터링·주석을 생성하는 다단계 흐름을 사용합니다. 이 과정은 소스 구조 보존과 편집 영역의 기하 일관성 확보를 목표로 하며 수백만 샘플 규모의 편집 데이터 구축을 가능하게 합니다.
- flow-matching 목적함수(Flow-matching objective)
- — Flow-matching은 디퓨전·생성 학습에서 Gaussian prior에서 목표 잠재분포로의 벡터장(velocity field)을 예측하도록 모델을 훈련하는 방법입니다. 입력으로 노이즈화된 잠재와 시간 인자를 받고 목표 벡터장을 출력하여 역방향 흐름을 학습하며, 본 논문에서는 3D-DiT의 생성 단계 최적화에 이 손실을 적용했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.