왜 중요한가
다중 시점에서 서로 다른 의미를 갖는 3D 객체를 한 메쉬로 표현하는 기술은 기존 SDS 기반 방법의 느림, 과포화된 색상, 불연속 접합 문제로 제약이 크다. JanusMesh는 훈련 없이 두 가지 시맨틱을 갖는 고품질 3D 환상을 빠르게 생성하며, 지오메트리 무결성과 텍스처 품질을 모두 향상시킨다.
핵심 기여
Stage 1: Dual-branch geometry generation with cross-space denoising
Stage 1은 두 개의 시맨틱(y1, y2)을 조건으로 하는 Dual-branch denoising을 구축하고, latent를 voxel space로 디코딩한 뒤 CLIP-guided orientation search로 실루엣 정렬을 수행하고, SDF blending으로 두 객체를 지오메트릭하게 융합한다. 융합된 기하를 다시 latent으로 인코딩한다. 이 프로세스는 training 없이 진행되며, 매 스텝마다 두 지오메트리가 충돌 없이 공존하도록 보장한다.
Stage 2: View-conditioned texture synthesis
Stage 2는 fused 메시에 대해 view-dependent 텍스처를 생성한다. depth-conditioned Stable Diffusion과 ControlNet으로 각 시점에서의 texture를 예측한 뒤 Mesh Texture Aggregation으로 두 시점의 텍스처를 코사인 가중치로 결합한다.
CLIP-guided adaptive orientation search
CLIP render-caption 유사도를 활용해 두 객체의 실루엣을 정렬하는 최적 회전 θ2*를 선택하고, anchor view I1을 통해 두 객체의 시각적 정합성을 높인다.
Training-free 도입과 빠른 런타임
SDS 기반의 시간 소요(약 40분)에 비해 본 방법은 training-free로 3~5분 내에 두 개의 의미를 가진 3D 환상을 생성할 수 있다.
세 객체 확장 및 평가 프로토콜
세 객체 확장(3-object illusion)과 CLIP, GPT-4.1-mini, FID/KID 및 물체 검출 기반 평가 등 포괄적 평가 프로토콜을 도입했다.
핵심 아이디어 이해하기
출발점: 두 가지 의미를 갖는 3D 환상을 얻으려면 각 시점에서의 기하학적 일관성과 텍스처 해석이 동시에 필요하다. 기존의 SDS 기반 방식은 per-객체 최적화가 필요하고, 합성 시 지오메트리 간섭이 발생하기 쉽다. 본 논문은 3D latent를 두 개의 독립적 denoising 경로로 처리한 뒤, voxel 공간에서 SDF blending으로 기하를 융합하고, 재차 latent로 인코딩한다. 이 Cross-space denoising은 Geometric validity를 유지하는 동시에 두 시맨틱의 분리된 표현을 가능하게 한다. 텍스처는 Stage 2에서 view별로 2D diffusion priors를 투사·합성하고, Mesh Texture Aggregation으로 두 시점 간의 경계에서도 매끄러운 텍스처를 보장한다. CLIP-guided Orientation Search는 두 객체의 실루엣 정합성을 자동으로 최적화하여 지오메트리 간섭을 최소화한다. 최종적으로 3D 환상의 질은 3~5분의 실행 시간과 함께 실험적으로 우수함이 확인된다.
방법론
개요: y1, y2 두 프롬프트와 θ1, θ2의 목표 각도에서, 두 개의 독립된 지오메트리 브랜치를 통해 Stage 1에서 기하를 생성하고_SDF blending으로 융합한다. Stage 2에서 depth-conditioned Stable Diffusion의 예측 이미지를 각 뷰에서 역투영(un-project)하고 Mesh Texture Aggregation으로 두 시점의 텍스처를 결합한다. 이로써 하나의 3D 메쉬가 두 시점에서 서로 다른 의미를 보여준다.
관련 Figure

Stage 1과 Stage 2의 흐름, dual-branch denoising과 SDF blending, view-conditioned texture synthesis가 하나의 메쉬에서 두 시점을 통해 서로 다른 의미를 표현하도록 연결된다.
Figure 1-3에 해당하는 파이프라인/두 시점에서의 Orthogonal View에서의 듀얼 시맨틱 합성 구조를 보여주는 도식

Stage 1의 Dual-Branch Geometry Generation과 Stage 2의 View-Conditioned Texture Synthesis를 한눈에 확인할 수 있는 구성도이며, CLIP-guided Orientation Search의 동작을 보강한다.
제안 아키텍처의 흐름도(Stage 1/Stage 2) 및 CLIP-guided Orientation Search의 구성
주요 결과
벤치마크 및 정량 평가에서 제시된 수치들로, 제로샷 방식의 효율성과 품질을 입증한다. GPT Accuracy 84%, FID 185.555, KID 0.051, Avg. Object Count 0.86, Multi-Obj. Rate 18% 등으로, Shape From Semantics, Direct Concatenation, TRELLIS, DreamBeast 대비 우수하거나 동등한 성능을 보이며, 런타임은 3–5분으로 SDS 기반 대비 현저한 차이를 보인다.
관련 Figure

SDS 기반 방법과 Direct Concatenation의 단점을 도식으로 제시하고, 본 방법의 지오메트리 일관성 및 다중 시점 표현의 이점을 시사한다.
두 객체를 결합한 결과물의 비교 도식 및 각 방법의 차이를 시각화
기술 상세
- 전체 아키텍처는 Stage 1의 Dual-Branch Geometry Generation과 Stage 2의 View-Conditioned Texture Synthesis로 구성된다. 2) Stage 1은 두 개의 독립 denoising 경로를 y1, y2로 조건화하고, z_t에서 v1, v2로 디코딩한 뒤 SDF blending을 통해 합성된 x^{1}{1|t}를 얻고, 이를 z^{1}{1|t}로 재인코딩한다. 3) SDF blending은 두 voxel의 SDF를 각 성분별로 평균하고 τ로 이진화하여 합성 표면을 얻는 방식이다. 4) CFG(Classifier-Free Guidance)와 Interval CFG를 사용해 중간 노이즈 단계에서 품질을 높이고 과포화 문제를 완화한다. 5) Stage 2는 depth-conditioned ControlNet 기반 Stable Diffusion으로 각 뷰에서 텍스처를 예측하고, Mesh Texture Aggregation으로 코사인 가중치 기반으로 결합해 최종 텍스처를 생성한다. 6) CLIP-guided Orientation Search는 4개 뷰의 텍스처를 기준으로 I1을 선택하고, Object 2의 회전 θ2*를 28개의 후보 각도에서 I1과의 이미지-이미지 CLIP 유사도로 최적화한다. 7) Noise Guidance는 두 가지 전략을 도입한다. (a) Noise Blending Guidance: v^1, v^2를 결합해 guidance latent를 얻고 이를 노이즈와 가중합한다. (b) Space Control Guidance: t0를 증가시켜 초기 denoising 시점에서 구조적 제약을 강화한다. 8) 확장: 3-object Illusion의 경우 denoising branch를 3개로 확장하고 각기의 고정 각도(0, 120, 240도)에서 fusion한다. 9) 구현 세부: RTX 4090에서 실행하며, SDF의 Truncated distance clip_s=12, τ=0.8, Stage 1은 25 denoising steps, Stage 2는 30 steps, ω=7.5의 Interval CFG, CLIP은 OpenCLIP ViT-B/32, t0=10 등이다.
한계점
특정 객체군에서 TRELLIS의 실패 사례(예: pigs, bats) 존재. 3-object Illusion에서 CLIP-guided Orientation Search가 불안정해지며 세 객체의 각도 자동 정렬이 어려워 현재는 0/120/240도로 고정한다.
실무 활용
텍스처와 기하를 분리해 다중 시나리오에 대한 3D 환상을 빠르게 생성해야 하는 응용에 적합하다.
- VR/AR 콘텐츠에서 서로 다른 시점의 의미를 가진 단일 3D 객체를 빠르게 생성
- 게임에서 2D diffusion priors를 이용한 다중 시점 텍스처 관리
- 3D 디자인 프로토타이핑에서 비훈련형(training-free) 멀티-의미 메쉬 생성
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- SDF(Signed Distance Field)(SDF (Signed Distance Field))
- — 3D 표면의 경계가 되는 등고선처럼 표면으로부터의 거리 정보를 사용해 매끄러운 형상을 얻는 기법. 두 객체의 형상을 부드럽게 융합할 때 각 점의 표면까지의 최단거리 값을 이용해 교차 영역의 매끄러운 경계를 형성하는 데 활용된다.
- TRELLIS
- — 3D 기하학과 외관 정보를 희소 구조 잠재공간으로 표현하는 Rectified Flow 기반의 3D 생성기. Stage 1에서 지오메트리 합성의 기반으로 사용된다.
- CLIP
- — 텍스트-이미지 쌍의 유사도를 학습해 텍스트 프롬프트와 이미지 간 매칭을 측정하는 모델. Orientation Search 및 품질 평가에 활용된다.
- Mesh Texture Aggregation
- — 다중 시점에서 예측된 텍스처를 코사인 가중치로 혼합해 최종 메시 표면에 매끄럽게 결합하는 texture 합성 기법.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.