본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
CineMobile: 모바일 기기에서 영화적 카메라 모션을 생성하는 이미지-투-비디오 확산 모델
MeshFlow: triangle soups 형태로 삼각형 메시를 생성하는 Equivariant Optimal-Transport Flow Matching
HiLo-Token: 입력 적응형 고저주파 토큰 압축으로 효율적인 이미지 편집
JLT: Latent Diffusion Transformer에서의 Clean-Latent 예측
Aurora: 도구를 사용하는 에이전트와 함께하는 통합 비디오 편집
QuantVLA: 시각-언어-행동(VLA) 모델을 위한 척도 보정 사후 학습 양자화
생성된 현실: 손과 카메라 제어를 이용한 대화형 비디오 생성 기반 인간 중심 월드 시뮬레이션
DreamID-Omni: 제어 가능한 인간 중심 오디오-비디오 생성을 위한 통합 프레임워크
디퓨전 트랜스포머의 풍부한 다양성을 위한 컨텍스트 공간 내 즉시 반발 기법
WiT: 궤적 충돌 내비게이션을 통한 경로점 확산 트랜스포머
SparkVSR: 희소 키프레임 전파를 통한 대화형 비디오 초해상도 기술
리만 운동 생성: 리만 플로우 매칭을 통한 인간 운동 표현 및 생성의 통합 프레임워크
GR00T N1: 범용 휴머노이드 로봇을 위한 오픈 파운데이션 모델
결함 발견 및 수정: 에이전트 기반 데이터 합성을 통한 VLM 및 확산 모델의 시각적 아티팩트 이해력 강화
← 피드로 돌아가기
Diffusion Transformer
Architecture (AI 아키텍처)
약 14개 아티클
관련 태그:
DiT
ByteDance
CogVideoX
ControlNet
DINOv3
Aurora
DreamID-Omni
EAGLE-2
Equivariant Optimal-Transport Flow Matching
ArtiAgent