관련 기사 바로가기
CineMobile: 모바일 기기에서 영화적 카메라 모션을 생성하는 이미지-투-비디오 확산 모델MeshFlow: triangle soups 형태로 삼각형 메시를 생성하는 Equivariant Optimal-Transport Flow MatchingHiLo-Token: 입력 적응형 고저주파 토큰 압축으로 효율적인 이미지 편집JLT: Latent Diffusion Transformer에서의 Clean-Latent 예측Aurora: 도구를 사용하는 에이전트와 함께하는 통합 비디오 편집QuantVLA: 시각-언어-행동(VLA) 모델을 위한 척도 보정 사후 학습 양자화생성된 현실: 손과 카메라 제어를 이용한 대화형 비디오 생성 기반 인간 중심 월드 시뮬레이션DreamID-Omni: 제어 가능한 인간 중심 오디오-비디오 생성을 위한 통합 프레임워크디퓨전 트랜스포머의 풍부한 다양성을 위한 컨텍스트 공간 내 즉시 반발 기법WiT: 궤적 충돌 내비게이션을 통한 경로점 확산 트랜스포머SparkVSR: 희소 키프레임 전파를 통한 대화형 비디오 초해상도 기술리만 운동 생성: 리만 플로우 매칭을 통한 인간 운동 표현 및 생성의 통합 프레임워크GR00T N1: 범용 휴머노이드 로봇을 위한 오픈 파운데이션 모델결함 발견 및 수정: 에이전트 기반 데이터 합성을 통한 VLM 및 확산 모델의 시각적 아티팩트 이해력 강화
← 피드로 돌아가기
Diffusion Transformer
약 14개 아티클
관심 태그 추가
관련 태그:DiTByteDanceCogVideoXControlNetDINOv3AuroraDreamID-OmniEAGLE-2Equivariant Optimal-Transport Flow MatchingArtiAgent
TIMEHEADLINE