본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
CtrlVTON: VIP-SAM 기반 마스크 제어형 가상 피팅 프레임워크
From RGB Generation to Dense Field Readout: 텍스트-투-이미지 백본에서 직접 픽셀-정렬 밀집 예측을 읽어내는 ReChannel
LingBot World v2 공개 가중치와 장시간 롤아웃 안정성 보고
LingBot-World-Infinity: 인과적 사전학습과 증류로 실시간 무한 인터랙티브 월드 생성
LingBot-Video: DiT 기반 로봇 지향 대규모 MoE 비디오 파운데이션 모델이다. Mixture-of-Experts 아키텍처를 채택해 용량과 추론 효율의 균형을 맞추었다. 로봇 중심 데이터 프로파일링과 다차원 보상체계를 결합해 물리적 합리성과 작업 완수 능력을 학습하게 설계되었다.
AlayaWorld: 장기간 탐험 가능하고 플레이 가능한 비디오 월드 생성에 관한 연구. 이 논문은 AlayaWorld 프레임워크의 전체 스택 설계와 핵심 모듈을 기술한다. 실시간 상호작용, 공간·시간 일관성 유지, 장시간 안정성 확보를 중심으로 구성되었다.
MemLearner: 쿼리 토큰 기반의 학습형 컨텍스트 질의로 장기 일관성을 확보한 Video World Models
LiveEdit 실시간 Diffusion 기반 스트리밍 비디오 편집
PhysisForcing: 로봇 조작을 위한 물리 정렬 기반 비디오 월드 시뮬레이터
PHYSIFORMER: 세계 좌표에서 역학을 학습해 시뮬레이션하기
IV-CoT: 구조 인식을 위한 암시적 시각 Chain-of-Thought 기반 텍스트→이미지 생성
DomainShuttle: 자유 형식 오픈 도메인 주체 기반 텍스트-투-비디오 생성
DiffusionBench: ImageNet과 Text-to-Image를 연결하는 통합 훈련 프레임워크 NanoGen을 통한 DiT(디퓨전 트랜스포머) 전방위 평가
RT-Lynx: Diffusion Transformers에서 GEMM Sparsity를 Activation으로 옮겨 실현하는 방법
Diffusion Transformers에서의 Cross-Layer 정보 라우팅 재고
Q-ARVD: Autoregressive Video Diffusion Models의 양자화
QuantVLA: 시각-언어-행동(VLA) 모델을 위한 척도 보정 사후 학습 양자화
DreamID-Omni: 제어 가능한 인간 중심 오디오-비디오 생성을 위한 통합 프레임워크
TokenDial: 시공간 토큰 오프셋을 통한 텍스트-비디오 생성의 연속적 속성 제어
GenMask: 직접적인 마스크 생성을 통한 세그멘테이션용 DiT 적응 기술
← 피드로 돌아가기
DiT
Architecture (AI 아키텍처)
약 38개 아티클
관련 태그:
LoRA
Flow Matching
Wan
ByteDance
Diffusion Transformer
diffusion
Chain of Thought
CaTok
AMD
Cosmos-Predict