본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
재구성 VAE를 시맨틱 정렬 토크나이저로 바꾸자 1.3B 모델의 장기 예측 성능이 크게 개선된 사례
PixCon: 기초모델(DINOv2) 기반 반지도 세멘틱 분할에서 오염 없는 양성 샘플로 임베딩을 구조화하는 방법
DecQ: Representation Autoencoders에서 Detail-condensing Queries를 활용한 재구성 및 생성 향상
AnomalyDINO: DINOv2를 활용한 패치 기반 퓨샷 이상 탐지 성능 향상
비주얼 이상 탐지를 위한 파운데이션 모델의 최신 연구 트렌드 분석
고전적 포렌식 특징과 DINOv2 임베딩을 결합한 이미지 진위 탐지기
이미지 합성을 위한 안내된 종단간 자기회귀 학습(GEAR)
LongAV-Compass: Minute-scale Audio-Visual Generation을 위한 통합 평가 벤치마크
잠재적 세계 속성 파악을 위한 창발적 조합 통신
Stable Diffusion 컬러링 페이지 생성을 위한 CLIP 및 DINOv2 기반 자동 품질 분류기 구축
큐빅 이산 확산: 고차원 표현 토큰 기반의 이산적 시각 생성
ViT-AdaLA: 선형 어텐션을 활용한 비전 트랜스포머 적응 프레임워크
OneWorld: 3D 통합 표현 오토인코더를 활용한 3D 장면 생성 제어
V-Co: 공동 노이즈 제거를 통한 시각적 표현 정렬의 심층 분석
The Batch: GPT-5.4 출시와 AI 에이전트 생태계의 진화
스펙트럼 매칭: 잠재 확산 모델에서 우수한 확산 가능성을 위한 통합적 관점
당신의 ViT는 사실 이미지 세그멘테이션 모델입니다: 복잡한 디코더 없는 단순화된 아키텍처
현대 비디오 게임에서의 의사결정: 인간의 플레이부터 월드 모델까지
월드 가이던스: 액션 생성을 위한 컨디션 공간에서의 월드 모델링
DreamWorld: 비디오 생성을 위한 통합 세계 모델링
← 피드로 돌아가기
DINOv2
Vision Models (비전 모델)
약 26개 아티클
관련 태그:
CLIP
ViT
LingBot-Vision
ARKit
ClearGrasp
CaTok
DAgger
CubiD
DecQ
Best Practice