본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
PointDiT: 픽셀 공간 확산 기반 단안 포인트맵 추정을 위한 간결한 ViT 프레임워크
밀집 공간 지각을 위한 경계 중심 비전 사전학습
Import AI 449: 스스로 학습하는 LLM과 블록체인 기반 72B 분산 학습의 부상
Robbyant이 LingBot-Vision 4개 비전 백본을 Apache-2로 공개하고 성능표를 제시하다
Inverse INSID3: DINOv3 특징으로 배경 예시 기반 분할을 수행하는 오픈소스 프로젝트
사이클 일관성 마스크 예측을 통한 교차 시점 객체 대응 학습
INSID3: DINOv3를 활용한 학습이 필요 없는 인컨텍스트 세그멘테이션
SpatialBoost: 언어 가이드 추론을 통한 시각적 표현력 강화
행동 전 관찰: 시각-언어-행동 모델을 위한 시각 파운데이션 표현 강화
WiT: 궤적 충돌 내비게이션을 통한 경로점 확산 트랜스포머
공간-시간적 우도를 통한 생성된 비디오의 학습 없는 탐지
8개의 토큰으로 수행하는 계획 수립: 잠재 세계 모델을 위한 압축형 이산 토크나이저
OmniStream: 연속 스트림에서의 지각, 재구성 및 행동 마스터하기
DINOv3와 YOLOv12를 결합한 하이브리드 객체 탐지 프레임워크 공개
미세한 질감의 유기물 세그멘테이션을 위한 SOTA 아키텍처 및 손실 함수 제안 요청
← 피드로 돌아가기
DINOv3
Vision Models (비전 모델)
약 17개 아티클
관련 태그:
LingBot-Vision
Covenant-72B
Ego-Exo4D
DeepVision-VLA
Diffusion Transformer
DINOv2
Cycle-Consistency
Flow Matching
HANDAL-X
Claude Code