본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
오픈 보캐뷸러리 세그멘테이션
비디오 유사도 측정을 위한 실전 가이드와 6기법 벤치마크
CogSENet: 블러-조건적 의미 라우팅과 명시적 주파수 융합을 통한 블라인드 이미지 디블러링
CC3M 데이터셋을 활용한 CLIP 모델 바닥부터 학습하기
HALO-Loss: 신경망의 과잉 확신과 환각 문제를 해결하는 새로운 손실 함수 오픈소스 공개
Claude와 Vibe Coding으로 구축한 시각적 탐색 플랫폼 endlss.co 개발기
재구성 VAE를 시맨틱 정렬 토크나이저로 바꾸자 1.3B 모델의 장기 예측 성능이 크게 개선된 사례
비디오 프레임 중복 판별을 위한 imageprism: 해시와 임베딩 점수 통합 라이브러리
처음 만든 flow matching 이미지 생성 모델 공개
Auto Dataset Builder: 자연어 명령으로 무인 YOLO 주석 데이터셋 생성
ariel_scans를 FiftyOne으로 파싱해 CLIP 임베딩을 추가하고 plane_finder 플러그인으로 공개함
DINO 임베딩과 CLIP 재순위를 이용해 항공사진에서 RC기체를 찾아냈다.
LongAV-Compass: Minute-scale Audio-Visual Generation을 위한 통합 평가 벤치마크
추론 시 이미지 가이던스를 텍스트-조건 확산 모델에 주입하는 Visual Concept Fusion(VCF)
범용 분할 학습기로서의 확산 모델
QPrompt: 시각 언어 모델의 효율적 일반화를 위한 양자화된 프롬프트
스탠포드 CME 296 강의 4: 확산 모델 및 거대 비전 모델 - 잠재 확산 모델과 멀티모달 가이던스
DiagramBank: 검색 증강 생성을 위한 논문 메타데이터 포함 대규모 다이어그램 디자인 예시 데이터셋
LoRA 가중치 기저를 이용한 시각적 유추 공간 확장 (LoRWeB)
AI 비전 기술의 진화: CNN에서 멀티모달 VLM까지
← 피드로 돌아가기
CLIP
Vision Models (비전 모델)
약 56개 아티클
관련 태그:
DINO
DINOv2
ViT
CIFAR-10
PEFT
ArcFace
PPO
Google
LoRA
Contrastive Learning