본문으로 건너뛰기

관련 기사 바로가기

게임 엔진 기반의 강화학습을 통한 월드 모델 학습 프레임워크 RLHEV.CLIP과 SigLIP의 학습 목표 차이언어 모델의 학습 방식이 컴퓨터 비전 분야를 어떻게 변화시켰는가.대규모 전자상거래 상품의 시각 속성 인식을 위한 합성 라벨 자동생성 방법CogSENet: 블러-조건적 의미 라우팅과 명시적 주파수 융합을 통한 블라인드 이미지 디블러링파운데이션 모델의 정의와 주요 예시 분석Discrete Distribution Networks: 단순 원리로 설계된 새로운 이산 분포 생성 모델오픈 보캐뷸러리 세그멘테이션비디오 유사도 측정을 위한 실전 가이드와 6기법 벤치마크재구성 VAE를 시맨틱 정렬 토크나이저로 바꾸자 1.3B 모델의 장기 예측 성능이 크게 개선된 사례비디오 프레임 중복 판별을 위한 imageprism: 해시와 임베딩 점수 통합 라이브러리처음 만든 flow matching 이미지 생성 모델 공개Auto Dataset Builder: 자연어 명령으로 무인 YOLO 주석 데이터셋 생성ariel_scans를 FiftyOne으로 파싱해 CLIP 임베딩을 추가하고 plane_finder 플러그인으로 공개함DINO 임베딩과 CLIP 재순위를 이용해 항공사진에서 RC기체를 찾아냈다.LongAV-Compass: Minute-scale Audio-Visual Generation을 위한 통합 평가 벤치마크추론 시 이미지 가이던스를 텍스트-조건 확산 모델에 주입하는 Visual Concept Fusion(VCF)범용 분할 학습기로서의 확산 모델QPrompt: 시각 언어 모델의 효율적 일반화를 위한 양자화된 프롬프트스탠포드 CME 296 강의 4: 확산 모델 및 거대 비전 모델 - 잠재 확산 모델과 멀티모달 가이던스
← 피드로 돌아가기

CLIP

Embeddings (임베딩 모델)

58개 아티클

관심 태그 추가
TIMEHEADLINE