본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Qwen2-VL을 활용한 그래프 위상 기반 악성 거래 탐지 접근법
대규모 멀티모달 모델을 위한 비디오 표현 방식 분석
VID-AD: 시각적 방해 요소 환경에서의 이미지 수준 논리적 이상 탐지를 위한 데이터셋
범용 인-컨텍스트 분류기로서의 대형 멀티모달 모델
LoRA 없이 유명인 얼굴을 구현하는 z-image turbo 모델 활용 사례
로컬 멀티모달 LLM을 활용한 GUI 자동화 파이프라인 구축 및 모델 추천 문의
← 피드로 돌아가기
Qwen2-VL
Vision Models (비전 모델)
약 8개 아티클
관련 태그:
LoRA
Hugging Face
CLIP
FORGE
llama.cpp
OmniParser
OneVision-Encoder
PEFT
Phi-3.5-Vision
PyAutoGUI