본문으로 건너뛰기
관련 기사 바로가기
7B-MoT 기반 SenseNova-Vision 오픈소스 레포 업데이트 공유
멀티모달 LLM의 시각 정보 처리 다시 생각하기
대규모 시각-언어 모델의 시각적 접지를 위해 필요한 것은 단 몇 개의 어텐션 헤드뿐이다
AI 비전 기술의 진화: CNN에서 멀티모달 VLM까지
토큰의 딜레마: 거대 비전 언어 모델의 지속 학습을 위한 드리프트 인식 토큰 할당 기반 동적 MoE
AgilePruner: 대형 시각-언어 모델의 적응형 시각 토큰 프루닝을 위한 어텐션 및 다양성에 관한 경험적 연구
← 피드로 돌아가기
LLaVA
Datasets (데이터셋)
약 6개 아티클
관심 태그 추가
Datasets
관련 태그:
7B-MoT
AgilePruner
CHAIR
CLIP
GPT-4V
LLaViT
LVLM
MoE
OpenSenseNova
Qwen-VL
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필