본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
대규모 시각-언어 모델의 시각적 접지를 위해 필요한 것은 단 몇 개의 어텐션 헤드뿐이다
RubiCap: 정밀한 이미지 캡셔닝을 위한 루브릭 가이드 강화학습
← 피드로 돌아가기
GPT-4V
Language Models (대형 언어 모델)
약 2개 아티클
관련 태그:
Gemini
GRPO
LLaVA
LVLM
Qwen
Qwen2.5
RubiCap