ZJUI-AI4H/Hulu-Med
Python2 / 0
2D·3D·비디오·텍스트 의료 데이터를 하나의 파이프라인으로 처리하는 오픈소스 의료 VLM.
TL;DR
Hulu-Med는 공개 데이터 16.7M 샘플만으로 학습된 의료 비전-언어 모델로, SigLIP 기반 비전 인코더와 Multimodal Projector가 2D·3D·비디오 영상을 Qwen 기반 언어모델 공간으로 사상하고 Medical-Aware Token Reduction으로 토큰을 약 55% 줄여 처리한다. 4B부터 235B까지 여러 파라미터 규모로 제공되며 HuggingFace Transformers와 vLLM을 모두 지원해 AutoModelForCausalLM으로 바로 로드하거나 대규모 서빙에 쓸 수 있다. 30개 의료 벤치마크에서 동급 오픈소스 의료 VLM을 대부분 웃돌고 일부 지표에서는 GPT-4.1·Gemini-2.5-Flash 같은 상용 모델과도 견줄 만한 점수를 냈다고 README가 구체적 수치로 제시한다. 완전 투명한 파이프라인을 표방하지만 3D 의료 영상 처리를 위해 nibabel·flash-attn 등 특정 버전 의존성 설치가 필요하다.
핵심 포인트
- 학습 데이터·코드·가중치를 전부 공개하고 전량 공개 데이터로만 학습한 완전 투명한 파이프라인을 표방한다.
- Medical-Aware Token Reduction으로 토큰을 약 55% 줄여 2D·3D·비디오를 하나의 파이프라인에서 처리한다.
- 30개 의료 벤치마크에서 동급 오픈소스 의료 VLM을 웃돌고 일부 지표는 상용 모델과도 비슷한 점수를 냈다.
- 3D 니프티(NIfTI) 영상 처리에 nibabel, 추론 가속에 flash-attn 등 버전이 고정된 의존성 설치가 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| OM.VQA | accuracy | 84.2 | Hulu-Med-7B, 동급 7B 중 최고 |
| HealthBench | score | 64.5 | Hulu-Med-Flash-Preview-27B |
1k
STARS
35
FORKS
+204
TRENDING
2
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.