TL;DR
의료 영역에서는 다중 모달 신호를 통합하는 모델이 임상적 가치를 제공할 가능성이 크지만, 대규모 고품질 공개 멀티모달 데이터가 부족해 모델 일반화와 재현성에 제약이 있었다. MedPMC는 공개된 학술 문헌을 자동으로 가공해 임상 관련 이미지와 패널 단위 캡션을 정합한 고충실 데이터 인프라를 공급함으로써 이 병목을 직접적으로 완화했다. 이 접근은 문헌의 계속적 확장을 반영해 주기적 업데이트가 가능하고, 동일한 아키텍처에서 훈련한 모델의 품질을 데이터 품질 수준에서 개선했음이 실험으로 확인됐다.
왜 중요한가
의료 영역에서는 다중 모달 신호를 통합하는 모델이 임상적 가치를 제공할 가능성이 크지만, 대규모 고품질 공개 멀티모달 데이터가 부족해 모델 일반화와 재현성에 제약이 있었다. MedPMC는 공개된 학술 문헌을 자동으로 가공해 임상 관련 이미지와 패널 단위 캡션을 정합한 고충실 데이터 인프라를 공급함으로써 이 병목을 직접적으로 완화했다. 이 접근은 문헌의 계속적 확장을 반영해 주기적 업데이트가 가능하고, 동일한 아키텍처에서 훈련한 모델의 품질을 데이터 품질 수준에서 개선했음이 실험으로 확인됐다.
핵심 기여
문헌 기반 자동 파이프라인으로 11M 의료 이미지-텍스트 쌍 구축
MedPMC는 6.1M PMC 논문을 대상으로 다섯 단계(초기 스크리닝, 다중 패널 탐지, 패널 분해, 캡션 분리·정렬, 의료 이미지 분류)를 자동화해 최종 11M의 고충실 이미지-텍스트 쌍을 생성했다. 각 단계는 전용 학습 데이터와 벤치마크로 검증되어 단계별 성능(F1/mAP/ROUGE-L)이 공개되었다. 파이프라인은 모듈화되어 향후 구성 요소 교체와 반기별 업데이트가 가능하다.
패널 정합을 위한 MLLM 기반 캡션 분리·정렬 방식
캡션 분리와 서브패널 정렬을 순차적 처리 대신 MLLM(InternVL-2.5-4B)으로 병렬 처리해 서브캡션을 생성하고 순서에 따라 패널에 대응시켰다. 이 방식은 PMC-OA의 규칙/CLIP 기반 방법보다 높은 F1=81.4 및 ROUGE-L=85.3을 확보했다. 패널 수 불일치 샘플을 제거하는 필터링으로 페어의 정확성을 우선시해 학습 신호 품질을 확보했다.
데이터 품질 개선이 시각표현학습 성능으로 전이됨을 실증
동일한 모델 아키텍처(OpenCLIP ViT-L/14)와 훈련 스케줄을 유지한 채 BMC-CLIP 데이터 대신 MedPMC로만 교체해 학습한 MedPMC-CLIP이 26개 벤치마크에서 평균 AUC를 7.1포인트 개선했다. 또한 LLaVA-Med 파이프라인에서 시각 인코더만 교체할 때 OmniMedVQA에서 16.9포인트, MMMU에서 1.9포인트 향상이 관찰됐다. 임상적 전이성은 YNHHS 피부과 환자 이미지 10,524건의 Recall@5가 11.7포인트 상승한 결과로 보강됐다.
코드·모델·벤치마크의 공개로 재현성과 확장성 확보
파이프라인 구현 코드, 구성별 학습데이터, 구성요소 벤치마크, 그리고 사전학습 모델 체크포인트를 공개해 파이프라인의 재현과 주기적 업데이트가 가능하다. 공개 리포지토리는 https://github.com/Yale-BIDS-Chen-Lab/MedPMC 이고, 데이터 라이선스 필터 및 버전별 처리 내역을 함께 제공해 추적 가능성을 확보했다. 이 설계는 문헌 기반 자원을 지속적 인프라로 활용할 수 있는 기반을 제공한다.
핵심 아이디어 이해하기
의료 멀티모달 모델 학습에는 높은 품질의 이미지-텍스트 정합이 필수이며, 논문 그림을 그대로 사용하면 비의료 그래프·다이어그램과 복합 패널 때문에 신호 대 잡음비가 크게 낮아진다. 기존 큰 규모의 PMC 유래 코퍼스는 양적 규모는 크지만 의료 관련성이나 패널 단위 정렬이 부족해 학습 효율이 떨어졌다. 따라서 문헌을 대규모로 활용하려면 문헌 특유의 실패 모드를 정확히 제거하고 패널 단위로 정합을 확보하는 데이터 전처리 설계가 필요하다. MedPMC의 핵심 해법은 텍스트 기반 선별과 패널 분해, 그리고 MLLM을 이용한 캡션 분리·정렬을 결합한 모듈화된 파이프라인이다. 첫 단계에서 캡션과 인라인 문맥을 결합한 텍스트 분류(PubMedBERT)를 통해 다운로드 전 후보를 좁혀 비의료 이미지 전송·저장 비용을 줄였다. 이후 Vision Transformer와 YOLOv10 계열 모델로 다중 패널을 감지·분리하고, InternVL 계열의 MLLM으로 전체 그림과 분리된 서브패널을 함께 입력해 서브캡션을 생성·정렬함으로써 패널-캡션 정합도를 크게 향상시켰다. 이 데이터 품질 개선은 대비 학습 기반의 시각-언어 표현 학습에 직접적으로 전이되었다. MedPMC로 학습한 CLIP 스타일 비전-언어 모델은 동일 아키텍처와 훈련법을 유지한 비교 실험에서 더 적은 데이터로도 평균 AUC를 유의미하게 향상시켰다. 또한 해당 비전 인코더를 MLLM 파이프라인에 교체했을 때 시각 중심 질의응답과 임상 이미지 검색 성능이 실질적으로 개선되어, 데이터 정제의 마진 이득이 모델 성능 개선으로 연결됨이 실험적으로 확인됐다.
방법론
파이프라인은 다섯 단계로 구성되어 각 단계에 전용 학습 데이터와 검증 벤치마크가 매핑되어 있다. 첫 단계는 캡션과 인라인 참조 텍스트를 연결해 PubMedBERT 기반 분류기로 의료 관련 그림 후보를 선별했고, 두 번째 단계는 Vision Transformer로 다중 패널 여부를 분류해 패널 분해 대상만 다운로드하도록 했다. 세 번째 단계에서는 YOLOv10 기반 객체 탐지기로 서브패널 바운딩박스를 예측해 그림을 평균 9.2개의 서브패널로 분해했다. 네 번째 단계는 캡션 분리와 서브패널-서브캡션 정렬을 하나의 MLLM 태스크로 처리했다. 원본 복합 그림, 분해된 서브패널, 전체 캡션을 입력으로 받아 서브캡션 목록을 생성하고, 생성된 서브캡션 수가 서브패널 수와 일치하지 않으면 샘플을 제거해 정합성을 확보했다. 이 단계의 학습 데이터는 MedICaT의 수동 라벨과 PMC 유래 합성 예시를 조합해 확장했다. 마지막으로 분해된 서브패널을 Vision Transformer 분류기로 의료 관련 여부를 판정해 최종 코퍼스를 구축했다. 각 구성요소의 성능 평가는 별도 벤치마크(초기 스크리닝 F1=93.2, 다중 패널 탐지 F1=96.5, 패널 분해 mAP=89.8, 캡션 정렬 F1=81.4 등)를 사용해 모델 선택과 하이퍼파라미터 튜닝에 반영했다.
관련 Figure

이미지 왼쪽은 초기 스크리닝부터 의료 그림 분류까지 이어지는 단계별 처리 흐름을 화살표로 배치해 파이프라인 구조를 제시하고 있다. 중앙은 대비 학습으로 비전-언어 인코더를 학습한 뒤 이를 Multimodal LLM의 시각 인코더로 초기화하는 절차를 연결해 데이터에서 모델로의 전이 경로를 명확히 하고 있다. 마지막으로 하단은 세 가지 평가 축(이미지 분류, 의료 QA, 피부 이미지 검색)을 통해 파이프라인 산출물의 적용 범위를 요약하고 있다.
MedPMC의 다섯 단계 파이프라인과 CLIP 기반 모델 학습 및 MLLM 통합 워크플로를 도식화한 개요 그림이다.
주요 결과
MedPMC 최종 코퍼스는 3.1M 다중 패널 그림-캡션 쌍, 0.6M 단일 패널 쌍, 그리고 7.3M 서브패널-서브캡션 쌍을 포함해 총 약 11M의 의료 이미지-텍스트 페어로 구성됐다. 수동 검토(5명, 그중 3명은 의료 교육자)가 실시된 샘플에서 MedPMC의 의료 관련성은 95.3%로 확인되었고, 기존 BIOMEDICA 샘플의 의료 관련성은 19.7%로 나타나 데이터 품질 차이를 정량화했다. 분포 관찰 결과 MedPMC는 방사선, 병리, 안과, 내시경, 피부과 등 임상적으로 중요한 영상 기법을 폭넓게 포함했다. 동일한 OpenCLIP ViT-L/14 초기화와 훈련 스케줄을 유지한 채 MedPMC로만 재학습한 MedPMC-CLIP은 26개 벤치마크(11개 전문 분야 평균)에서 BMC-CLIP 대비 평균 AUC를 7.1 포인트 향상시켰다(95% CI 6.3–8.0). LLaVA-Med 파이프라인에서 시각 인코더만 MedPMC-CLIP으로 교체했을 때 OmniMedVQA에서 16.9 포인트, MMMU에서 1.9 포인트의 개선이 관찰돼 시각 인코더 품질이 멀티모달 추론 성능에 미치는 영향을 확인했다. 임상 전이 검증으로는 YNHHS의 10,524 피부과 환자 이미지에서의 morphology→image 검색에서 Recall@5가 BMC-CLIP 대비 11.7 포인트 상승해 실제 환자 데이터로의 전이성이 확인됐다.
관련 Figure

왼쪽 막대는 MedPMC와 BIOMEDICA 간 비의료 이미지 비율 차이를 비교해 MedPMC가 비의료 콘텐츠를 크게 줄였음을 수치로 보여준다. 중앙 패널은 방사선 내 세부 모달리티 분포(MRI, CT, X-ray 등)를 제시하고, 우측 그래프는 연도별 논문 수와 추출된 figure-caption pair 수의 상승 추세를 나타내어 파이프라인의 확장 가능성을 정량적으로 입증한다. 이 그림은 코퍼스의 구성과 연속적 업데이트 역량을 함께 확인할 수 있게 한다.
데이터셋 구성과 모달리티 분포, 연도별 논문·추출 페어 수 성장 곡선을 보여주는 통계형 그림이다.

상단 패널은 Accuracy, F1, AUC에서 MedPMC-CLIP이 여러 기존 모델을 상회함을 막대그래프로 제시하고 있다. 중단의 전문 분야별 비교는 MedPMC-CLIP이 11개 전문 분야 중 대부분에서 BMC-CLIP을 능가했음을 보여주며, 하단 패널의 QA 및 검색 결과는 MLLM 통합과 임상 전이성에서의 실질적 이득을 수치(예: Recall@5 개선)로 제공한다. 이 그림은 데이터 정제 효과가 다양한 평가 축에서 일관되게 전이되었음을 시각적으로 검증한다.
이미지 분류, 전문 분야별 AUC 비교, 멀티모달 QA 및 피부 이미지 검색에서 MedPMC-CLIP의 성능 향상을 요약한 성능 그래프 모음이다.

왼쪽 상단 누적분포는 내부 임상 이미지와의 최근접 코사인 거리의 중앙값이 MedPMC에서 가장 작아 시각 분포가 가장 가깝다는 정량적 근거를 제공한다. 우측의 UMAP 산점도는 내부 임상 이미지의 밀도 윤곽선 위에 외부 데이터셋 포인트를 오버레이해 MedPMC가 임상 분포 전반에 광범위하게 겹침을 보이는 반면 다른 데이터셋은 일부 영역에 편중됨을 드러낸다. 이 시각 자료는 문헌 유래 피부 사진이 실제 임상 사진 분포에 더 잘 근접함을 보여주어 임상 전이성의 기초를 제공한다.
DINOv2 임베딩 공간에서 내부 임상 피부 사진과 외부 공개 데이터셋(MedPMC, SCIN, DermNet, Fitzpatrick17k)의 최근접 거리 분포와 UMAP 투영을 비교한 시각화이다.
기술 상세
전체 아키텍처는 단계별로 서로 다른 모델을 적용하는 모듈형 파이프라인이다. 텍스트 선별은 PubMedBERT 기반 이진 분류로 캡션과 인라인 텍스트를 결합해 의료 관련 후보를 판별했고, 이미지 단계에서는 Vision Transformer를 다중 패널 탐지와 의료 분류용 백본으로 사용했다. 패널 분해는 YOLOv10 계열 객체 탐지기에서 바운딩박스를 예측해 평균 9.2개의 서브패널을 추출했다. 캡션 분리·정렬은 InternVL-2.5-4B 기반의 MLLM을 사용해 원본 다중 패널 그림, 분해된 서브패널, 전체 캡션을 입력으로 서브캡션 목록을 직접 생성했다. 생성된 서브캡션의 수와 서브패널 수가 일치하지 않는 경우를 제거해 페어 정확도를 우선시했고, 학습 데이터는 MedICaT의 라벨과 GPT 기반 합성 예시를 병합해 확장했다. 대비 학습 단계에서는 OpenCLIP ViT-L/14 초기화를 유지하고 배치 사이즈 8192, learning rate 1e-6 등의 기존 BMC-CLIP 훈련 설정을 그대로 적용해 데이터셋 차이가 성능 변화의 주원인임을 고립시켰다. 임베딩 유사도 비교는 DINOv2 임베딩으로 최근접 이웃 코사인 거리를 계산하고 UMAP으로 시각화해 문헌 유래 피부 사진과 병원 기반 사진의 분포 일치를 정량화했다. 통계적 유의성 평가는 paired bootstrap(10,000 반복)로 신뢰구간을 산출했고, 각 실험에서 동일한 재샘플링을 두 모델에 동일하게 적용해 비교의 공정성을 확보했다.
한계점
MedPMC는 주로 이미지-텍스트 페어에 초점을 맞추어 표 형식 데이터, 구조화된 임상 수치, 장기간 환자 레코드와 같은 복합적 임상 모달리티는 포함하지 않았다. 원문 캡션 품질의 분산, 출판 바이어스(대표 사례·시각적으로 뚜렷한 사례 선호) 등 문헌 특유의 한계가 결과에 반영될 수 있다. 공개 벤치마크와의 완전한 중복 배제를 보장할 수 없으므로 성능 해석 시 아키텍처 통제 실험과 내부 임상 전이 검증을 함께 고려해야 한다.
실무 활용
MedPMC 코퍼스와 파이프라인은 의료용 시각-언어 인코더를 사전학습하거나 멀티모달 LLM의 시각 백본으로 초기화하는 데 직접 활용 가능하다. 또한 기사-캡션-서브캡션의 구조화된 메타데이터를 통해 전문 분야별, 모달리티별로 데이터 서브셋을 추출해 특화 모델을 개발할 수 있다. 공개된 코드와 체크포인트는 동일 파이프라인을 재현하거나 반기별 업데이트를 자동화하는 실무 워크플로에 통합될 수 있다.
- 대규모 의료 비전-언어 인코더의 프리트레이닝 데이터로 사용해 제로샷 분류 및 검색 성능을 향상시킬 수 있다.
- LLaVA-Med와 같은 멀티모달 LLM에서 시각 인코더를 교체해 시각 중심 질의응답 성능을 개선하는 초기화 전략으로 적용할 수 있다.
- 드문 질환, 병리 서브도메인, 혹은 특정 영상기법이 부족한 분야에서 문헌 유래 데이터를 필터링해 보강 데이터셋으로 활용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Contrastive Learning
- — 대상 이미지와 텍스트 쌍을 긍정 샘플로, 임의의 다른 쌍을 부정 샘플로 취급해 임베딩 공간에서 관련 쌍의 거리를 줄이고 비관련 쌍의 거리를 늘리는 학습 방식이다. 이 방식은 이미지와 텍스트를 공통 표현으로 정렬해 제로샷 분류와 검색에 유리한 임베딩을 생성한다. MedPMC에서는 CLIP 스타일 대비 학습을 통해 문헌에서 추출한 이미지-텍스트 쌍을 시멘틱하게 결합하는 데 핵심 역할을 했다.
- Multi-panel Figure Separation
- — 학술 논문에 실린 복합 그림을 각 패널 단위로 분할해 단일 이미지 단위를 생성하는 처리 단계이다. 이는 객체 탐지 기반의 바운딩박스 예측을 통해 각 서브패널을 잘라내고 이후 캡션과의 정확한 정렬을 가능하게 한다. MedPMC 파이프라인에서는 YOLOv10 계열 모델로 3.1M 다중 패널을 평균 9.2개 서브패널로 분해했다.
- Caption Separation and Alignment
- — 전체 figure 캡션을 서브캡션으로 분리하고 각 서브캡션을 대응 서브패널에 할당하는 과정이다. 해당 단계는 단일 캡션을 단일 이미지에 대응시키는 이미지-텍스트 정합성을 보장해 대비 학습의 신호 품질을 높인다. MedPMC는 MLLM 기반 접근으로 서브캡션 생성 및 순서 기반 정렬을 수행해 F1=81.4, ROUGE-L=85.3을 확보했다.
- Vision Transformer
- — 이미지를 패치로 분할해 토큰화한 뒤 Transformer 블록으로 처리해 전역 문맥을 포착하는 비전 모델 아키텍처이다. MedPMC 파이프라인에서는 패널 탐지와 의료 이미지 분류에서 backbone으로 사용되어 높은 F1 점수를 기록했다. 이미지 기반 특징을 추출해 텍스트 임베딩과 대조하는 CLIP 계열 학습에 적합하다.
- DINOv2
- — 자가지도 학습으로 강인한 이미지 임베딩을 얻는 방법론과 그에 기반한 모델 계열이다. MedPMC 논문에서는 외부 데이터셋과 내부 임상 데이터의 임베딩 유사도 비교를 위해 DINOv2 임베딩을 사용해 최근접 이웃 거리와 UMAP 시각화 결과를 산출했다. 이는 문헌 유래 이미지의 임상적 분포 일치도를 정량화하는 데 핵심 도구로 활용됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.