섹션별 상세
기존의 이산적 라벨 분류 방식은 병리학자가 사용하는 풍부한 형태학적 묘사와 의미적 관계를 포착하는 데 한계가 있었다. 병리학자들은 조직의 미세한 패턴을 설명하기 위해 구조화된 언어적 묘사를 사용하지만, 단순 분류 모델은 이러한 정보를 소실한다. 이를 해결하기 위해 이미지와 텍스트를 결합하여 병리학자의 사고방식과 유사한 모델을 구축하고자 했다.

PLUTO 시각 파운데이션 모델로 타일 임베딩을 추출한 뒤 학습된 어텐션 풀링 네트워크를 통해 전체 슬라이드 임베딩을 생성한다. 모든 영역을 동일하게 처리하는 대신 모델이 슬라이드의 가장 관련성 높은 지역에 집중하도록 설계했다. 이 과정은 복잡한 시각 정보를 다운스트림 모델 학습에 효율적인 압축된 수치 형식으로 변환한다.
진단 보고서와 LLM이 생성한 형태학적 묘사를 언어 모델로 임베딩하고 프로젝션 레이어를 통해 시각 임베딩과 동일한 공간으로 투영한다. LLM은 전문가 병리학자의 역할을 수행하며 각 진단의 정의적 시각 특징을 포착하도록 지시받았다. 이를 통해 단순한 라벨을 넘어선 풍부한 의미적 맥락이 모델에 주입된다.
대조 학습(Contrastive Learning) 목적 함수를 사용하여 일치하는 슬라이드-설명 쌍은 가깝게, 일치하지 않는 쌍은 멀게 배치하여 정렬한다. 기존의 고정된 라벨 매핑 방식과 달리 입력과 라벨 설명 사이의 관계가 명시적으로 인코딩된 공유 공간을 학습한다. 이 구조는 슬라이드와 설명 간의 직접 비교를 통해 예측을 수행할 수 있게 한다.
UMAP 시각화 분석 결과, 공유 공간 내에서 텍스트와 슬라이드 임베딩이 임상적으로 의미 있는 카테고리별로 군집화됨을 확인했다. 광선 각화증이나 염증성 피부질환과 같은 하위 클래스들이 상위 진단 범주에 따라 자연스럽게 그룹을 형성했다. 이는 정렬된 언어 임베딩이 병리학적 진단 간의 의미적 관계를 성공적으로 포착했음을 입증한다.

피부병리학 데이터셋에서 기존 이미지 전용 aMIL 모델 대비 정확도가 상대적으로 약 4.6% 향상되는 성과를 거두었다. 가중 F1 점수 또한 5.9% 개선되어 미세한 형태학적 차이가 중요한 피부 질환 진단에서 멀티모달 접근의 효용성을 증명했다. 언어 데이터가 시각적 패턴만으로는 구별하기 어려운 모호한 사례에서 보완적인 신호를 제공했다.
위장병리학 분야에서는 정확도가 8.4%, 가중 F1 점수가 10.1% 향상되어 더 큰 성능 개선 폭을 기록했다. 위장병리는 진단 가능한 하위 유형이 많고 시각적으로 유사한 경우가 많아 예측이 까다로운 영역이다. 멀티모달 모델은 이러한 복잡한 도메인에서 형태학적 관계를 더 정확하게 파악하여 오분류를 줄였다.

추론 시 텍스트 임베딩은 미리 계산되어 캐싱되므로 이미지 임베딩 계산과 유사도 검색만으로 기존 모델과 유사한 속도로 동작한다. 두 가지 모달리티를 사용함에도 불구하고 실시간 진단 워크플로우에 적용 가능한 수준의 효율성을 유지한다. 결과적으로 정확도 향상과 실무적 효율성을 동시에 달성했다.
기술
- PLUTO
- aMIL
- LLM
- UMAP
활용 사례
- 전체 슬라이드 이미지(WSI) 자동 진단
- 텍스트 기반 병리 케이스 검색
- 오픈 보캐블러리 질병 분류
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 02.수집 2026. 04. 02.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.