TL;DR
진단 과정에서 CC와 MLO 두 뷰의 보완적 정보를 결합하는 것은 인간 판독에서 핵심적이며, 이 논문은 그러한 임상적 요구를 대형 비전 모델의 동결된 백본 안에서 토큰 수준으로 구조화하여 처리할 수 있음을 보였다. 프롬프트 기반 적응과 fusion token을 결합하면 전체 모델 파라미터를 미세조정하지 않고도 뷰 간 정보 교환을 계층적으로 유지할 수 있다. 이 접근은 제한된 레이블 데이터와 큰 사전학습 백본을 갖는 의료영상 과제에서 파라미터 효율성과 뷰 상보성 유지라는 두 가지 요구를 동시에 충족시키는 대안이 된다.
왜 중요한가
진단 과정에서 CC와 MLO 두 뷰의 보완적 정보를 결합하는 것은 인간 판독에서 핵심적이며, 이 논문은 그러한 임상적 요구를 대형 비전 모델의 동결된 백본 안에서 토큰 수준으로 구조화하여 처리할 수 있음을 보였다. 프롬프트 기반 적응과 fusion token을 결합하면 전체 모델 파라미터를 미세조정하지 않고도 뷰 간 정보 교환을 계층적으로 유지할 수 있다. 이 접근은 제한된 레이블 데이터와 큰 사전학습 백본을 갖는 의료영상 과제에서 파라미터 효율성과 뷰 상보성 유지라는 두 가지 요구를 동시에 충족시키는 대안이 된다.
핵심 기여
토큰 중심의 이중-뷰 학습 프레임워크 제안
제안된 프레임워크는 심층 공유 프롬프트 학습과 토큰 기반 교차-뷰 융합을 두 단계로 결합해 동결된 vision Transformer를 다중 뷰 분류에 재사용했다. 이 구조는 CC 및 MLO 뷰를 동일한 백본으로 인코딩하면서도 뷰 간 종속성을 별도의 fusion token으로 명시적으로 보존하게 설계되었다. 실험에서는 이 설계가 linear probing과 프롬프트 전용 방법, 전통적 합성 기반 융합 대비 일관된 성능 향상을 보여주었다.
심층 공유-뷰 프롬프트(Deep Shared-View Prompt) 설계
각 선택된 트랜스포머 레이어에 하나의 학습 가능한 프롬프트 토큰을 삽입하여 백본을 동결한 상태에서 계층적 적응을 수행했다. CC와 MLO에 동일한 프롬프트 집합을 공유함으로써 두 뷰의 표현이 같은 특성 공간으로 정렬되게 하였고, 이로 인해 소수의 학습 가능한 파라미터로도 도메인 특화 적응이 가능해졌다. 논문에서 프롬프트 깊이를 검증한 결과 특정 깊이(예: 8, 12, 16)에서 성능 우위를 보였고 지나치게 얕거나 깊게 삽입하면 성능 저하가 발생함이 관찰되었다.
토큰 기반 교차-뷰 융합 메커니즘 도입
각 융합 블록은 양방향 multi-head cross-attention을 실행하고, cross-attention 출력을 토큰 차원에서 평균 풀링하여 fusion token을 생성한 뒤 상대 뷰의 토큰 시퀀스 앞에 삽입했다. Fusion token은 이후 트랜스포머 레이어에서 다른 시각 토큰과 함께 정제되어 계층적으로 보완 정보를 전파하는 매개체 역할을 수행했다. 동일 구간에 단일 단계로 출력을 더하는 잔차적 합성 방식 대비 fusion token 방식이 F1과 AUC에서 일관된 개선을 보였다.
다층(다중 깊이) 융합 블록과 체계적 실험 및 절제 연구
단일 레이어 융합 대신 여러 깊이에 융합 모듈을 배치하여 점진적이고 반복적인 뷰 간 상호작용을 가능하게 했다. VinDr-Mammo 이진 실험에서 서로 다른 융합 블록 수(1, 2, 4)를 비교한 결과 적절히 분포된 두 개의 블록이 최적의 AUC(0.8593)를 달성했다는 관찰이 있었다. 추가로 aggregation 방식, encoder head 미세조정 여부, prompt 깊이 등을 절제 실험으로 검증해 설계 선택 근거를 제공했다.
핵심 아이디어 이해하기
기존 다중 뷰 융합 방식은 보통 특성 수준에서 한 번에 통합하거나 잔차적 추가로 정제해 뷰별 표현과 교차-뷰 표현이 뒤섞이게 되는 문제가 있다. 이 논문은 교차-뷰 정보를 별도의 토큰으로 요약해 삽입하면 뷰별 구조는 보존하면서도 뷰간 의존성을 명시적으로 전달할 수 있다는 점에 주목했다. 토큰은 transformer의 자연스러운 처리 단위이므로 이후 레이어에서 다른 시각 토큰들과 동일한 처리 흐름으로 정제될 수 있다.
방법론
전체 접근은 두 단계로 구성되며 첫 단계는 심층 공유-뷰 프롬프트 학습, 두 번째 단계는 토큰 기반 교차-뷰 융합이다. 심층 공유-뷰 프롬프트에서는 J개의 레이어( J ≤ K )에 각기 하나의 프롬프트 토큰을 삽입해 입력 임베딩과 함께 레이어에 공급하고, 프롬프트와 분류기만 학습시키며 백본과 pooling head는 동결했다. 교차-뷰 융합 단계에서는 CC와 MLO의 중간 히든 상태 H_cc, H_mlo에 대해 양방향 multi-head cross-attention을 계산하고 그 출력을 토큰 차원에서 평균 풀링하여 t_cc, t_mlo를 생성한 뒤 각 뷰의 토큰 시퀀스 앞에 삽입했다.
관련 Figure

그림은 MedSigLIP 백본의 여러 encoder 레이어 사이에 프롬프트 토큰을 삽입하는 흐름과 특정 층에서 CC↔MLO 간의 교차-어텐션을 수행해 fusion token을 생성·삽입하는 과정을 보여준다. 또한 fusion token이 이후 레이어에서 원래 토큰과 함께 정제되어 계층적으로 정보를 전파함을 도식적으로 나타내며, 제안 기법의 핵심 설계 요소들을 구조적으로 요약하고 있다.
전체 모델 아키텍처를 도식화한 그림으로 Stage1의 심층 프롬프트와 Stage2의 Cross-View Fusion Block 삽입 지점을 시각화하고 있다.
주요 결과
메인 벤치마크에서 제안한 전체 프레임워크는 VinDr-Mammo 5-클래스에서 F1-score 50.40%와 AUC 0.8090을 기록했고 CMMD에서는 F1 64.96%와 AUC 0.7161을 달성했다. Linear probing 대비 개선이 관찰되었고 Stage1(프롬프트)와 Stage2(융합)의 결합이 전체 성능에 상호 보완적 영향을 미쳤다. Fusion token 대 Residual fusion 비교에서 VinDr-5 기준 F1 상승 5.22 포인트 및 AUC +0.0521이 보고되었고, 평균 풀링이 융합 토큰 집계 방식 중 최선의 성능을 나타냈다.
관련 Figure

혼동 행렬은 제안 방법이 BI-RADS 1과 5에 대해 대각 성능이 비교적 높고 중간 카테고리에서 혼동이 발생함을 수치로 보여준다. 이 도표는 모델의 오류 경향성을 파악하는 근거로 쓰이며 ordinal한 BI-RADS 분류에서 균등하지 않은 성능 분포가 존재함을 실험적으로 뒷받침한다.
VinDr-Mammo 5-클래스 테스트에 대한 제안 방법의 정규화된 혼동 행렬을 나타내며 클래스별 오분류 패턴을 시각화하고 있다.

그래프는 특정 깊이(예: 8, 12, 16)에서 성능이 상승하고 깊이가 지나치게 커지면 성능이 급락하는 패턴을 나타낸다. 이 결과는 프롬프트의 삽입 깊이가 모델 적응에 중요한 하이퍼파라미터이며 최적 깊이 탐색이 필요함을 근거로 제시한다.
프롬프트 삽입 깊이에 따른 VinDr-Mammo 5-클래스 F1-score 변화를 선 그래프로 나타낸 그림이다.

곡선은 융합 블록 수가 2일 때 가장 우수한 AUC(0.8593)를 보이며 1블록과 4블록의 곡선은 상대적으로 낮은 영역을 차지한다. 이 시각화는 융합 블록의 수와 배치가 판별 능력에 실질적 영향을 미치며 과도한 융합이 역효과를 낼 수 있음을 뒷받침한다.
다양한 수의 융합 블록(N=1,2,4)에 대한 VinDr-Mammo 이진 분류의 ROC 곡선을 중첩해서 비교한 그림이다.

민감도 맵은 모델 예측에 크게 기여하는 영상 영역을 강조하며 일부 사례에서 병변 위치와 높은 일치도를 보였다. 이 시각화는 fusion token과 프롬프트 기반 적응이 국소적 중요 영역을 포착하는 데 기여했음을 시사하는 해석적 증거로 사용되었다.
여러 사례에 대한 CC·MLO 원본 영상, 오버레이, 그리고 occlusion 기반 민감도 맵을 나란히 제시한 시각화이다.
기술 상세
전체 아키텍처는 MedSigLIP pretrained vision Transformer를 백본으로 사용하고 입력은 CC와 MLO 각 이미지의 패치 임베딩이다. Stage1에서는 J개의 레이어에 각각 하나의 학습 가능한 프롬프트 토큰 p_i를 삽입하고 H_i = V_i([p_i, H_{i-1}]) 형태로 레이어 입력을 구성하며 J 이후 레이어는 기존 흐름을 유지했다. Stage2의 Cross-View Fusion Block에서는 A_cc = MHA(H_cc, H_mlo, H_mlo) 및 A_mlo = MHA(H_mlo, H_cc, H_cc)를 계산하고 token 차원 평균풀링으로 t_cc, t_mlo를 생성한 뒤 H'_cc = [t_cc, H_cc], H'_mlo = [t_mlo, H_mlo]로 갱신해 이후 레이어에서 함께 정제하도록 했다.
한계점
데이터셋 자체의 클래스 불균형이 존재하며 VinDr-Mammo에서 각 BI-RADS 클래스 분포가 크게 편향되어 있어 성능 해석 시 주의를 요한다. 프롬프트 깊이와 융합 블록의 수 및 배치에 민감성이 있어 하이퍼파라미터 튜닝이 필요하며 지나치게 많은 융합 블록은 오히려 성능 저하를 유발했다. 제시된 결과는 MedSigLIP 백본과 특정 전처리(예: CLAHE, 448×448 리사이즈)에 의존하므로 다른 백본이나 전처리 설정에서는 재검증이 필요하다.
실무 활용
공개된 코드 저장소가 존재하므로 제안된 프레임워크는 연구용 재현과 실험적 도입이 가능하다. 동결된 대형 백본과 소량의 학습 가능한 파라미터를 이용하는 구조는 라벨이 제한된 의료 데이터 환경에서 비용-효율적인 전이학습 전략으로 활용될 수 있다. 다만 프롬프트 깊이와 융합 블록 배치에 민감하므로 실제 배포 전 검증이 필요하다.
- 의료영상 연구 환경에서 사전학습된 MedSigLIP와 같은 비전 백본을 동결한 채로 소수의 학습 가능한 요소로 다중 투영(multi-view) 판독 모델을 구축하는 실험적 파이프라인 구축에 적용할 수 있다. 실무에서는 라벨이 제한된 병원 데이터셋을 이용해 심층 공유 프롬프트를 먼저 학습하고 그 후 계층적 융합 토큰을 도입해 성능과 해석성을 모두 확보하는 워크플로우를 구성할 수 있다.
- 임상 보조 도구 개발에서 CC와 MLO를 함께 처리해야 하는 유방 스크리닝 모델의 초기 프로토타입 제작에 적용할 수 있다. 제안된 설계는 전체 모델을 미세조정하지 않아도 새 병원 데이터에 상대적으로 빠르게 적응 가능하며, 민감한 의료 환경에서 계산 자원과 규제상 리스크를 줄이는 데 유리하다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Fusion Tokens
- — 교차-뷰 정보 교환을 위해 생성되는 소형 토큰으로, 한 뷰의 요약된 상호 정보를 다른 뷰의 토큰 시퀀스에 삽입하여 이후 레이어에서 함께 정제되게 만드는 구조이다. 이 토큰은 cross-attention의 출력을 평균 풀링으로 요약한 벡터로 생성되어 원래의 시퀀스 앞에 삽입되며, 계층적으로 보완적 특징을 전파하는 매개체 역할을 한다. 논문에서는 직접적 특징 합성 대신 fusion token을 사용해 뷰별 구조를 보존하면서 명시적인 뷰간 의존성을 유지하였다.
- Cross-Attention
- — 한 뷰의 토큰이 다른 뷰의 토큰을 쿼리·키·밸류로 활용하여 상보적 정보를 선택적으로 집계하는 multi-head attention 연산이다. 논문에서는 CC와 MLO 간의 bidirectional cross-attention을 통해 상응하는 표현을 생성하고, 이 출력을 평균 풀링하여 fusion token으로 요약하였다. 이 메커니즘은 뷰별 특징을 직접 더하거나 이어붙이는 방식보다 뷰간 의존성을 명시적이고 분리된 표현으로 유지하게 한다.
- Deep Visual Prompt
- — 사전학습된 vision Transformer의 여러 레이어에 학습 가능한 프롬프트 토큰을 삽입하여 백본 파라미터를 동결한 상태에서 계층적 적응을 수행하는 방법이다. 각 선택된 레이어에 하나의 프롬프트 토큰을 추가하면 층별 표현이 작업 도메인에 맞춰 미세조정되며, 논문에서는 CC·MLO에 동일한 프롬프트 집합을 공유해 뷰 간 표현 정렬을 유도했다. 이 방식은 전체 모델을 미세조정하지 않고도 소량의 학습 파라미터로 적응성을 확보한다.
- BI-RADS
- — 유방 영상에서 병변의 악성 가능성과 권장 처치를 표준화하기 위해 사용되는 등급 체계로, 숫자가 클수록 악성 가능성이 높음을 나타낸다. 본 논문에서는 VinDr-Mammo 데이터에서 5-클래스 BI-RADS 분류와 바이너리 분류 기준으로 모델 성능을 평가하였다. 클래스 불균형과 임상적 의미 때문에 macro F1과 AUC를 같이 사용해 성능을 보고하였다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.