TL;DR
기관별로 이미지와 텍스트 데이터가 분산된 Vision-Language Model 학습에서는 원시 데이터를 이동시키지 않으면서 서로 다른 모달리티와 작업의 업데이트를 조정해야 한다. NVIDIA FLARE는 서버가 라운드를 조정하고 클라이언트가 로컬 데이터로 학습하는 구조에 Large-object externalization, Tensor Streaming, disk-backed aggregation을 결합해 큰 업데이트의 전송과 집계 부담을 낮춘다. FedUMM은 고정된 BLIP3o backbone의 LoRA 어댑터만 교환해 8개 클라이언트에서 라운드당 통신량을 28.6 GB에서 0.094 GB로 줄였고 VQA v2에서 전체 모델 FedAvg보다 0.7포인트 높은 결과를 냈다. 다만 실험은 시뮬레이션과 공개 일반 도메인 벤치마크에 기반하므로 임상 성능이나 형식적 Privacy Guarantee까지 입증한 결과는 아니다.
빠른 이해
새로운 점
전체 모델 대신 고정된 BLIP3o backbone의 LoRA 어댑터만 교환하면서 NVIDIA FLARE의 스트리밍과 디스크 오프로드를 함께 적용한 멀티모달 연합 학습 설계이다.
핵심 메커니즘
각 사이트가 로컬 이미지·텍스트·프롬프트로 고정된 BLIP3o backbone의 LoRA 어댑터를 학습하고, NVIDIA FLARE 서버가 모달리티별 어댑터와 alignment token 업데이트를 집계한다. 전체 모델 업데이트가 필요한 경우에는 큰 객체를 외부화하고 Tensor를 청크 단위로 스트리밍하며, 여러 업데이트는 safetensors 파일로 디스크에 오프로드한 뒤 필요할 때 읽는다.
핵심 수치
- 클라이언트당 라운드 통신량: 28.6 GB -> 0.094 GB- 8개 클라이언트 비교에서 전체 모델 FedAvg와 FedUMM 어댑터 교환 비교
- 전체 모델 페이로드 대비 통신량: 0.3%- FedUMM의 라운드당 0.094 GB 기준
- VQA v2 성능 변화: +0.7 points- 8개 클라이언트에서 전체 모델 FedAvg 대비
- 중앙 학습 기준 성능: 약 97%- 8개 클라이언트에서 VQA v2와 GenEval 모두 해당
- 평가 클라이언트 수: 최대 16개- Dirichlet 기반 데이터 이질성 조건의 시뮬레이션
- 지원 버전: NVIDIA FLARE 2.8.0- PyTorch FedAvg Tensor의 디스크 오프로드 기능
섹션별 상세
멀티모달 연합 학습의 병목

NVIDIA FLARE의 라운드 구조

큰 업데이트의 전송과 집계
FedUMM의 어댑터 기반 설계

실험 결과와 적용 범위
워크플로 설계와 시작점
용어 해설
- 연합 학습(Federated Learning)
- — 원시 데이터를 한곳에 모으지 않고 여러 기관이 각자의 데이터로 모델을 학습한 뒤, 서버가 승인된 모델 업데이트만 모아 전역 모델을 갱신하는 분산 학습 방식이다. 데이터는 현장에 남고 모델 상태 일부만 네트워크를 이동한다.
- Vision-Language Model
- — 이미지와 텍스트를 함께 처리해 시각 질의응답, 캡션 생성, 이미지·텍스트 추론을 수행하는 모델이다. 기관마다 보유한 이미지, 보고서, 프롬프트가 다르면 같은 모델을 공동 학습하기 위한 업데이트 규칙이 필요하다.
- LoRA
- — 사전 학습된 모델의 원래 가중치를 고정한 채 저순위 어댑터만 학습하는 Parameter-Efficient Fine-Tuning 기법이다. 연합 학습에서는 전체 모델 대신 작은 어댑터를 전송하므로 통신량과 서버 메모리 부담을 줄이는 데 쓰인다.
- Tensor Streaming
- — 큰 Tensor를 한 번에 직렬화하지 않고 필요한 청크 단위로 나누어 순차적으로 전송하는 방식이다. NVIDIA FLARE의 pull 기반 Tensor Downloader는 한 번에 처리하는 데이터 크기를 낮춰 모델 배포 중 피크 메모리를 줄인다.
- 디스크 기반 집계(Disk-Backed Aggregation)
- — 여러 클라이언트의 모델 업데이트를 서버 메모리에 모두 보관하지 않고 임시 파일에 저장한 뒤 필요할 때 읽어 집계하는 방식이다. NVIDIA FLARE 2.8.0은 PyTorch FedAvg 업데이트를 safetensors 파일로 오프로드해 클라이언트 수 증가에 따른 CPU 메모리 선형 증가를 막는다.
- Dirichlet 기반 데이터 이질성(Dirichlet-Controlled Heterogeneity)
- — 클라이언트마다 데이터 분포가 다르도록 Dirichlet 분포를 이용해 합성 파티션을 구성하는 평가 조건이다. FedUMM 실험은 최대 16개 클라이언트에서 기관별 데이터와 작업 구성이 다른 연합 학습 상황을 재현했다.
기술
- NVIDIA FLARE
- FedUMM
- LoRA
- BLIP3o
- FedAvg
- Large-object externalization
- FLARE Tensor Downloader
- Tensor Streaming
- tensor disk offload
- safetensors
- Recipe API
- Auto-FL
- VQA v2
- GenEval
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
