TL;DR
재료과학 논문에 포함된 수십 년 분량의 실험적 지식이 그림으로 축적되어 있으나 대부분 패널 단위 정렬이 이루어지지 않아 AI 학습에 활용하기 어려웠다. 본 연구는 복합 그림을 패널 단위로 분해하고 캡션·본문 참조 문장을 패널 수준으로 매칭해 패널-텍스트 쌍을 대규모로 확보함으로써 재료 과학 특화의 비주얼 데이터를 AI가 학습할 수 있는 형식으로 전환했다. 이로 인해 시각-언어 학습, 검색 및 후속 모델의 도메인 적응성이 즉시 개선될 근거 데이터가 제공되었다.
왜 중요한가
재료과학 논문에 포함된 수십 년 분량의 실험적 지식이 그림으로 축적되어 있으나 대부분 패널 단위 정렬이 이루어지지 않아 AI 학습에 활용하기 어려웠다. 본 연구는 복합 그림을 패널 단위로 분해하고 캡션·본문 참조 문장을 패널 수준으로 매칭해 패널-텍스트 쌍을 대규모로 확보함으로써 재료 과학 특화의 비주얼 데이터를 AI가 학습할 수 있는 형식으로 전환했다. 이로 인해 시각-언어 학습, 검색 및 후속 모델의 도메인 적응성이 즉시 개선될 근거 데이터가 제공되었다.
핵심 기여
MatMMExtract 파이프라인의 공개 구현과 전체 워크플로우 자동화
MatMMExtract는 출판사 XML에서 그림과 캡션 및 본문 내 참조 문장을 추출하고 복합 그림을 패널 단위로 분해한 뒤 LLM과 사전 정의된 분류 체계를 이용해 구조화된 주석을 생성하는 엔드투엔드 파이프라인이다. 파이프라인은 matmmextract PyPI 패키지로 공개되어 재현 가능하도록 구성되었으며 데이터 수집부터 최종 데이터셋 조립까지의 모든 단계를 포함한다. 라이선스 필터링, 이미지 다운로드, 검출기 기반 분할, JSON 스키마 검증, LLM 기반 주석 생성 등 실무에서 필요한 처리 절차를 통합했다.
MaterialScope: 재료과학 도메인 특화의 수동 주석 검출 데이터셋 구축
재료과학 그림 2,811장에 대해 총 12,906개의 유효 바운딩 박스를 PhD 연구자들이 수동 주석으로 확보하여 MaterialScope 벤치마크를 만들었다. 이 데이터셋은 학습/검증/테스트로 분할되어 도메인 적응(fine-tuning)에 사용되었고, YOLO12-m을 포함한 여러 검출기에서 도메인 특화 재학습의 이점을 정량적으로 입증했다. MaterialScope의 교차 평가에서 Cohen's κ=0.9245로 높은 주석 일관성을 보였고 데이터셋은 공개되어 재현성과 비교 연구에 활용 가능하다.
분류 체계와 LLM 기반 주석 생성의 결합 및 모델 벤치마크
논문은 19개의 상위 시각화 카테고리와 100여 개 이상의 하위타입으로 구성된 이중 레벨 분류 체계를 정의하고 이를 프롬프트로 LLM에 직접 제공해 엄격한 열거형 선택을 유도했다. 6개 저비용 LLM을 캡션·서브캡션·요약 품질과 환각률 관점에서 비교 평가한 결과 Gemini 3.1 Flash Lite가 4.8%의 낮은 환각률과 높은 'good' 비율로 비용 대비 최적의 선택으로 결정되었다. JSON 스키마로 출력 구조를 강제하여 후처리 없이도 주석의 일관성과 기계적 처리 가능성을 확보했다.
MatSciFig 데이터셋과 검색용 dual-encoder 기준 성능 제공
MatMMExtract를 적용해 180,571개의 원본 그림에서 391,606개의 패널-텍스트 쌍을 생성해 MatSciFig 데이터셋으로 공개했다. MatSciFig를 활용해 CLIP ViT-B/32와 MatSciBERT 기반의 dual-encoder를 학습한 결과 zero-shot CLIP 대비 R@1에서 4.4×(이미지→텍스트)와 5.4×(텍스트→이미지)의 개선이 관찰되어 데이터셋의 즉각적인 실용성을 확인했다. 모든 코드와 데이터는 오픈 라이선스 하에 공개되어 후속 연구에 활용 가능하다.
핵심 아이디어 이해하기
문제 출발점은 학술 논문의 그림이 대개 복합 그림(compound figure) 형태로 제공되어 하나의 캡션이 여러 패널을 동시에 설명한다는 점이다. 이런 구조에서는 원래 캡션을 그대로 이미지-텍스트 정렬에 쓰면 패널별로 어떤 텍스트가 대응하는지 불명확해져 학습 신호에 노이즈가 유입된다. 따라서 패널 수준의 정확한 위치 검출과 텍스트의 패널별 분해가 필요하다. MatMMExtract는 이 문제를 두 단계로 접근했다: 먼저 도메인 특화 검출기로 그림을 패널 단위로 분해하고, 그 다음 캡션과 본문 참조 문장을 입력으로 LLM을 구동해 각 패널에 대해 서브캡션·카테고리·요약을 생성한다. 이렇게 하면 이미지와 텍스트가 패널 단위로 정렬되어 대조 학습이나 검색을 위한 고품질 트레이닝 쌍이 만들어진다.
방법론
전체 방법론은 세 가지 연속 단계로 구성된다. 첫째, OpenAlex와 Scopus로부터 라이선스 필터링을 거친 논문 메타데이터를 수집하고 Elsevier/Springer API로부터 구조화된 XML을 내려받아 그림 링크·캡션·본문 참조 문장을 추출한다. 둘째, 복합 그림을 단일 패널 또는 다중 패널로 분류하고 재료과학에 특화된 MaterialScope 주석으로 도메인 적응(fine-tuning)한 YOLO12-m 검출기를 포함한 여러 모델을 재학습시켜 패널 경계(box)를 로컬라이즈한다. 셋째, 검출로 얻은 패널 레코드와 캡션·참조 문장을 LLM에 프롬프트로 제공하되 두 레벨 분류 체계를 명시하고 JSON 스키마를 강제하여 서브캡션, 시각화 카테고리·하위타입, 40–60단어 요약을 생성한다.
관련 Figure

파이프라인은 출판사 XML에서 그림과 캡션·참조문을 추출한 뒤 복합 그림을 검출기(예: YOLO12-m)로 분해하고 LLM에 분류 체계와 텍스트를 제공해 서브캡션과 요약을 생성하는 순서로 구성되어 있다. 다이어그램은 각 단계에서 생성되는 출력(패널 크롭, 서브캡션, 분류, 요약)이 최종적으로 MatSciFig 데이터셋으로 합쳐지는 과정을 명시적으로 보여주어 전체 방법론과 데이터 흐름을 이해하는 데 직접적인 도움을 준다.
MatMMExtract 파이프라인의 개요 다이어그램으로, 메타데이터 수집·검출·LLM 기반 주석·데이터셋 조립의 흐름을 시각화했다.
주요 결과
검출 성능 측면에서 MaterialScope로 도메인 적응을 수행한 YOLO12-m은 mAP50 0.9227을 달성하며 본 논문에서 선택된 서브패널 검출기로 채택되었다. 동일한 실험군의 다른 YOLO 변종들도 도메인 적응으로 Exsclaim 대비 mAP50에서 큰 폭의 향상을 보였으며 DAB-DETR는 데이터 규모가 작을 때 일반화가 약한 것으로 보고되었다. 생성 측면에서 6개 LLM 비교 실험에서 Gemini 3.5 Flash와 Gemini 3.1 Flash Lite 계열이 캡션·요약의 'good' 비율과 낮은 환각률 측면에서 우수했고, 비용-품질 균형으로 Gemini 3.1 Flash Lite가 최종 선택되어 전체 파이프라인의 주석 모델로 사용되었다. 데이터셋 결과로 MatMMExtract 적용 후 180,571개의 원본 그림에서 391,606개의 패널-텍스트 쌍이 수집되었고 MatSciFig 기반 dual-encoder는 zero-shot CLIP 대비 R@1에서 4.4×(i→t) 개선을 포함한 유의미한 검색 성능 향상을 보였다.
관련 Figure

이 그래프는 Microscopy, Generic Plot, Simulation 등 주요 카테고리에서 Gemini 계열이 높은 분류 정확도를 보이고 일부 모델이 특정 카테고리에서 약점을 드러냄을 시각적으로 확인시킨다. 카테고리별 표본 수와 함께 제시되어 있어 소표본 카테고리의 추정 불확실성도 해석 가능하다.
각 시각화 카테고리별로 여러 LLM의 분류 정확도를 막대그래프로 비교한 그림으로, 모델 간 성능 차이를 보여준다.

이 열지도는 XPS, FTIR, SEM과 같은 특징이 뚜렷한 서브카테고리에서 거의 완전한 정확도를 보였고, Fatigue/S-N Curve나 Scatter Plot 같이 미세한 구분이 요구되는 서브카테고리에서는 모델 간 편차가 크다는 사실을 드러낸다. 따라서 분류 성능 향상을 위해서는 서브카테고리별 데이터 증강이나 추가 훈련이 필요함을 시사한다.
서브카테고리별로 모델들의 정확도를 열지도(heatmap)로 나타낸 그림으로, 세부 하위타입에서의 모델별 강·약점을 제시한다.

이 그림은 캡션·요약에서 'good' 비율과 환각률을 병렬로 보여주어 Gemini 3.1 Flash Lite가 낮은 환각률(4.8%)과 높은 'good' 비율을 기록해 비용-효율적 선택임을 정량적으로 나타낸다. 또한 다른 모델들이 낮은 비용에도 불구하고 환각률이 유의하게 높아 대규모 자동 주석 파이프라인에서의 위험을 명확히 보여준다.
캡션 및 요약 품질, 환각률을 모델별로 비교한 복합 막대·히트맵으로, Gemini 모델 계열의 우수성과 비용-품질 균형 선택 근거를 제시한다.
기술 상세
패널 검출기는 YOLO 계열의 여러 변형(YOLO8-m, YOLO9-c, YOLO10-m, YOLO11-m, YOLO12-m)과 DAB-DETR를 비교한 뒤 MaterialScope로 도메인 특화 학습을 수행했다. YOLO 패밀리는 1024×1024 해상도에서 Ultralytics 기본 SGD 옵티마이저(모멘텀 0.937, 코사인 LR decay)로 50에폭 미세조정을 수행했고 DAB-DETR은 AdamW로 학습해 비교 실험을 표준화했다. 평가 프로토콜은 confidence threshold 0.55, NMS IoU 0.45, 매칭 IoU 0.50을 사용해 precision/recall/F1과 빈도 분류별 APf/APc를 보고했다.
한계점
데이터 수집은 Elsevier와 Springer의 오픈 액세스 기사에 한정되어 있어 출판사 편향이 존재할 수 있으며 이로 인해 특정 하위 분야의 시각 유형이 과대표집될 가능성이 있다. 생성된 서브캡션과 요약은 오직 캡션과 본문 참조 문장만을 근거로 생성되므로 그림 자체의 시각적 정보가 캡션에 충분히 반영되지 않은 경우 주석의 정확도가 낮아질 수 있고, 실제로 저비용 모델들에서 환각률이 높게 관찰되었다. 현재 분류 체계는 합금·복합재·세라믹 중심으로 설계되어 있어 다른 재료 하위분야나 새로운 시각화 유형을 포괄하려면 분류 체계의 확장과 도메인 전문가와의 협업이 필요하다.
실무 활용
MatSciFig는 재료과학 분야의 시각-언어 학습을 위한 대규모 패널 수준 코퍼스를 제공하므로 도메인 적응된 비전-언어 모델이나 검색 시스템 개발에 즉시 활용 가능하다. 데이터는 CC-BY-NC 라이선스로 공개되어 연구용 학습과 평가에 바로 사용될 수 있다. 파이썬 패키지(matmmextract)와 GitHub 저장소를 통해 파이프라인을 설치하고 재현할 수 있어 자체 코퍼스 구축이나 추가 출판사로 확장하는 실무 적용이 용이하다.
- 재료과학 전용 vision-language 모델을 학습해 패널-수준의 이미지 검색 및 캡션 자동생성을 수행하는 연구 개발
- 문헌 기반 정보 추출 파이프라인에 MatSciFig를 사용해 실험 조건·결과와 시각자료를 연결하는 지식베이스 구축
- 재료 분야 교육용 데이터로 활용해 교재나 논문 가이드를 자동으로 생성하는 서포트 도구 개발
- 교차모달 retrieval 연구에서 hard-negative 전략과 결합해 세부적 시각 차이를 판별하는 모델 평가
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

이 그림은 패널 레이블 A–T와 단일 패널(single)에 걸친 주석 빈도를 정량화하여 데이터셋 내에서 어떤 패널 레이블이 상대적으로 많았는지를 보여준다. 분포를 보면 상위 레이블 몇 개가 대다수 주석을 차지하고 있음을 확인할 수 있어 데이터 분할·희소 서브타입 처리 전략의 필요성을 뒷받침한다.
패널 레이블별 주석 수 분포를 세로 막대그래프로 표현한 그림으로, 전체 주석의 분포와 'single' 패널 빈도를 보여준다.

분포 차트는 데이터셋 내에서 Microscopy, Generic Plot, Schematic/Diagram이 상위 비중을 차지함을 수치로 확인시켜주며 데이터셋 편향을 정량화한다. 이러한 분포는 후속 모델 학습 시 빈발 카테고리에 대한 과적합 가능성과 희소 카테고리에 대한 평가 불안정성을 고려해야 함을 시사한다.
MatSciFig의 시각화 카테고리 분포를 수평막대그래프로 표현한 그림으로, Microscopy가 가장 큰 비중(27.2%)임을 보여준다.

이 그림은 Microscopy에서 SEM이 62.7%로 우세하고 Generic Plot에서는 Line Graph가 47.6%로 주요 비중을 차지한다는 구체적 분포를 제시해 각 카테고리의 대표성을 확인시킨다. 이는 서브타입 기반의 학습·평가 스키마 설계 및 하위타입 별 샘플링 전략 수립에 직접적인 근거를 제공한다.
상위 6개 카테고리에 대한 서브타입 분포를 서브플롯으로 분해해 시각화한 그림으로, 각 카테고리 내부의 세부 구성 비율을 제시한다.

히스토그램은 서브캡션이 10–30 단어 범위로 분산되는 반면, 인위적으로 40–60단어로 제한한 요약은 중앙집중적인 분포를 보임을 확인시킨다. 이 차이는 캡션은 원문에 의존해 길이가 다양해지는 반면 요약은 일관된 길이 제약으로 후속 모델 학습 시 텍스트 길이 관련 편차를 줄이는 효과가 있음을 보여준다.
서브캡션과 요약의 단어 수 분포를 히스토그램으로 보여주며 요약이 40–60단어 제한으로 더 균일함을 나타낸다.
용어 해설
- Compound Figure
- — 여러 개의 하위 패널이 하나의 그림으로 묶여 단일 캡션으로 설명되는 과학 논문 그림 형식이다. 단일 캡션이 여러 패널을 동시에 기술하므로 패널별로 텍스트를 정렬하기 위해서는 각 패널의 위치를 정확히 검출하고 캡션·본문의 참조 문장을 패널 수준으로 분해하는 절차가 필요하다. MatMMExtract에서는 이러한 구조적 특성을 해결하기 위해 패널 검출기와 텍스트 기반 주석 생성 절차를 결합하여 패널-텍스트 정렬을 복원했다.
- InfoNCE
- — 대조 학습에서 이미지와 텍스트 임베딩을 동일한 공간에 정렬하는데 사용하는 대칭 교차 엔트로피 손실이다. 배치 내의 올바른 쌍을 정답으로, 나머지를 음성 예시로 취해 softmax 교차 엔트로피를 계산하며 온도 파라미터 τ를 학습하여 유사도 분포의 샤프니스 조절을 허용한다. 본 논문은 CLIP 방식의 대칭 InfoNCE를 사용해 512차원 임베딩 공간에서 이미지-텍스트 검색 성능을 최적화했다.
- Hard Negative Sampling
- — 검색 모델 학습에서 단순 무작위 음성 대신 같은 서브타입 또는 같은 카테고리에서 선택된 시각적으로 혼동되기 쉬운 음성 샘플을 배치에 포함시키는 전략이다. 이 논문은 세 단계(같은 서브타입, 같은 카테고리, 무작위) 우선순위를 사용해 실제로 혼동되는 예시로 모델을 학습시켜 판별력을 높였다. 결과적으로 모델은 단순한 구별이 아닌 미세한 구분에 강해져 R@K 성능이 향상되었다.
- MatMMExtract Pipeline
- — 출판사 XML에서 그림·캡션·본문 참조 문장을 추출하고, 도메인 특화 검출기로 복합 그림을 분해한 뒤 LLM과 사전 정의된 분류 체계를 이용해 패널별 주석과 요약을 생성하는 일련의 자동화 과정이다. 파이프라인은 MaterialScope로 검증된 YOLO12-m 기반 검출기와 Gemini 3.1 Flash Lite를 사용한 텍스트 주석 생성을 결합하여 MatSciFig라는 대규모 패널 수준 멀티모달 데이터셋을 생성했다. 파이프라인은 PyPI 패키지(matmmextract)로 공개되어 동일한 절차를 재현 가능하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.