본문으로 건너뛰기

재료과학 시각 기록을 여는 대규모 멀티모달 데이터셋

재료과학 논문에 포함된 수십 년 분량의 실험적 지식이 그림으로 축적되어 있으나 대부분 패널 단위 정렬이 이루어지지 않아 AI 학습에 활용하기 어려웠다. 본 연구는 복합 그림을 패널 단위로 분해하고 캡션·본문 참조 문장을 패널 수준으로 매칭해 패널-텍스트 쌍을 대규모로 확보함으로써 재료 과학 특화의 비주얼 데이터를 AI가 학습할 수 있는 형식으로 전환했다. 이로 인해 시각-언어 학습, 검색 및 후속 모델의 도메인 적응성이 즉시 개선될 근거 데이터가 제공되었다.

추가 이미지 분석

패널 레이블별 주석 수 분포를 세로 막대그래프로 표현한 그림으로, 전체 주석의 분포와 'single' 패널 빈도를 보여준다.
Chart

이 그림은 패널 레이블 A–T와 단일 패널(single)에 걸친 주석 빈도를 정량화하여 데이터셋 내에서 어떤 패널 레이블이 상대적으로 많았는지를 보여준다. 분포를 보면 상위 레이블 몇 개가 대다수 주석을 차지하고 있음을 확인할 수 있어 데이터 분할·희소 서브타입 처리 전략의 필요성을 뒷받침한다.

패널 레이블별 주석 수 분포를 세로 막대그래프로 표현한 그림으로, 전체 주석의 분포와 'single' 패널 빈도를 보여준다.

MatSciFig의 시각화 카테고리 분포를 수평막대그래프로 표현한 그림으로, Microscopy가 가장 큰 비중(27.2%)임을 보여준다.
Chart

분포 차트는 데이터셋 내에서 Microscopy, Generic Plot, Schematic/Diagram이 상위 비중을 차지함을 수치로 확인시켜주며 데이터셋 편향을 정량화한다. 이러한 분포는 후속 모델 학습 시 빈발 카테고리에 대한 과적합 가능성과 희소 카테고리에 대한 평가 불안정성을 고려해야 함을 시사한다.

MatSciFig의 시각화 카테고리 분포를 수평막대그래프로 표현한 그림으로, Microscopy가 가장 큰 비중(27.2%)임을 보여준다.

상위 6개 카테고리에 대한 서브타입 분포를 서브플롯으로 분해해 시각화한 그림으로, 각 카테고리 내부의 세부 구성 비율을 제시한다.
Chart

이 그림은 Microscopy에서 SEM이 62.7%로 우세하고 Generic Plot에서는 Line Graph가 47.6%로 주요 비중을 차지한다는 구체적 분포를 제시해 각 카테고리의 대표성을 확인시킨다. 이는 서브타입 기반의 학습·평가 스키마 설계 및 하위타입 별 샘플링 전략 수립에 직접적인 근거를 제공한다.

상위 6개 카테고리에 대한 서브타입 분포를 서브플롯으로 분해해 시각화한 그림으로, 각 카테고리 내부의 세부 구성 비율을 제시한다.

서브캡션과 요약의 단어 수 분포를 히스토그램으로 보여주며 요약이 40–60단어 제한으로 더 균일함을 나타낸다.
Chart

히스토그램은 서브캡션이 10–30 단어 범위로 분산되는 반면, 인위적으로 40–60단어로 제한한 요약은 중앙집중적인 분포를 보임을 확인시킨다. 이 차이는 캡션은 원문에 의존해 길이가 다양해지는 반면 요약은 일관된 길이 제약으로 후속 모델 학습 시 텍스트 길이 관련 편차를 줄이는 효과가 있음을 보여준다.

서브캡션과 요약의 단어 수 분포를 히스토그램으로 보여주며 요약이 40–60단어 제한으로 더 균일함을 나타낸다.

용어 해설

복합 그림(패널 합성 그림)(Compound Figure)
여러 개의 하위 패널이 하나의 그림으로 묶여 단일 캡션으로 설명되는 과학 논문 그림 형식이다. 단일 캡션이 여러 패널을 동시에 기술하므로 패널별로 텍스트를 정렬하기 위해서는 각 패널의 위치를 정확히 검출하고 캡션·본문의 참조 문장을 패널 수준으로 분해하는 절차가 필요하다. MatMMExtract에서는 이러한 구조적 특성을 해결하기 위해 패널 검출기와 텍스트 기반 주석 생성 절차를 결합하여 패널-텍스트 정렬을 복원했다.
InfoNCE 손실(InfoNCE)
대조 학습에서 이미지와 텍스트 임베딩을 동일한 공간에 정렬하는데 사용하는 대칭 교차 엔트로피 손실이다. 배치 내의 올바른 쌍을 정답으로, 나머지를 음성 예시로 취해 softmax 교차 엔트로피를 계산하며 온도 파라미터 τ를 학습하여 유사도 분포의 샤프니스 조절을 허용한다. 본 논문은 CLIP 방식의 대칭 InfoNCE를 사용해 512차원 임베딩 공간에서 이미지-텍스트 검색 성능을 최적화했다.
고난이도 음성 샘플링(Hard Negative Sampling)
검색 모델 학습에서 단순 무작위 음성 대신 같은 서브타입 또는 같은 카테고리에서 선택된 시각적으로 혼동되기 쉬운 음성 샘플을 배치에 포함시키는 전략이다. 이 논문은 세 단계(같은 서브타입, 같은 카테고리, 무작위) 우선순위를 사용해 실제로 혼동되는 예시로 모델을 학습시켜 판별력을 높였다. 결과적으로 모델은 단순한 구별이 아닌 미세한 구분에 강해져 R@K 성능이 향상되었다.
MatMMExtract 파이프라인(MatMMExtract Pipeline)
출판사 XML에서 그림·캡션·본문 참조 문장을 추출하고, 도메인 특화 검출기로 복합 그림을 분해한 뒤 LLM과 사전 정의된 분류 체계를 이용해 패널별 주석과 요약을 생성하는 일련의 자동화 과정이다. 파이프라인은 MaterialScope로 검증된 YOLO12-m 기반 검출기와 Gemini 3.1 Flash Lite를 사용한 텍스트 주석 생성을 결합하여 MatSciFig라는 대규모 패널 수준 멀티모달 데이터셋을 생성했다. 파이프라인은 PyPI 패키지(matmmextract)로 공개되어 동일한 절차를 재현 가능하게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 29.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.