본문으로 건너뛰기

NSF-SCIFY: NSF Awards 데이터베이스에서 과학적 주장 추출

대규모 과학 주장 데이터셋은 주장 검증, 발견 추적, 메타과학 연구를 가능하게 한다. Grant abstracts를 새로운 소스로 활용해 기존의 작은 데이터셋 중심 연구의 한계를 넘어선다.

왜 중요한가

대규모 과학 주장 데이터셋은 주장 검증, 발견 추적, 메타과학 연구를 가능하게 한다. Grant abstracts를 새로운 소스로 활용해 기존의 작은 데이터셋 중심 연구의 한계를 넘어선다.

핵심 기여

대규모 과학 주장 데이터셋 구축

NSF-SCIFY는 2.8M개의 주장을 400K abstract에서 추출해 모든 과학·수학 분야를 포괄한다.

하위 데이터셋: MATSCI

NSF-SCIFY-MATSCI는 materials science 분야에서 114K 주장과 145K 조사 제안을 포함한다.

하위 데이터셋: NSF-SCIFY-20K

다섯 개 NSF directorates를 커버하는 20K awards로 구성, 135K 주장과 139K 조사 제안을 포함한다.

제로샷 프롬프팅 기반 추출 파이프라인

Claude-3.5를 활용해 기술·비기술 초록에서 주장과 조사 제안을 공동으로 추출하는 스케일러블 파이프라인을 제시한다.

신규 평가 지표 및 공개 자원

LLM 판단 기반의 새로운 평가 지표를 제시하고 데이터/모델을 공개해 재현성과 확장을 가능하게 한다.

핵심 아이디어 이해하기

배경: NSF awards 초록은 검증 가능한 초기 주장을 담고 있으며, 전통적 문헌 기반 데이터와 차별화된 특성을 가진다. 원리: 제로샷 프롬프팅으로 Claims와 Investigation Proposals를 함께 추출하고, 추출 품질을 높이기 위해 정밀한 소스 텍스트와의 연계를 유지한다. 중요성: 대규모, 다학제적 커버리지를 통해 주장 검증 시스템의 데이터 신호를 확장하고, 이후의 사실 확인 및 메타 과학 연구에 새로운 벤치마크를 제공한다.

관련 Figure

콘텐츠 임베딩 vs 스타일 임베딩의 t-SNE 시각화
Diagram

Technical과 Non-Technical 초록 간 스타일 차이를 시각적으로 확인하며, 데이터의 특성 차이를 보강한다.

콘텐츠 임베딩 vs 스타일 임베딩의 t-SNE 시각화

방법론

데이터 수집: NSF Awards 데이터베이스를 XML로 다운로드해 1970년부터 2024년까지의 Awards를 파싱하고 NSF-SCIFY를 구성한다(412,155개 파싱 가능 awards). MATSCI 서브셋은 16,042 awards를 포함한다. 데이터 처리: 각 레코드는 Award ID, 제목, 연도, Directorate, 기술/비기술 초록, 주장의 목록, 조사 제안, 연결 Publications를 포함한다. 주석 및 제로샷 추출: Anthropic Claude-3.54를 사용해 두 유형의 진술(Claims, Investigation Proposals)을 식별하는 JSON 객체를 반환하도록 프롬프트를 구성한다. 온도는 0으로 고정한다. 프롬프트 다변형을 실험해 두 유형의 추출을 함께 수행하는 것이 관련성 유지에 유리함을 확인했다. 평가 설계: 120개 Awards를 수작업으로 검증하고, GPT-4o-mini를 활용해 Pairwise 판단을 수행하여 Precision/Recall/F1를 계산한다. NSF-SCIFY-20K에 대해 7B 모델 기반 미세조정의 효과를 추가로 확인했다.

관련 Figure

NSF-SCIFY 샘플 레코드(award_id, title, directorate, 기술/비기술 초록, 주장 목록, 조사 제안, Publications 포함).
Diagram

데이터 구조를 직관적으로 보여주며 데이터 수집 및 추출 파이프라인의 맥락을 해석하는 근거를 제공한다.

NSF-SCIFY 샘플 레코드(award_id, title, directorate, 기술/비기술 초록, 주장 목록, 조사 제안, Publications 포함).

주요 결과

Task 1 비기술 초록 생성: 미세조정된 Mistral-7B-instruct-v0.3은 BERTScore-F1 0.8561, ROUGE-L-sum 0.2166 등에서 우수한 성능을 보임. Task 2 주장 추출: 미세조정 Mistral의 Precision 0.7450, Recall 0.7098, F1 0.7097로 개선이 크며 Qwen도 비슷한 추세. Task 3 조사 제안 추출: 미세조정 Mistral의 Precision 0.7351, Recall 0.7539, F1 0.7261이며 Qwen도 유사한 개선을 보임. 이러한 결과는 데이터의 질과 미세조정의 효과를 뚜렷이 입증한다.

관련 Figure

NSF-SCIFY 도메인 분포를 시각화한 차트/그래프
Chart

다양한 디렉터레이션 분포를 통해 데이터의 커버리지를 확인하고, 연구 범위의 폭을 직관적으로 파악한다.

NSF-SCIFY 도메인 분포를 시각화한 차트/그래프

주장/조사 제안의 범주를 시각화한 트리맵/그래프
Diagram

주장의 유형 및 제안의 분포를 보여주며, 핵심 카테고리의 비중을 해석하는 데 기여한다.

주장/조사 제안의 범주를 시각화한 트리맵/그래프

Investigation Proposal 카테고리의 트리맵
Diagram

제안 분류의 분포를 시각화해 연구 초점과 실험 방향을 파악하는 데 도움을 준다.

Investigation Proposal 카테고리의 트리맵

다양한 NSF Award Area의 주장 정밀도/재현율 비교 차트
Chart

영역별 정밀도/재현율의 차이를 보여주며, 주장 추출의 신뢰도 차이를 해석하는 근거를 제공한다.

다양한 NSF Award Area의 주장 정밀도/재현율 비교 차트

Investigation Proposal 추출의 정밀도/재현율 비교 차트
Chart

제안 추출의 영역별 차이가 있으나 전반적으로 정밀도/재현율이 균형 있게 나타난다. 논문의 주장 신뢰성에 직접 기여한다.

Investigation Proposal 추출의 정밀도/재현율 비교 차트

기술 상세

데이터 소스 및 구성: NSF Awards XML에서 1970-2024를 포괄하며 412,155개의 parseable award를 확보했다. 전처리 이후, 16,042 Awards(MATSCI), 16K awards에 대한 більш 작은 샘플을 생성했다. 주된 기술은 Claude-3.54의 제로샷 프롬프팅으로 Claims/Investigation Proposals를 JSON 형식으로 추출하는 방법이다. 평가 단계에서 인간 주석 및 LLM 기반 판단을 활용해 정밀도/재현율/F1를 계산했고, 20K NSF-SCIFY-20K에서도 미세조정 효과를 확인했다.

실무 활용

대규모 과학 주장 데이터셋은 주장 검증, 발견 추적, 메타 과학 연구에 실용적 신호를 제공한다.

  • 대규모 주장 검증 파이프라인 구축
  • 과학 커뮤니케이션 자동화 및 요약 시스템
  • 연구 동향 분석 및 메타 연구 지원
  • 조사 제안의 자동 도출 및 비교 분석

코드 공개 여부: 공개

코드 저장소 보기

키워드

NSF-SCIFYscientific-claimsinvestigation-proposalszero-shot-promptingfine-tuningdataset-releaseclaim-verification
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 25.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.