TL;DR
교육용 AI가 단순한 문제해결 능력에서 벗어나 학습 순서와 개념 간 관계를 이해하려면 교과 구조에 대한 명시적 지식이 필요하다. 이 논문은 공식 교과서를 원천으로 하는 구조화된 지식그래프를 구축하여 교과서 내 선행관계와 도표의 시각적 근거까지 연결했다. 그 결과로 생성된 벤치마크와 학습 데이터는 모델이 교과적 맥락에서 왜 어떤 개념을 먼저 배워야 하는지 학습하도록 만드는 핵심 자원이 되었다.
왜 중요한가
교육용 AI가 단순한 문제해결 능력에서 벗어나 학습 순서와 개념 간 관계를 이해하려면 교과 구조에 대한 명시적 지식이 필요하다. 이 논문은 공식 교과서를 원천으로 하는 구조화된 지식그래프를 구축하여 교과서 내 선행관계와 도표의 시각적 근거까지 연결했다. 그 결과로 생성된 벤치마크와 학습 데이터는 모델이 교과적 맥락에서 왜 어떤 개념을 먼저 배워야 하는지 학습하도록 만드는 핵심 자원이 되었다.
핵심 기여
공식 교과서 기반의 대규모 교과 연계 지식그래프 구축
이 작업은 People’s Education Press의 수학, 물리, 화학, 생물 교과서를 원천으로 하여 K12-KGraph를 구축했다. 그래프는 9종 노드와 14종 엣지 타입을 포함하고 있으며 노드에 교과서 문장과 증거 인용을 연결해 사실성 검증이 가능하다. 구축 과정은 OCR 변환, 섹션 분할, LLM 기반 섹션 추출, 계층적 병합, DAG 검증을 포함해 자동화와 수동 검증을 결합한 파이프라인으로 설계되었다.
그래프 유도 다지선다 벤치마크 K12-Bench 생성
K12-Bench는 그래프 이웃 탐색을 통해 생성된 23,640개의 다중선택 문항을 포함한다. 문항은 Ground, Prereq, Neighbor, Evidence, Locate의 다섯 가족으로 구성되어 구조적 교과 이해의 다양한 측면을 측정한다. 생성 과정에서 교사 검수와 3-그램 유사도 및 LLM 기반 교재적 판단 필터를 적용해 문항의 정확도와 판별력을 유지했다.
KG 기반 감독 학습 코퍼스 K12-Train 합성 및 효능 검증
K12-Train은 그래프의 노드 속성과 엣지 의미를 활용해 7,335개의 감독 학습 샘플을 합성했으며 텍스트 전용 2,267개와 멀티모달 5,068개로 분류되었다. 노드-기반 QA, 엣지-기반 QA, 결정론적 템플릿을 조합하고 신뢰도 임계값으로 필터링해 환각을 최소화했다. 동일한 2,300샘플 예산 조건에서 K12-Train-Text는 여러 일반용 데이터 대비 GaokaoBench와 EduEval에서 일관되게 우수한 성능을 보였고, K12-Train-Full은 멀티모달 벤치에서 최상의 전체 성능을 달성했다.
핵심 아이디어 이해하기
대형 언어모델은 문제의 정답을 찾아내는 능력은 탁월하지만 교과서가 조직한 지식의 구조를 내재적으로 학습하지 못하면 학생을 안내하는 데 필요한 교육적 판단을 수행하지 못한다. 교과 구조는 개념 간의 상위어 관계, 선행관계, 도표가 제공하는 시각적 증거 같은 명시적 연결로 구성되며 이러한 연결을 명시적으로 표현하면 모델이 관계 중심의 질문에 답변할 수 있는 능력을 얻는다. 따라서 교과서 원문을 구조화해 노드와 엣지로 표현하는 것이 핵심 출발점이다.
방법론
구축 파이프라인은 다섯 단계로 이어졌다. 첫째, MinerU 기반 OCR로 PDF를 마크다운으로 변환해 수식과 이미지 자산을 보존했다. 둘째, 목차 파서를 통해 섹션 단위 파일을 생성하고 각 이미지와 섹션 텍스트를 연계했다. 셋째, 섹션별로 GPT-5.2에 스키마 의식을 갖춘 프롬프트를 보내 노드와 엣지를 JSON 구조로 추출하고 각 엣지에 근거 문장 혹은 신뢰도 점수를 부착했다.
관련 Figure

이미지는 다섯 단계의 자동화 파이프라인과 각 단계에서 사용된 주요 도구와 제약을 시각적으로 연결한다. 특히 섹션별 추출 후 병합과정에서 이름 중복 제거와 DAG 기반 검증을 거쳐 교과적 위계와 선행관계의 일관성을 확보하는 흐름을 강조하고 있다. 이 도식은 파이프라인이 자동 추출과 휴먼 인-더-루프 검증을 조합해 사실성 보증을 달성하는 방법을 명확히 전달한다.
Figure 1은 교과서 PDF에서 시작해 OCR, 섹션 분할, LLM 기반 노드·엣지 추출, 계층적 병합, DAG 검증으로 이어지는 전체 구성 파이프라인을 도식화하고 있다.

이미지는 동일한 그래프 구조에서 어떻게 Prereq 유형의 다중선택 벤치와 엣지-기반 QA 학습 샘플을 생성하는지를 단계별로 보여준다. 이 자료는 그래프가 벤치마크와 SFT 데이터의 단일 출처가 되어 난이도와 정답 추적을 통제할 수 있음을 시각적으로 입증한다.
Figure 2는 K12-KGraph의 한 부분 서브그래프를 벤치마크 항목과 학습 샘플로 각각 변환하는 과정을 예시로 보여준다.
주요 결과
K12-Bench 평가에서 전형적인 최상 모델도 구조적 교과 이해에서 뚜렷한 한계를 드러냈다. 최고 정확도는 Gemini-3-Flash의 57.1% EM였고 강력한 공개 모델 Gemma-4-31B-IT는 46.4% EM에 그쳤으며 Prereq와 Neighbor 과제가 특히 낮은 성능을 보였다. K12-Train의 효과는 샘플 예산을 엄격히 맞춘 상황에서도 분명하게 나타났으며 Qwen3-4B와 Llama3.1-8B에서 K12-Train-Text는 동일한 2,300샘플 예산의 주요 일반 SFT 코퍼스들을 능가했다.
기술 상세
그래프 스키마는 아홉 개의 노드 타입(Book, Chapter, Section, Concept, Skill, Experiment, Exercise, Figure, VisualElement)과 열네 개의 방향성 엣지를 포함한다. Concept 노드는 name, definition, importance, optional formula, aliases, examples 같은 속성을 가지며 Experiment 노드는 instruments, is_student, process, phenomena, conclusion 속성을 포함한다. 멀티모달 구성요소는 Figure와 VisualElement를 통해 도표와 시각적 요소를 노드화하고 refers_to, illustrates, requires_figure, supports_edge 같은 시각적 관계를 엣지로 표현해 시각적 근거를 연결했다.
실무 활용
K12-KGraph와 파생 데이터는 교육용 LLM과 VLM의 커리큘럼 인지 능력을 강화하는 실무 자원으로 사용 가능하다. 그래프는 교과 자료를 근거로 한 샘플 합성과 벤치마크 생성을 자동화하기 때문에 교육 소프트웨어의 평가·튜닝 파이프라인에 직접 통합할 수 있다. 관련 코드와 데이터는 공개 저장소를 통해 재사용할 수 있다.
- 교과별 튜터링 시스템에서 선행학습 경로를 추천하고 학습자 수준에 맞춘 학습 순서를 자동으로 생성하는 데 사용할 수 있다.
- 교육 플랫폼의 모델 평가에 K12-Bench를 도입해 단순 정답률이 아닌 교과 구조 이해를 측정하는 기준을 추가할 수 있다.
- 교사 보조 도구에서 도표와 실험을 근거로 한 설명 자동 생성 및 시각적 증거 매칭 기능을 구현하는 데 활용할 수 있다.
- 멀티모달 교육용 VLM을 미세조정할 때 K12-Train-Full을 사용해 텍스트와 이미지 정보를 통합한 추론 능력을 향상시킬 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Curriculum Cognition
- — 교과 구조 인지는 개념들 사이의 선행관계, 분류 구조, 도표와 실험의 시각적 근거, 교과서 내 위치 등 지식이 체계적으로 조직된 방식을 의미한다. 본문에서는 이러한 구조적 연결을 그래프 노드와 엣지로 모델링하여 모델이 단순한 사실 회상을 넘어서서 왜 어떤 순서로 학습해야 하는지와 도표가 어떻게 개념을 뒷받침하는지를 학습하도록 요구한다. 커리큘럼 인지는 교육용 LLM이 학생 지도와 학습 경로 설계에 유용한 지식을 제공하는 핵심 능력으로 취급된다.
- Knowledge Graph
- — 지식 그래프는 노드와 엣지로 사실과 관계를 형식화한 구조적 표현이다. 이 논문에서는 교과서의 개념, 기술, 실험, 도표 등을 노드로, 상위어 관계(is_a), 선행관계(prerequisites_for), 시각적 근거(refers_to/illustrates) 등을 엣지로 구현하여 교과 구조를 재현한다. 그래프는 벤치마크 문항 생성과 SFT 데이터 합성의 단일 근원으로 활용되어 출처 추적성과 일관된 난이도 통제가 가능하게 했다.
- KG-Guided Synthesis
- — 지식그래프 기반 합성은 그래프의 노드 속성과 엣지 의미를 템플릿이나 LLM 프롬프트로 변환하여 감독 학습용 QA 쌍을 자동 생성하는 방법이다. 본문에서는 노드-기반 QA, 엣지-기반 QA, 그리고 결정론적 템플릿을 조합해 K12-Train 데이터셋을 만들고 신뢰도 필터를 적용해 변질을 줄였다. 이 접근은 학습 샘플이 그래프의 구조적 의미를 직접 반영하도록 하여 샘플 효율을 높였다.
- Prerequisite Reasoning
- — 선행 개념 추론은 어떤 개념을 습득하려면 먼저 학습해야 하는 다른 개념들을 결정하는 능력이다. 논문에서는 prerequisites_for 엣지를 통해 교과서에 명시된 선행관계를 그래프에 저장하고 이를 이용해 Prereq 유형의 다지선다 문항을 생성하여 모델이 방향성 있는 구조적 관계를 학습하도록 했다. Prereq 문제는 본 연구에서 모델 성능이 특히 낮게 나타난 난제 영역으로 보고되었다.
- Multimodal Grounding
- — 멀티모달 근거화는 텍스트와 도표·실험 사진 같은 시각적 요소를 연계하여 개념의 증거와 설명을 구성하는 과정이다. 본문에서는 Figure와 VisualElement 노드를 도입하고 refers_to, illustrates, requires_figure, supports_edge 같은 엣지로 시각적 근거를 그래프에 연결하여 VQA 샘플을 합성했다. 이로 인해 텍스트만으로는 알기 어려운 시각적 정보가 학습 신호로 포함되어 VLM 성능이 향상되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
