본문으로 건너뛰기

LLM을 활용한 온톨로지 및 지식 그래프 자동 구축 파이프라인 연구

LLM을 활용해 연구 논문에서 온톨로지와 지식 그래프를 반자동으로 구축하는 6단계 파이프라인과 그 성능을 검증한 연구이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 연구는 연구 논문에서 온톨로지와 지식 그래프(KG)를 반자동으로 구축하는 6단계 파이프라인을 제안한다. ChatGPT-3.5와 Mixtral 8x7B를 활용하여 CQ 생성부터 KG 구축까지의 과정을 자동화하며, 인간의 검증을 포함한 Human-in-the-loop 방식을 통해 79%의 평가 일치율을 달성했다. 연구 결과, LLM은 KG 구축의 효율성을 크게 높일 수 있으나 결측치 처리, 중복 생성, 형식 호환성 등에서 여전히 한계를 보여 인간의 보조가 필수적임을 확인했다.

챕터별 상세

00:00

온톨로지와 지식 그래프 기초

온톨로지는 특정 도메인의 개념과 관계를 정의한 스키마이며, 지식 그래프는 이 스키마에 실제 데이터를 채운 결과물이다. 스키마를 TBox, 인스턴스를 ABox로 구분하여 관리하며, 이를 통해 서로 다른 출처의 정보를 연결하고 추론 및 시맨틱 검색을 수행할 수 있다. 본 연구는 사람이 수행하던 온톨로지 및 지식 그래프 구축 작업을 LLM으로 대체할 수 있는지 검증하는 데 목적이 있다.

TBox는 스키마(개념/관계 정의), ABox는 인스턴스(실제 데이터)를 의미한다.

03:26

역량 질문(CQ)의 정의와 중요성

역량 질문(Competency Question, CQ)은 온톨로지나 지식 그래프가 반드시 답할 수 있어야 하는 질문 목록으로, 소프트웨어 개발의 요구사항 명세와 유사하다. 설계의 출발점이자 구축 후 검증 기준으로 활용되며, 기존에는 도메인 전문가가 직접 작성했으나 본 연구에서는 LLM을 통해 생성한다. 예를 들어 '어떤 모델 아키텍처를 사용했는가?'와 같은 질문을 CQ로 설정하여 지식 그래프가 이를 처리할 수 있도록 설계한다.

CQ는 지식 그래프가 갖추어야 할 지식의 범위를 결정하는 핵심 설계 요소이다.

04:51

기존 구축 방식의 한계와 연구 동기

전통적인 온톨로지 구축은 도메인 전문가, 온톨로지 엔지니어, 컴퓨터 과학자의 협업이 필수적이며, CQ 수집부터 인스턴스 채우기까지의 과정이 수작업으로 이루어져 비용과 시간이 많이 소요된다. 또한 표현력이 높을수록 설계가 복잡해지는 문제가 있다. 본 연구는 이러한 자원 집약적인 구축 작업과 도메인 지식 활용 사이의 균형을 맞추기 위해 LLM을 도입하여 구축 과정을 자동화하고자 한다.

기존 방식은 인력 의존도가 높고 확장성이 떨어지는 문제가 있다.

05:53

LLM 기반 6단계 파이프라인

연구팀은 CQ 생성부터 지식 그래프 평가까지 전 과정을 자동화하는 6단계 반자동 파이프라인을 제안한다. 데이터 수집, CQ 생성, 온톨로지 생성, CQ 답변(RAG), 지식 그래프 구축, 평가 단계로 구성된다. 모든 단계를 LLM이 수행하는 것은 아니며, CQ 생성과 평가 단계에는 사람이 개입하는 'Human-in-the-loop' 방식을 채택하여 성능과 신뢰성을 확보했다.

반자동(Semi-automatic) 파이프라인은 LLM의 효율성과 인간의 검증을 결합한 형태이다.

09:47

파이프라인 상세: 데이터 수집 및 CQ 생성

1단계 데이터 수집은 기존 연구의 문헌 리뷰 데이터셋을 재사용하며, 2단계 CQ 생성은 ChatGPT-3.5를 활용한다. 도메인 전문가 2명이 ChatGPT-3.5가 생성한 초안을 검토 및 수정하여 최종 40개의 CQ를 확정한다. 이 과정에서 데이터 출처, 아키텍처, 하이퍼파라미터 등 지식 그래프에 필요한 핵심 변수들을 질문에 포함시킨다.

CQ 생성 시 도메인 전문가의 검토가 필수적이다.

text
Listing 1.1 Klein et al. (2015)에서 생성된 KG 발췌
dlprov:DeepLearningPipeline rdf:type dlprov:DeepLearningPipeline ;
  dlprov:hasDataFormat dlprov:DataFormat_1 , dlprov:DataFormat_2 .

dlprov:DataFormat_1 rdfs:label 'Audio Spectrogram' .
dlprov:DataFormat_2 rdfs:label 'Image data' .

논문에서 생성된 지식 그래프의 RDF/Turtle 형식 예시

11:05

파이프라인 상세: 온톨로지 생성

3단계 온톨로지 생성은 40개의 CQ를 기반으로 개념과 관계를 추출한다. LLM에 지시문과 함께 예시를 제공하는 인컨텍스트 러닝(In-context learning)을 활용하며, W3C 표준인 PROV-O 온톨로지를 재사용하여 데이터 출처를 기술한다. 결과적으로 45개의 클래스, 41개의 관계, 365개의 공리로 구성된 온톨로지를 구축했다.

PROV-O는 데이터의 출처(provenance)를 기술하기 위한 표준 온톨로지이다.

12:31

파이프라인 상세: RAG 기반 답변 생성

4단계 CQ 답변 생성은 RAG를 활용하여 논문 5편에서 40개의 CQ에 대한 200개의 답변을 생성한다. Mixtral 8x7B 모델을 사용하며, 2,500 토큰의 청크와 100 토큰의 오버랩을 설정했다. 생성된 답변의 중복이나 불필요한 설명을 제거하기 위해 텍스트 후처리를 수행하여 품질을 높였다.

RAG는 외부 문서를 검색하여 LLM의 답변 정확도를 높이는 기술이다.

13:35

파이프라인 상세: 지식 그래프 구축 및 평가

5단계 지식 그래프 구축은 LLM을 통해 답변에서 핵심 엔티티와 관계를 추출하여 온톨로지에 매핑한다. 6단계 평가는 LLM이 생성한 지식 그래프의 품질을 측정하며, 사람이 작성한 정답(Ground Truth)과 비교하여 79%의 일치율을 보였다. 지식 그래프의 정합성 평가를 위해 인스턴스가 CQ 답변에 실제로 등장하는지 검증하는 방식을 사용했다.

지식 그래프의 품질은 정답과의 일치율 및 정합성으로 평가한다.

15:38

모델 선정 및 인프라

연구팀은 Llama 2-70B, Mixtral 8x7B, Falcon-40B 세 가지 모델을 비교하여 Mixtral 8x7B를 최종 선정했다. Mixtral 8x7B는 Sparse Mixture-of-Experts(MoE) 구조로 연산량을 줄이면서도 높은 성능을 보여주었다. 추론 설정은 제로샷(Zero-shot), 온도 0, 최대 출력 25,000 토큰으로 고정했으며, NVIDIA A100 80GB GPU 1장으로 파이프라인을 구동했다.

MoE는 모델의 일부 전문가 네트워크만 활성화하여 연산 효율을 높이는 구조이다.

16:58

결과 및 한계점

실험 결과, 제안한 파이프라인은 40개의 CQ에 대해 45개의 클래스, 41개의 관계, 365개의 공리를 성공적으로 구축했다. 그러나 LLM은 여전히 결측치 처리, 중복 인스턴스 생성, 프롬프트 민감도, 형식 호환성 문제 등 한계를 보였다. 특히 PROV-O 온톨로지 규칙 재사용에 어려움을 겪어, 아직은 LLM이 온톨로지 구축을 완벽히 대체하기보다 인간의 작업을 보조하는 도구로 활용되어야 한다.

LLM의 한계로 인해 Human-in-the-loop 검증이 필수적이다.

용어 해설

온톨로지(Ontology)
특정 도메인의 개념과 그들 사이의 관계를 정의한 스키마로, 데이터의 구조와 의미를 명시적으로 표현한다. 지식 그래프 구축의 기반이 되는 TBox 역할을 수행하며, 도메인 지식을 체계화하여 추론과 시맨틱 검색을 가능하게 한다.
지식 그래프(Knowledge Graph)
온톨로지라는 스키마(TBox)에 실제 데이터(ABox)를 채워 넣은 결과물이다. 엔티티 간의 관계를 그래프 형태로 저장하여 복잡한 데이터 간의 연결성을 추론하고 의미 기반의 검색을 수행하는 데 필수적이다.
역량 질문(Competency Question)
온톨로지나 지식 그래프가 반드시 답할 수 있어야 하는 질문 목록이다. 소프트웨어 개발의 요구사항 명세와 유사한 역할을 하며, 설계의 출발점이자 구축 후 검증 기준으로 활용된다.
검색 증강 생성(RAG)
외부 지식 베이스에서 관련 문서를 검색하여 LLM에 컨텍스트로 제공함으로써 답변의 정확성을 높이는 기술이다. 본 연구에서는 논문 데이터를 검색하여 지식 그래프 구축을 위한 답변 생성에 활용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.