본문으로 건너뛰기

온톨로지 및 지식그래프 구축 사례: Wikidata와 MANUMATE

Wikidata와 MANUMATE 사례를 통해 온톨로지 기반 지식그래프 구축의 설계 목적과 거버넌스, 재사용 전략을 비교 분석한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

온톨로지와 지식그래프는 데이터의 의미를 구조화하여 기계가 추론 가능한 형태로 변환하는 핵심 기술이다. Wikidata는 RDF와 SPARQL을 활용해 웹 스케일의 오픈 협업 지식그래프를 구축하고, Reification 기법으로 복잡한 메타 정보를 처리한다. 반면, MANUMATE는 스마트 제조 현장의 이기종 시스템 간 시맨틱 상호운용성 문제를 해결하기 위해 온톨로지 기반 프레임워크를 적용한다. 두 사례는 지식그래프의 설계 목적과 거버넌스 전략이 도메인 특성에 따라 어떻게 달라져야 하는지를 보여준다.

챕터별 상세

01:38

온톨로지 기초와 구성 요소

온톨로지는 개념화의 명시적 명세로, 기계가 이해할 수 있는 공식적인 사전이자 규칙집이다. 클래스, 인스턴스, 속성, 공리라는 4가지 요소로 구성된다. 클래스는 개념의 범주를, 인스턴스는 실제 개체를, 속성은 개체 간의 관계를, 공리는 항상 참인 논리 규칙을 정의한다.

온톨로지는 데이터의 의미를 명확히 정의하여 시스템 간 데이터 교환을 가능하게 한다.

04:38

시맨틱 웹 스택과 언어

시맨틱 웹은 RDF, OWL, SWRL, SPARQL 순으로 표현력과 기능이 확장되는 구조를 가진다. RDF는 주어-술어-목적어의 트리플 형태로 지식을 표현한다. OWL은 클래스 계층과 논리 공리를 정의하며, SWRL은 if-then 규칙을 추가한다. SPARQL은 RDF 데이터를 조회하는 그래프 전용 쿼리 언어이다.

상위 레이어로 갈수록 표현력과 추론 기능이 강화된다.

08:08

Wikidata의 운영과 인프라

Wikidata는 위키미디어 재단의 자매 프로젝트로, 전 세계가 협업하는 거대 지식그래프이다. MySQL 기반의 블롭 저장 방식에서 RDF와 SPARQL 기반의 시맨틱 기술로 전환했다. 6대 머신과 2개의 데이터센터를 운영하며, 로드밸런싱과 캐시를 통해 월 2.7억 건 이상의 실시간 쿼리를 처리한다.

Wikidata는 대규모 데이터의 실시간 조회와 관리를 위해 오픈소스 스택을 최적화했다.

12:00

Wikidata의 구체화(Reification)와 성능

Wikidata는 복합 값과 한정어 처리를 위해 Reification 기법을 사용한다. 문장 자체를 노드화하여 조건, 출처, 순위 정보를 연결한다. 2018년 1분기 기준 상위 50% 쿼리는 40ms 미만, 상위 95% 쿼리는 440ms 미만으로 처리된다. 타임아웃 발생률은 0.05% 미만이다.

Reification은 데이터의 신뢰성과 정밀도를 높이기 위한 필수적인 구조이다.

21:50

사용 로그 분석과 로보틱 트래픽

Wikidata 쿼리 로그 분석 결과, 99.4%가 로봇 트래픽이고 진짜 사람의 쿼리는 0.6%에 불과하다. 로봇 트래픽은 정형화된 패턴을 보이며, 이를 구분하지 않으면 실제 사용자 패턴 분석이 불가능하다. 로봇과 사람의 쿼리 패턴 차이를 이해하는 것이 데이터 엔지니어링의 핵심이다.

로봇 트래픽을 분리해야 실제 사용자 요구사항을 파악할 수 있다.

25:40

MANUMATE 프레임워크와 제조 현장

MANUMATE는 제조 현장의 이기종 시스템 간 시맨틱 상호운용성 문제를 해결하기 위한 온톨로지 프레임워크이다. ERP, MES, SCADA 등 다양한 시스템이 사용하는 용어와 데이터 구조의 차이를 온톨로지로 통합한다. 브라질의 장기 보관 우유 포장재 공장을 실증 대상으로 삼았다.

제조 현장은 시스템마다 용어와 데이터 구조가 달라 통합이 어렵다.

32:40

MANUMATE의 3단계 프로세스

MANUMATE는 참조 온톨로지, 요구사항, 응용 온톨로지의 3단계 구조를 가진다. 참조 온톨로지는 일반적인 제조 개념을 정의하고, 요구사항을 반영하여 특정 제품에 맞는 응용 온톨로지를 생성한다. 이후 Context Alignment, Ontology Mapping, Consistency Reasoning 과정을 거쳐 시스템에 정보를 배포한다.

특수화 과정을 통해 일반적인 온톨로지를 특정 도메인에 맞게 구체화한다.

43:32

다중 상속과 인스턴스화

MANUMATE는 다중 상속을 통해 하나의 개체가 여러 정체성을 가질 수 있게 한다. 예를 들어, PrintedReel은 커팅 공정에서는 원료로, 인쇄 공정에서는 제품으로 인식된다. Owlready2 라이브러리를 사용하여 Python에서 온톨로지를 객체처럼 다루며, Pellet 추론기로 논리적 모순을 검증한다.

다중 상속은 복잡한 제조 공정의 상태 변화를 표현하는 데 유용하다.

44:42

MANUMATE의 한계와 결론

MANUMATE는 온톨로지 병합의 어려움, 높은 모델링 진입장벽, 미탐구 영역(Digital Twin 등)이라는 한계를 가진다. 그러나 암묵적인 지식을 명시화하고 자동화된 정보 교환을 가능하게 했다는 점에서 의의가 있다. 온톨로지는 제조 현장의 언어 문제를 해결하는 중재자 역할을 수행한다.

온톨로지 구축은 전문성이 필요하며, 현실적인 구현에는 많은 노력이 요구된다.

용어 해설

온톨로지(Ontology)
개념화의 명시적 명세로, 특정 도메인의 용어와 관계를 기계가 이해할 수 있도록 공식적으로 정의한 사전이자 규칙집이다. 클래스, 인스턴스, 속성, 공리로 구성되어 데이터의 의미를 구조화한다.
지식그래프(Knowledge Graph)
데이터를 그래프 형태로 표현하여 개체 간의 관계를 명시적으로 나타낸 구조이다. 온톨로지를 설계도로 삼아 실제 데이터를 채워 넣어 구축하며, 복잡한 데이터 간의 연관성을 추론하는 데 활용된다.
자원 기술 프레임워크(RDF)
웹상의 자원을 주어-술어-목적어의 트리플 형태로 표현하는 표준 모델이다. 지식그래프 구축의 기초가 되며, 데이터를 기계가 해석 가능한 형태로 연결한다.
스파클(SPARQL)
RDF 데이터를 조회하고 조작하기 위한 표준 쿼리 언어이다. 그래프 구조의 데이터를 효율적으로 검색할 수 있게 하며, SQL과 유사한 역할을 수행한다.
구체화(Reification)
진술 자체를 객체로 취급하여 메타 정보를 추가하는 기법이다. 특정 문장에 대한 조건, 출처, 순위 등 부가 정보를 표현할 때 사용된다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 22.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.