본문으로 건너뛰기

LLM 기반 지식 그래프 구축을 위한 코드 구조 및 Wikidata 스키마 활용 전략

LLM의 지식 추출 성능을 높이기 위해 생성을 코드 구조나 Wikidata 스키마에 결속시키는 Grounding 전략과 그 효과를 분석했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

비정형 텍스트에서 지식 그래프를 구축할 때 발생하는 구조 손실과 표준 부재 문제를 해결하기 위해 LLM의 생성을 코드 구조나 외부 온톨로지에 결속시키는 방법론을 다룬다. CodeKGC는 KGC를 코드 완성 문제로 변환하여 구조적 정확도를 높였고, Wikidata 기반 연구는 표준 스키마 매핑을 통해 지식의 상호 운용성을 확보했다. 실험 결과 이러한 Grounding 전략이 단순 자연어 생성보다 복잡한 관계 추출과 지식 정합성 측면에서 우수함이 확인됐다.

챕터별 상세

00:00

KGC의 정의와 생성형 방식의 한계

비정형 텍스트에서 (head, relation, tail) 관계를 추출하여 지식 그래프를 구축하는 KGC 작업의 개념을 정의했다. 기존 Pipeline 방식은 단계별 오류 누적 문제가 있었고, 이를 해결하기 위해 등장한 Generative KGC는 텍스트 직렬화 과정에서 구조 정보가 손실되는 Structural Loss와 외부 스키마 없이 자유 생성되어 기존 지식 베이스와 정합되지 않는 Lack of Grounding 문제를 안고 있었다. 이러한 한계를 극복하기 위해 LLM의 생성을 코드 구조나 외부 온톨로지에 결속시키는 전략이 필요하다.

KGC는 비정형 데이터를 기계가 이해할 수 있는 구조화된 지식으로 변환하는 핵심 기술이다.

06:04

CodeKGC: 코드 구조를 활용한 지식 추출

LLM이 자연어보다 코드의 엄격한 문법과 구조를 더 잘 모델링한다는 점에 착안하여 KGC를 코드 완성 문제로 재정의한 CodeKGC 방법론을 다뤘다. 스키마를 Python 클래스 상속 구조로 인코딩하는 Schema-aware Prompt와 추출 과정을 관계 식별, 엔티티 추출, 트리플 생성의 3단계로 나누는 Rationale-enhanced Generation을 도입했다. 실험 결과 CoNLL04 데이터셋에서 Vanilla Prompt 대비 성능이 크게 향상되었으며, 특히 중첩된 트리플 처리에서 코드 특화 Backbone 모델을 사용할 때 59.7%의 높은 정확도를 기록했다.

코드 구조를 활용하면 텍스트 직렬화 시 발생하는 구조 정보 손실을 최소화할 수 있다.

python
class Person(Entity):
    """person(Entity)"""
    def __init__(self, name: str):
        super().__init__(name)

class Work_for(Rel):
    """work_for(Rel)"""
    def __init__(self, head: Person, tail: Organization):
        super().__init__(head, "work_for", tail)

CodeKGC에서 스키마를 Python 클래스 상속 구조로 정의하여 LLM에 입력하는 예시

20:20

Wikidata 스키마 기반의 자동 온톨로지 구축

LLM의 자유 생성 결과가 기존 지식 체계와 충돌하는 문제를 해결하기 위해 Wikidata 스키마에 Grounding하는 4단계 파이프라인을 제시했다. 문서에서 핵심 정보를 묻는 Competency Question을 생성하고, 추출된 관계를 Wikidata의 표준 프로퍼티와 벡터 유사도 기반으로 매핑하여 OWL 온톨로지로 정형화하는 과정을 거친다. SciERC 데이터셋 실험에서 LLM Baseline의 점수가 0.07에 불과했던 반면, 제안 모델은 0.73을 기록하며 외부 스키마 준수를 통한 지식 정합성 확보의 우수성을 입증했다.

Wikidata는 전 세계적으로 널리 쓰이는 오픈 지식 베이스로, 표준화된 스키마를 제공한다.

31:49

생성 제어와 Grounding의 시사점

두 연구는 LLM의 자유로운 생성을 통제 가능한 대상에 결속시킨다는 공통된 철학을 공유하고 있다. CodeKGC는 코드라는 '표현 형식'에, 두 번째 논문은 Wikidata라는 '의미 체계'에 Grounding하여 각각 구조적 정확도와 상호 운용성을 확보했다. 결국 무엇에 Grounding하느냐가 LLM이 지식 추출을 얼마나 정교하게 수행할지를 결정하는 핵심 요소이며, 이는 Hallucination 방지와 지식 재사용성 측면에서 중요한 의미를 갖는다.

Grounding 전략은 LLM의 출력을 특정 도메인이나 표준 규격에 맞추는 데 필수적이다.

용어 해설

지식 그래프 구축(KGC)
비정형 텍스트에서 엔티티 간의 관계를 추출하여 (주어, 술어, 목적어) 형태의 트리플로 구조화하는 작업이다. 지식 그래프는 데이터 간의 의미적 연결을 시각화하고 기계가 이해할 수 있는 형태로 저장하여 복잡한 추론을 가능하게 한다.
온톨로지(Ontology)
데이터의 의미와 개념, 관계, 규칙을 명시적으로 정의한 설계도이다. 지식 그래프의 상위 레이어 역할을 하며, 정의된 클래스 간의 관계를 통해 명시되지 않은 새로운 사실을 도출하는 추론 능력을 부여한다.
생각의 사슬(CoT)
복잡한 문제를 해결하기 위해 중간 추론 단계를 명시적으로 생성하도록 유도하는 Prompting 기법이다. KGC 작업에서는 관계 식별, 엔티티 추출, 트리플 생성의 단계를 나누어 수행함으로써 최종 결과의 정확도를 높인다.
웹 온톨로지 언어(OWL)
웹상에서 온톨로지를 표현하기 위해 설계된 표준 언어이다. 데이터 간의 복잡한 관계와 제약 조건을 정의할 수 있어, 서로 다른 시스템 간의 지식 공유와 상호 운용성을 보장하는 데 필수적이다.
그라운딩(Grounding)
LLM의 자유로운 텍스트 생성을 특정 코드 구조나 외부 지식 베이스의 스키마와 같은 통제 가능한 대상에 결속시키는 과정이다. 이를 통해 모델의 Hallucination을 방지하고 출력 결과의 구조적 일관성을 확보한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.