챕터별 상세
00:00
기존 선형 청킹의 한계와 문맥 손실 문제
문서를 단순히 일정한 길이로 자르는 기존의 선형 청킹 방식은 제목과 해당 섹션의 설명을 분리시키는 문제를 야기한다. 이로 인해 검색 결과에서 특정 텍스트가 추출되더라도 그 상위 맥락을 알 수 없어 LLM의 답변 품질이 저하된다. 데이터 간의 논리적 연결 고리가 끊어지는 현상은 복잡한 구조를 가진 문서에서 특히 심각하게 나타난다.
15:20
POMA AI의 계층적 파싱과 Chunksets 개념
POMA AI는 문서의 내부 계층 구조를 분석하여 섹션 간의 관계를 재구성하는 방식을 채택했다. 이를 통해 생성된 'Chunksets'는 각 텍스트 조각이 문서 내에서 어떤 위치에 있는지, 어떤 상위 항목에 속하는지에 대한 정보를 포함한다. AI는 이 구조화된 데이터를 통해 단순한 키워드 매칭을 넘어 섹션 간의 유기적인 흐름을 이해하게 된다.
Chunksets는 POMA AI에서 정의한 논리적 데이터 단위로, 계층 구조 정보가 포함된 청크들의 집합이다.
35:45
Qdrant 고차원 공간을 통한 구조적 데이터 분석
구조화된 Chunksets는 Qdrant 벡터 데이터베이스의 고차원 공간에 저장되어 정밀한 분석의 대상이 된다. Qdrant는 이러한 파편화된 정보들이 어떻게 연결되는지 분석할 수 있는 강력한 검색 엔진 역할을 수행한다. 단순히 질문에 답하는 수준을 넘어 정보의 아키텍처 자체를 문맥화하여 검색의 질을 한 단계 높이는 아키텍처를 구축했다.
Qdrant는 대규모 벡터 데이터를 효율적으로 처리하고 유사도 검색을 수행하는 오픈소스 벡터 데이터베이스이다.
용어 해설
- 청킹(Chunking)
- — 긴 텍스트 데이터를 LLM이 처리하기 쉬운 작은 단위로 나누는 과정이다. 단순히 글자 수나 토큰 수로 자르는 방식이 일반적이지만, 문맥이 끊기는 문제가 발생할 수 있다.
- 계층적 청킹(Hierarchical Chunking)
- — 문서의 제목, 소제목, 본문 등의 구조적 위계를 유지하며 데이터를 나누는 기법이다. 섹션 간의 논리적 관계를 보존하여 검색 시 더 정확한 문맥을 제공한다.
- 벡터 데이터베이스(Vector Database)
- — 데이터를 수치화된 벡터 형태로 저장하고 유사도 기반 검색을 수행하는 저장소이다. 고차원 공간에서 데이터 간의 의미적 거리를 계산하여 관련 정보를 빠르게 찾아낸다.
언급된 리소스
GitHubQdrant 벡터 데이터베이스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 12.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.