TL;DR
데이터 생성량이 커질수록 수작업 메타데이터 표준화가 분석과 데이터 공유를 막는 병목이 되므로, AWS 기반 시스템이 스키마 정렬과 필드 값 검증을 자동화합니다. Amazon Bedrock LLM은 열 구조의 의미적 정렬과 복잡한 오류의 fallback 처리를 맡고, Embedding 유사도, Fuzzy matching, TF-IDF와 k-nearest neighbors, PMI가 일상적인 보정을 단계적으로 처리합니다. Human-in-the-Loop 방식에서는 연구자가 추천을 승인하거나 수정한 뒤 재검증하며, 대규모 데이터셋에서는 Model Context Protocol 기반 metadata agent가 오류 조회와 수정 재제출을 자동화합니다. 실제 운영에서는 변경 이력, 접근 제어, Amazon Bedrock Guardrails, 자율 작업 범위를 함께 관리해야 데이터 무결성과 책임성을 유지할 수 있습니다.
섹션별 상세

git clone https://github.com/aws-samples/sample-intelligent-metadata-harmonization.git
cd metadata-harmonization
# Create and activate Python virtual environment
make createPythonEnvironment
source .venv/bin/activate
# Install all dependencies (Python packages, TypeScript packages, CDK, frontend)
make installGitHub 저장소를 복제한 뒤 Python 가상 환경을 만들고 Python, TypeScript, AWS CDK, 프런트엔드 의존성을 설치합니다.
appName: "metadata-harmonization-app"
env: "dev"
dev:
profile: "your-aws-profile"
deploymentName: "metadata-harmonization-dev"
accountNumber: "123456789012" # Your 12-digit AWS account number
region: "us-east-1"
deploymentStage: "dev"
removalPolicy: "destroy"
logLevel: "INFO"
targetPlatform: "linux/amd64"AWS 계정, 리전, 배포 단계와 리소스 삭제 정책을 config.yaml에 설정합니다.
# First-time setup: prepare your AWS account for CDK
make bootstrap
# Deploy all AWS resources
make deployAWS CDK 계정을 초기화한 뒤 컨테이너 이미지와 클라우드 인프라를 배포합니다.
uv run metadata-agent validate data/synthetic_dataset/simple_test.csv --interactive실행 중인 API에 MCP로 연결된 metadata agent가 CSV를 검증하고 오류 보고서와 추천을 바탕으로 수정 작업을 수행합니다.

용어 해설
- 메타데이터 조화(Metadata Harmonization)
- — 서로 다른 출처의 메타데이터에서 라벨, 식별자, 형식을 공통 기준에 맞추는 과정입니다. 스키마와 필드 값을 비교하고 불일치를 수정해 데이터셋 간 상호운용성과 분석 가능성을 높입니다. 이 글에서는 규칙, Embedding, LLM을 결합해 반복적인 정규화 작업을 자동화합니다.
- 스키마 정렬(Schema Alignment)
- — 원본 데이터의 열 구조를 목표 스키마와 비교해 이름, 개수, 분할 및 결합 관계를 맞추는 절차입니다. 단순한 문자열 유사도만으로 처리하기 어려운 동의어와 문맥을 LLM이 보완합니다. 정렬이 끝나야 필드 값 검증과 후속 통합이 안정적으로 진행됩니다.
- TF-IDF
- — 문서나 행에서 특정 단어가 얼마나 중요한지 나타내는 텍스트 특성 표현입니다. 전체 데이터에서 흔한 단어의 가중치는 낮추고 특정 행에 집중된 단어의 가중치는 높여 행 간 유사도 계산에 사용합니다. 이 시스템에서는 구조가 비슷한 메타데이터 행을 찾는 입력 벡터를 구성합니다.
- 점별 상호정보량(Pointwise Mutual Information)
- — 두 값이 독립적으로 나타날 때보다 함께 등장하는 정도를 측정하는 통계량입니다. 메타데이터의 열 조합에서 특정 값들이 자연스럽게 함께 나타나는 패턴을 찾아 필드 보정 후보를 좁힙니다. 글에서는 유사한 행의 가중 투표 결과와 PMI 신호를 결합합니다.
- Human-in-the-Loop
- — 자동화 시스템이 추천을 생성하더라도 최종 변경 권한을 사람이 보유하는 운영 방식입니다. 사용자는 오류가 표시된 필드를 확인하고 AI 추천을 수락, 수정 또는 거부한 뒤 데이터를 다시 검증합니다. 연구자의 도메인 지식과 변경 승인 절차를 유지하면서 반복 작업을 줄이는 데 중요합니다.
- Model Context Protocol
- — Agent가 외부 서비스와 전문 도구에 정해진 방식으로 접근하도록 연결하는 프로토콜입니다. 이 구현에서는 metadata agent가 MCP를 통해 원격 처리 서비스, 스키마 검증기, Embedding 기반 유사도 모듈을 호출합니다. Agent는 오류 보고서와 추천을 가져와 수정 후 재제출하는 순환 작업을 수행합니다.
기술
- Amazon Bedrock
- Amazon S3
- Amazon DynamoDB
- Amazon Cognito
- Amazon ECS
- Amazon Fargate
- Amazon VPC
- AWS IAM
- AWS CloudFormation
- Amazon ECR
- Amazon CloudWatch
- AWS CDK
- Amazon Titan
- TF-IDF
- Pointwise Mutual Information
- Levenshtein distance
- Model Context Protocol
- Docker
- Node.js
- Python
- Next.js
- uv
활용 사례
- Biomedical 연구 데이터의 메타데이터 표준화
- 서로 다른 기관에서 수집한 데이터셋의 스키마 정렬
- 대량 레코드의 필드 오류 검증과 수정 추천
- 조직별 온톨로지와 통제 어휘를 반영한 메타데이터 보정
- 연구 데이터 공유를 위한 변경 이력과 승인 관리
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.