본문으로 건너뛰기

LangGraph와 Azure를 활용한 멀티모달 비디오 규정 준수 자동화 파이프라인 구축

LangGraph와 Azure AI 서비스를 결합하여 비디오의 음성 및 텍스트 데이터를 분석하고 규정 준수 여부를 자동으로 판별하는 엔드투엔드 RAG 시스템 구축 가이드이다.

챕터별 상세

00:00

프로젝트 개요 및 아키텍처 설계

LangGraph를 사용한 에이전틱 워크플로 설계 방식을 정의했다. Azure Video Indexer로 멀티모달 데이터를 추출하고 Azure AI Search를 벡터 DB로 활용하는 RAG 구조를 채택했다. 전체 시스템은 비디오 입력부터 최종 JSON 보고서 생성까지 자동화되는 구조이다.
17:35

Azure 서비스 설정 및 환경 구성

Azure Blob Storage, Video Indexer, AI Search, OpenAI 서비스를 생성하고 API 키를 설정했다. 각 서비스가 파이프라인에서 담당하는 역할인 데이터 저장, 특징 추출, 검색, 추론 기능을 정의했다. .env 파일을 통해 환경 변수를 관리하며 보안성과 유연성을 확보했다.
24:38

LangGraph 상태 관리 및 노드 구현

VideoAuditState 클래스를 통해 비디오 URL, 트랜스크립트, OCR 텍스트 등을 포함하는 전역 상태 객체를 정의했다. index_video_node는 비디오를 다운로드하고 인덱싱하며, audio_content_node는 규정 준수 여부를 판단한다. 각 노드는 상태를 입력받아 처리 후 업데이트된 상태를 반환하여 데이터 흐름을 유지한다.
python
class VideoAuditState(TypedDict):
    video_url: str
    video_id: str
    local_file_path: Optional[str]
    video_metadata: Dict[str, Any]
    transcript: Optional[str]
    ocr_text: List[str]
    compliance_results: Annotated[List[ComplianceIssue], operator.add]
    final_status: str
    final_report: str
    errors: Annotated[List[str], operator.add]

LangGraph 워크플로 전체에서 공유되고 업데이트되는 비디오 감사 시스템의 전역 상태 구조 정의

25:53

멀티모달 데이터 추출 및 Video Indexer 연동

비디오에서 음성 트랜스크립트와 화면상의 텍스트(OCR)를 추출하는 로직을 구현했다. Azure Video Indexer API를 호출하여 비정형 비디오 데이터를 텍스트 기반의 정형 데이터로 변환하는 과정을 자동화했다. 추출된 데이터는 이후 규정 대조를 위한 핵심 컨텍스트로 활용된다.
27:50

규정 준수 감사 및 RAG 로직 구현

Azure AI Search에 저장된 규정 문서에서 관련 조항을 검색하는 하이브리드 검색을 구현했다. GPT-4o 모델이 추출된 비디오 컨텍스트와 검색된 규정 조항을 비교 분석하여 위반 사항을 탐지한다. 최종 결과는 위반 항목, 심각도, 설명을 포함한 구조화된 JSON 형식으로 생성된다.
29:30

관측성 확보 및 모니터링 설정

LangSmith를 연동하여 LLM 호출의 전체 트레이스를 시각화하고 디버깅하는 과정을 구현했다. Azure Application Insights를 통해 API 호출 성공률, 지연 시간, 에러 로그를 실시간으로 모니터링한다. 이를 통해 프로덕션 환경에서 발생할 수 있는 병목 현상과 오류를 즉각적으로 파악할 수 있다.

용어 해설

랭그래프(LangGraph)
LangChain 생태계의 일부로, 순환 그래프 구조를 통해 복잡한 상태 기반 AI 에이전트 워크플로를 설계하고 관리할 수 있게 해주는 라이브러리이다. 에이전트의 상태를 유지하면서 단계별 실행을 제어할 수 있어 정교한 논리 구조 구현에 필수적이다.
애저 비디오 인덱서(Azure Video Indexer)
비디오 및 오디오 콘텐츠에서 트랜스크립트, OCR, 얼굴 인식, 감정 분석 등 다양한 메타데이터를 자동으로 추출하는 클라우드 기반 AI 서비스이다. 비정형 비디오 데이터를 검색 및 분석 가능한 정형 데이터로 변환하는 역할을 한다.
랭스미스(LangSmith)
LLM 애플리케이션의 개발부터 배포까지 전 과정을 지원하는 플랫폼으로, 특히 복잡한 체인이나 에이전트의 실행 과정을 단계별로 추적(Tracing)하고 평가하는 데 특화되어 있다. 워크플로 최적화와 디버깅 효율성을 극대화한다.
멀티모달 검색 증강 생성(Multimodal RAG)
텍스트뿐만 아니라 이미지, 오디오, 비디오 등 다양한 형태의 데이터에서 정보를 검색하여 LLM의 답변 생성에 활용하는 기술이다. 비디오의 시각적 요소와 음성 요소를 모두 고려하여 더 정확한 맥락 파악이 가능하다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 09.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.