본문으로 건너뛰기
LangChain조회 1

Gemini Live와 LangChain Deep Agents를 활용한 음성 리서치 에이전트 구축

Gemini Live의 실시간 음성 반응성과 LangChain Deep Agents의 심층 추론을 비동기 방식으로 결합하여 지연 시간 문제를 해결한 음성 에이전트 아키텍처를 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

음성 AI 구축 시 발생하는 저지연 대화와 심층 추론 능력 사이의 트레이드오프를 해결하기 위해 Gemini Live와 LangChain Deep Agents를 결합한 새로운 아키텍처가 제시됐다. Gemini Live는 사용자와의 실시간 음성 인터페이스를 담당하여 즉각적인 반응성을 제공하고, 시간이 오래 걸리는 복잡한 리서치 작업은 백그라운드에서 Deep Agents가 수행하는 이원화 구조를 채택했다. 핵심 기술은 비동기 도구 승인(Async Tool Acknowledgement) 메커니즘으로, 에이전트가 리서치를 시작하자마자 사용자에게 진행 중임을 음성으로 알림으로써 모델이 결과가 나올 때까지 멈춰있는 블로킹 문제를 해결했다. 이를 통해 사용자는 수 분이 소요되는 심층 검색 결과가 준비되는 동안에도 AI와 자연스러운 대화를 지속할 수 있으며, 최종적으로는 LangSmith를 통해 복잡한 오케스트레이션 과정을 투명하게 모니터링할 수 있다.

챕터별 상세

0:00

음성 에이전트 구축의 핵심 트레이드오프

음성 에이전트 개발자는 자연스러운 대화를 위한 낮은 지연 시간(Latency)과 정확한 정보를 위한 심층 추론 능력 사이에서 선택을 강요받는다. 기존 방식으로는 빠른 응답을 위해 추론 깊이를 포기하거나, 정확한 정보를 위해 긴 침묵 시간을 감수해야 하는 문제가 있었다. 발표자는 이 두 마리 토끼를 모두 잡기 위한 새로운 접근 방식을 제안했다.
1:00

샌드위치 아키텍처와 S2S 모델의 한계

STT, LLM, TTS를 순차적으로 연결하는 샌드위치 아키텍처는 각 단계의 처리 시간 합산으로 인해 지연 시간이 길어지는 구조적 한계가 있다. 반면 Gemini Live와 같은 Speech-to-Speech(S2S) 모델은 지연 시간은 매우 낮지만, 수 분이 걸리는 복잡한 리서치 작업을 직접 수행하기에는 모델의 컨텍스트 유지와 실시간성 확보에 어려움이 있다.
1:38

음성 리서치 에이전트 아키텍처 소개

Gemini Live를 사용자 인터페이스(UI)로 활용하고, LangChain의 Deep Agents를 백그라운드 작업자로 활용하는 하이브리드 구조를 도입했다. Gemini Live는 사용자의 음성을 실시간으로 처리하며 대화를 주도하고, 복잡한 검색이나 분석이 필요할 때만 Deep Agents에게 작업을 위임한다. 이 방식은 대화의 흐름을 유지하면서도 고품질의 리서치 결과를 얻을 수 있게 한다.
2:22

실전 데모: 레딧 케이크 레시피 검색

사용자가 레딧에서 특정 케이크 레시피를 찾아달라고 요청하자, Gemini Live가 즉시 리서치를 시작하겠다고 응답하며 Deep Agent를 호출했다. Deep Agent가 여러 웹페이지를 검색하고 정보를 취합하는 수 초 동안 Gemini Live는 사용자에게 진행 상황을 말하며 대화를 이어갔다. 리서치가 완료되자 Deep Agent의 결과가 Gemini Live로 전달되어 사용자에게 상세한 레시피를 음성으로 브리핑했다.
4:30

비동기 도구 승인을 통한 블로킹 해결

전통적인 도구 호출 방식은 결과가 반환될 때까지 모델이 대기 상태(Blocking)에 빠지는 문제가 있었다. 이를 해결하기 위해 도구 실행 요청을 받자마자 즉시 승인(Acknowledgement) 신호를 보내 모델을 해방시키는 비동기 패턴을 적용했다. 모델은 승인을 받은 직후 사용자에게 '찾아보고 있습니다'와 같은 피드백을 줄 수 있으며, 실제 결과는 나중에 별도의 이벤트로 주입된다.

비동기 처리는 시스템의 반응성을 높이는 핵심 소프트웨어 공학 기법이다.

4:55

코드 구현 및 LangSmith 트레이스 분석

Google ADK(Agent Development Kit)를 사용하여 Gemini Live와 LangChain 에이전트를 연결하는 코드를 분석했다. LangSmith를 통해 확인한 트레이스에서는 Gemini Live의 음성 세션과 Deep Agent의 리서치 세션이 어떻게 병렬로 작동하는지 시각적으로 확인 가능하다. 특히 Deep Agent가 수행한 수많은 검색 단계와 최종 요약 과정이 메인 대화 흐름에 어떻게 통합되는지 상세히 보여주었다.

LangSmith는 복잡한 에이전트의 내부 동작을 가시화하여 디버깅을 돕는 도구이다.

용어 해설

샌드위치 아키텍처(Sandwich Architecture)
STT(음성-텍스트 변환), LLM(추론), TTS(텍스트-음성 변환)를 순차적으로 연결하는 전통적인 음성 AI 구조이다. 각 단계의 처리가 끝날 때까지 다음 단계가 대기해야 하므로 전체적인 지연 시간(Latency)이 길어지는 단점이 있다.
음성 간 직접 변환(Speech-to-Speech)
중간 텍스트 변환 과정 없이 음성 입력을 직접 처리하여 음성으로 출력하는 모델 방식이다. 샌드위치 아키텍처보다 훨씬 낮은 지연 시간을 제공하여 자연스러운 대화가 가능하지만, 복잡하고 긴 추론 작업에는 한계가 있다.
딥 에이전트(Deep Agents)
단순한 답변을 넘어 웹 검색, 데이터 분석 등 여러 단계의 복잡한 도구 사용과 추론을 수행하는 LangChain의 고성능 에이전트이다. 실행 시간이 수 분 이상 걸릴 수 있는 장기 실행 작업(Long-running tasks)을 처리하는 데 특화되어 있다.
비동기 도구 승인(Async Tool Acknowledgement)
도구 실행이 완료될 때까지 기다리지 않고, 실행 요청을 받았음을 즉시 확인(Ack)해주는 메커니즘이다. 이를 통해 음성 모델은 백그라운드에서 작업이 진행되는 동안 사용자에게 진행 상황을 알리거나 다른 대화를 계속 이어갈 수 있다.
랭스미스(LangSmith)
LLM 애플리케이션의 디버깅, 테스트, 평가 및 모니터링을 지원하는 플랫폼이다. 복잡한 에이전트의 실행 경로(Trace)를 시각화하여 어떤 단계에서 지연이나 오류가 발생하는지 상세히 분석할 수 있게 해준다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 01.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.