본문으로 건너뛰기

Stream Vision Agents와 Amazon Nova 2 Sonic을 활용한 실시간 음성 에이전트 구축

Stream의 Vision Agents 프레임워크와 Amazon Nova 2 Sonic을 결합하여 지연 시간이 짧고 자연스러운 실시간 음성 AI 에이전트를 구축하는 방법을 제시한다.

섹션별 상세

01
음성 AI 구축은 WebRTC 연결, VAD, 재연결 로직 등 인프라 부담이 크다. Vision Agents는 이러한 복잡성을 추상화하여 개발자가 에이전트 로직에 집중하도록 돕는다.
python
async def create_agent(**kwargs) -> Agent:
    agent = Agent(
        edge=getstream.Edge(),
        agent_user=User(name="Helpful Assistant", id="agent"),
        instructions="You are a helpful voice assistant. Be concise and friendly.",
        llm=aws.Realtime(
            model="amazon.nova-2-sonic-v1:0",
            region_name="us-east-1",
            voice_id="matthew",
        ),
    )
    return agent

Vision Agents와 Amazon Nova 2 Sonic을 사용하여 음성 에이전트를 초기화하는 코드

02
Amazon Nova 2 Sonic은 별도의 STT/TTS 서비스 없이 오디오 입력에서 출력까지 직접 처리한다. 이는 지연 시간을 줄이고 자연스러운 대화 흐름을 유지하는 데 기여한다.
03
에이전트는 @llm.register_function 데코레이터를 통해 외부 API나 데이터베이스를 호출한다. 이는 단순 대화를 넘어 실시간 정보 조회나 워크플로 자동화를 가능하게 한다.
python
@agent.llm.register_function(
    name="get_weather",
    description="Get the current weather for a given city"
)
async def get_weather(location: str) -> Dict[str, Any]:
    # In production, call a real weather API
    return {
        "city": location,
        "temperature": 72,
        "condition": "Sunny",
        "humidity": "45%"
    }

에이전트가 외부 API를 호출할 수 있도록 함수를 등록하는 예시

04
Stream의 엣지 네트워크는 WebRTC 연결을 종단하고 오디오 트랙을 에이전트 워커로 전달한다. 이를 통해 전 세계 어디서나 500ms 미만의 지연 시간으로 대화가 가능하다.
Stream 엣지 네트워크와 Amazon Bedrock을 통한 음성 에이전트 아키텍처 다이어그램
Diagram사용자의 오디오가 WebRTC를 통해 Stream SFU로 전달되고, Vision Agent 워커를 거쳐 Amazon Bedrock의 Nova 2 Sonic 모델로 처리되는 흐름을 보여준다. 에이전트가 도구(Tools)를 사용하여 지식 베이스를 조회하는 과정까지 포함하여 전체 시스템의 데이터 흐름을 명확히 설명한다.

용어 해설

웹 실시간 통신(WebRTC)
웹 브라우저와 모바일 애플리케이션 간에 별도의 플러그인 없이 실시간으로 음성, 영상, 데이터를 주고받을 수 있게 하는 오픈 소스 프로젝트 및 API 표준이다.
음성 대 음성(Speech-to-Speech)
텍스트 변환 과정을 거치지 않고 오디오 입력에서 직접 오디오 출력을 생성하는 모델 방식이다. 지연 시간을 줄이고 자연스러운 대화 흐름을 유지하는 데 유리하다.
음성 활동 감지(VAD)
오디오 신호에서 사람의 음성이 포함된 구간을 실시간으로 식별하는 기술이다. 에이전트가 사용자의 발화를 감지하고 대화 순서를 제어하는 데 필수적이다.
함수 호출(Function Calling)
LLM이 대화 중 외부 API나 도구를 호출하여 구조화된 데이터를 얻거나 특정 작업을 수행하도록 하는 기능이다. 에이전트가 실시간 정보를 조회하거나 워크플로를 자동화할 때 사용된다.

기술

  • Amazon Nova 2 Sonic
  • Amazon Bedrock
  • Vision Agents
  • WebRTC
  • Python

활용 사례

  • 음성 인터페이스(차량, 물류, 현장 작업)
  • 대규모 고객 지원 자동화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 15.수집 2026. 05. 15.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.