섹션별 상세
음성 AI 구축은 WebRTC 연결, VAD, 재연결 로직 등 인프라 부담이 크다. Vision Agents는 이러한 복잡성을 추상화하여 개발자가 에이전트 로직에 집중하도록 돕는다.
python
async def create_agent(**kwargs) -> Agent:
agent = Agent(
edge=getstream.Edge(),
agent_user=User(name="Helpful Assistant", id="agent"),
instructions="You are a helpful voice assistant. Be concise and friendly.",
llm=aws.Realtime(
model="amazon.nova-2-sonic-v1:0",
region_name="us-east-1",
voice_id="matthew",
),
)
return agentVision Agents와 Amazon Nova 2 Sonic을 사용하여 음성 에이전트를 초기화하는 코드
Amazon Nova 2 Sonic은 별도의 STT/TTS 서비스 없이 오디오 입력에서 출력까지 직접 처리한다. 이는 지연 시간을 줄이고 자연스러운 대화 흐름을 유지하는 데 기여한다.
에이전트는 @llm.register_function 데코레이터를 통해 외부 API나 데이터베이스를 호출한다. 이는 단순 대화를 넘어 실시간 정보 조회나 워크플로 자동화를 가능하게 한다.
python
@agent.llm.register_function(
name="get_weather",
description="Get the current weather for a given city"
)
async def get_weather(location: str) -> Dict[str, Any]:
# In production, call a real weather API
return {
"city": location,
"temperature": 72,
"condition": "Sunny",
"humidity": "45%"
}에이전트가 외부 API를 호출할 수 있도록 함수를 등록하는 예시
Stream의 엣지 네트워크는 WebRTC 연결을 종단하고 오디오 트랙을 에이전트 워커로 전달한다. 이를 통해 전 세계 어디서나 500ms 미만의 지연 시간으로 대화가 가능하다.

용어 해설
- 웹 실시간 통신(WebRTC)
- — 웹 브라우저와 모바일 애플리케이션 간에 별도의 플러그인 없이 실시간으로 음성, 영상, 데이터를 주고받을 수 있게 하는 오픈 소스 프로젝트 및 API 표준이다.
- 음성 대 음성(Speech-to-Speech)
- — 텍스트 변환 과정을 거치지 않고 오디오 입력에서 직접 오디오 출력을 생성하는 모델 방식이다. 지연 시간을 줄이고 자연스러운 대화 흐름을 유지하는 데 유리하다.
- 음성 활동 감지(VAD)
- — 오디오 신호에서 사람의 음성이 포함된 구간을 실시간으로 식별하는 기술이다. 에이전트가 사용자의 발화를 감지하고 대화 순서를 제어하는 데 필수적이다.
- 함수 호출(Function Calling)
- — LLM이 대화 중 외부 API나 도구를 호출하여 구조화된 데이터를 얻거나 특정 작업을 수행하도록 하는 기능이다. 에이전트가 실시간 정보를 조회하거나 워크플로를 자동화할 때 사용된다.
기술
- Amazon Nova 2 Sonic
- Amazon Bedrock
- Vision Agents
- WebRTC
- Python
활용 사례
- 음성 인터페이스(차량, 물류, 현장 작업)
- 대규모 고객 지원 자동화
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 15.수집 2026. 05. 15.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.