TL;DR
Loka는 음성을 텍스트로 변환하는 기존 3단계 파이프라인의 지연과 정보 손실 문제를 해결하기 위해 Amazon Nova 2 Sonic을 활용한 speech-to-speech 아키텍처를 도입했다. 이 접근법은 음성 신호의 억양과 맥락을 보존하면서 입력 오디오를 모델이 직접 이해하고 음성으로 응답을 생성하도록 설계되어 대화의 자연스러움과 처리 효율을 동시에 개선한다.
평가 결과 Nova 2 Sonic은 Big Bench Audio에서 speech reasoning 87.0을 기록했으며 Time to First Audio는 1.39초로 제시되어 기존 텍스트 기반 파이프라인보다 빠른 응답을 제공하고 비용은 시간당 약 0.27달러로 비교적 낮게 보고됐다. 프롬프트 템플릿 반복 개선을 통해 Judge 점수가 베이스라인 2.7에서 Prompt v2의 3.8까지 상승했고, 실제 고객 페르소나 테스트에서 평균 점수가 4.0으로 나타나 실무 적용성이 입증되었다.
엔지니어링 관점에서는 LiveKit을 전송 계층으로, AWS Fargate·ECS·ElastiCache·RDS를 조합한 서버리스·이벤트 기반 아키텍처로 확장성과 회복력을 확보했고 Amazon Bedrock을 통해 Nova 2 Sonic을 호출하는 방식이 사용됐다. 다만 긴 산만한 발화나 고령자 페르소나에서 완성도와 오류 복구가 낮아지는 한계가 관찰되어 추가적인 프롬프트 엔지니어링과 튜닝이 필요하다.
섹션별 상세



- Amazon Nova 2 Sonic은 Big Bench Audio에서 speech reasoning 87.0을 기록했다. — 본문의 벤치마크 결과 및 Figure 1(음성 추론 점수 비교)
- Nova 2 Sonic의 Time to First Audio는 1.39초로 보고되어 대화 중 barge-in을 지원하는 수준의 낮은 지연을 제공한다. — 본문의 지연 측정치 및 Figure 2(최초 음성 출력 시간 비교)
- Nova 2 Sonic의 입력 오디오 기준 비용은 시간당 약 0.27달러로 제시되어 다른 실시간 모델 대비 비용 효율성이 높게 보고되었다. — 본문의 비용 비교 및 Figure 3(시간당 오디오 비용 비교)
- 프롬프트 반복 개선으로 모델의 전체 Judge 점수는 초기 2.7에서 Prompt v2에서 3.8로 상승했고 세부 항목들이 전반적으로 개선되었다. — 프롬프트 개선 전후 표(Table 2)와 문단의 점수 변화 설명

용어 해설
- 음성-대-음성 모델(Speech-to-Speech)
- — 오디오 입력을 텍스트로 변환하지 않고 직접 이해와 생성까지 수행하는 모델 아키텍처로, 입력 음성을 인코딩해 내부에서 의미를 추론하고 바로 음성 출력을 생성함으로써 지연을 줄이고 억양·어조 같은 음성 신호의 정보를 보존한다.
- Big Bench Audio
- — 음성 입력에 대한 추론 능력을 측정하는 벤치마크로, 음성 데이터에서 의미를 추론해 답변·행동을 요구하는 문제들로 구성되어 모델의 음성 기반 reasoning 성능을 수치화한다.
- 최초 음성 출력 시간(Time to First Audio)
- — 사용자가 말한 후 모델이 처음 음성 토큰을 생성하여 들려줄 때까지 걸리는 시간으로, 대화의 자연스러움과 barge-in(대화 중 끼어들기) 가능성을 결정하는 핵심 지연(metric)이다.
- 프롬프트 템플릿(Prompt Template)
- — 반복 사용하는 지시문을 변수화해 재사용 가능하도록 만든 문자열 구조로, 서비스별 고유 정보를 런타임에 주입해 동일한 기본 지침을 여러 클라이언트에 일관되게 적용하고 거버넌스와 버전관리를 가능하게 한다.
- 중간 끼어들기(Barge-in)
- — 사용자가 에이전트의 발화 도중에 말을 끊고 입력할 때 시스템이 즉각 반응하는 동작으로, 낮은 지연과 스트리밍 음성 생성이 결합되어야 자연스러운 대화 흐름을 유지할 수 있다.
기술
- Amazon Nova 2 Sonic
- Amazon Bedrock
- LiveKit
- AWS Fargate
- Amazon ECS
- Amazon RDS
- Amazon ElastiCache
- Langfuse
- Python
- WebRTC
- SIP
활용 사례
- 자동차 딜러의 전화 상담 자동화
- 여행 상담과 일정 기획의 자연어 음성 인터페이스
- 교육용 튜터의 실시간 말투 적응형 학습 지원
- 의료 예약과 보험 질문을 포함한 복잡한 스케줄링
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


