섹션별 상세
음성 대화의 자연스러움을 결정하는 지연 시간 문제를 해결하기 위해 실시간 스트리밍 아키텍처를 도입했다. Live API는 입력을 기다린 후 응답하는 방식 대신 연속적인 입출력을 처리하여 대화의 흐름이 끊기지 않게 한다. 내부 테스트 결과 Gemini 3.1 Flash Live는 이전 모델 대비 응답 속도가 비약적으로 향상됐다. 실제 대화에서 인간이 느끼는 어색한 멈춤 현상을 최소화하여 사용자 경험을 개선했다.


사용자의 개입과 감정 변화에 유연하게 대응할 수 있는 대화 제어 기능을 강화했다. Barge-in 기능을 통해 모델의 답변 도중 사용자가 말을 끊고 끼어드는 것이 가능하며, 모델은 이를 즉각 인식하고 반응을 조절한다. 또한 사용자의 표현 방식에 따라 톤과 스타일을 바꾸는 감성 대화 기능을 지원한다. 이를 통해 정해진 스크립트를 읽는 듯한 느낌을 줄이고 상황에 맞는 역동적인 상호작용을 구현했다.
단순한 대화를 넘어 실질적인 업무를 수행할 수 있도록 도구 활용 및 멀티모달 능력을 확장했다. 70개 이상의 언어를 지원하며 구글 검색 및 함수 호출을 통해 외부 정보를 실시간으로 가져오거나 액션을 취할 수 있다. 음성뿐만 아니라 초당 1프레임의 JPEG 이미지 입력을 처리하여 시각적 문맥을 이해하는 어시스턴트 제작이 가능하다. 이는 AI가 보고 듣고 행동하는 통합적인 에이전트로 진화했음을 의미한다.
근거
- Gemini 3.1 Flash Live는 70개 이상의 언어를 지원하며 실시간 멀티모달 대화가 가능하다. — 본문 'Stronger Multilingual and Tool Capabilities' 섹션
개발자 편의성을 위해 실시간 전사 기능과 유연한 배포 옵션을 제공한다. 대화의 양방향 텍스트 기록을 자동으로 생성하여 디버깅, 성능 튜닝, 접근성 향상에 활용할 수 있도록 했다. 서버 간 연결과 클라이언트-서버 직접 연결 방식을 모두 지원하여 서비스 환경에 맞는 최적의 아키텍처 선택이 가능하다. 특히 WebSocket 프로토콜을 사용해 상태를 유지하며 데이터를 주고받는 구조를 채택했다.
기술
- Gemini 3.1 Flash Live
- Gemini API
- Google AI Studio
- WebSocket
- Google Search
활용 사례
- 실시간 음성 고객 상담원
- 시각 정보를 결합한 개인 비서
- 실시간 통번역 서비스
- 음성 기반 데이터 분석 도구
언급된 리소스
DemoGoogle AI Studio
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 31.수집 2026. 03. 31.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
