본문으로 건너뛰기
DeepMind Blog조회 1

Gemini 3.1 Flash Live: 더 자연스럽고 신뢰할 수 있는 오디오 AI의 등장

구글이 실시간 대화에 최적화된 고품질 오디오 모델 Gemini 3.1 Flash Live를 출시하여 지연 시간을 단축하고 복잡한 작업 수행 능력을 강화했다.

섹션별 상세

실시간 대화의 병목인 지연 시간과 부자연스러운 리듬 문제를 해결하기 위해 Gemini 3.1 Flash Live가 개발됐다. 이 모델은 오디오 데이터를 직접 처리하여 톤과 뉘앙스를 이해하고, 대화의 흐름을 이전 모델보다 2배 더 길게 유지하며 응답한다. ComplexFuncBench Audio 테스트에서 90.8%를 기록하며 다단계 함수 호출과 제약 조건 준수 능력을 증명했다. 이를 통해 개발자는 실제 환경의 소음이나 중단 상황에서도 안정적으로 작동하는 음성 에이전트를 구현할 수 있다.
ComplexFuncBench Audio 벤치마크 결과 그래프
ChartGemini 3.1 Flash Live가 다단계 함수 호출 및 제약 조건 준수 테스트에서 90.8%의 높은 점수를 기록했음을 보여준다. 이는 이전 모델 대비 복잡한 작업 수행 능력이 비약적으로 향상되었음을 시각적으로 증명한다.
Audio MultiChallenge 벤치마크 성능 비교 차트
Chart실제 환경의 소음과 대화 중단 상황을 가정한 테스트에서 Gemini 3.1 Flash Live가 36.1%의 점수로 선두를 달리고 있음을 나타낸다. 복잡한 지시 이행과 장기 추론 능력이 실제 오디오 환경에서 어떻게 발휘되는지 보여준다.
음성 AI의 안전성과 신뢰성 확보를 위해 모든 출력 오디오에 SynthID 워터마킹 기술을 적용했다. SynthID는 오디오 신호 내부에 감지 불가능한 패턴을 직접 삽입하여 AI 생성 콘텐츠 여부를 식별할 수 있게 하는 기술이다. 이를 통해 딥페이크나 허위 정보 확산을 방지하면서도 오디오 품질에는 영향을 주지 않는 보안 계층을 제공한다. 전 세계 200개 이상의 국가에서 다국어 지원과 함께 안전한 실시간 멀티모달 대화 환경을 구축하는 데 기여한다.

용어 해설

지연 시간(Latency)
데이터가 시스템에 입력되어 처리가 완료된 후 출력이 나오기까지 걸리는 시간이다. 실시간 음성 대화에서는 지연 시간이 짧을수록 대화의 흐름이 끊기지 않고 자연스럽게 느껴지며, 이 모델은 이를 최소화하는 데 집중했다.
워터마킹(Watermarking)
디지털 콘텐츠에 저작권 정보나 생성 출처를 식별할 수 있는 신호를 삽입하는 기술이다. Gemini 3.1 Flash Live는 SynthID를 통해 오디오 신호에 감지 불가능한 패턴을 심어 AI 생성물임을 증명하고 오남용을 방지한다.
함수 호출(Function Calling)
LLM이 외부 도구나 API를 실행하기 위해 필요한 인자값을 생성하고 실행을 요청하는 능력이다. 복잡한 작업을 수행하는 음성 에이전트가 사용자의 명령을 실제 시스템 동작으로 연결하는 핵심 메커니즘이다.
멀티모달(Multimodal)
텍스트, 이미지, 오디오 등 서로 다른 형태의 데이터를 동시에 이해하고 처리하는 기술이다. 이 모델은 오디오를 기본으로 하면서도 검색 및 시각적 정보와 결합하여 더 풍부한 상호작용을 제공한다.

기술

  • Gemini 3.1 Flash Live
  • SynthID
  • Google AI Studio
  • Gemini Live API

활용 사례

  • 실시간 고객 상담 에이전트
  • 음성 기반 코딩 보조
  • 다국어 실시간 통번역
  • 인터랙티브 교육 도구

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 03. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.