본문으로 건너뛰기

실시간 음성 대화를 위한 스트리밍 이중 brain 메모리

VoiceMem은 schema–entity 정보 그래프와 감정 persona 그래프를 스트리밍 검색해 134ms 안에 top-5 메모리를 구성합니다.

용어 해설

양방향 음성 언어 모델(Duplex Speech Language Model)
사용자 발화와 시스템 응답이 겹치거나 스트리밍으로 이어지는 실시간 대화를 처리하는 음성 언어 모델입니다. VoiceMem은 이 모델에 정보·감정 메모리를 연결해 발화 중 검색을 진행합니다.
음성 활동 감지(Voice Activity Detection)
음성 신호에서 사용자가 말하는 구간과 침묵 구간을 구분하는 처리입니다. 논문은 일반적인 500ms VAD 대기 시간 안에 메모리 검색을 끝내 응답 지연을 추가하지 않는 구조를 사용합니다.
감정 귀속(Affective Attribution)
감정이 누구의 상태인지뿐 아니라 어떤 사람·사건·개념을 향하는지 연결하는 과정입니다. VoiceMem은 독립 persona 노드와 entity에 연결된 cross-entity 노드를 분리해 단기 반응과 장기 성향을 관리합니다.
스키마-엔터티 인덱스(Schema–Entity Index)
상위 schema로 의미 영역을 좁힌 뒤 하위 entity에서 구체적인 사람·사건·개념을 찾는 2단계 메모리 인덱스입니다. 검색 후보를 조밀하게 만들어 적은 top-k 예산에서도 관련 기억을 유지합니다.
검색 증강 생성(Retrieval-Augmented Generation)
현재 질의와 의미적으로 가까운 외부 기록을 검색한 뒤 그 결과를 언어 모델 입력에 넣어 응답을 만드는 방식입니다. VoiceMem은 일반적인 유사도 검색보다 정보·감정 그래프를 먼저 거쳐 후보 공간을 줄입니다.
온라인 온폴리시 증류(Online On-Policy Distillation)
학생 모델이 실제로 생성한 응답을 교사 모델과 비교하고 검증하면서 학습 데이터를 반복적으로 만드는 증류 방식입니다. VoiceMem은 memory world 구성, black-box 교정, 검증, SFT Update를 순환해 ChatMem-400K를 구축합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.