용어 해설
- 양방향 음성 언어 모델(Duplex Speech Language Model)
- — 사용자 발화와 시스템 응답이 겹치거나 스트리밍으로 이어지는 실시간 대화를 처리하는 음성 언어 모델입니다. VoiceMem은 이 모델에 정보·감정 메모리를 연결해 발화 중 검색을 진행합니다.
- 음성 활동 감지(Voice Activity Detection)
- — 음성 신호에서 사용자가 말하는 구간과 침묵 구간을 구분하는 처리입니다. 논문은 일반적인 500ms VAD 대기 시간 안에 메모리 검색을 끝내 응답 지연을 추가하지 않는 구조를 사용합니다.
- 감정 귀속(Affective Attribution)
- — 감정이 누구의 상태인지뿐 아니라 어떤 사람·사건·개념을 향하는지 연결하는 과정입니다. VoiceMem은 독립 persona 노드와 entity에 연결된 cross-entity 노드를 분리해 단기 반응과 장기 성향을 관리합니다.
- 스키마-엔터티 인덱스(Schema–Entity Index)
- — 상위 schema로 의미 영역을 좁힌 뒤 하위 entity에서 구체적인 사람·사건·개념을 찾는 2단계 메모리 인덱스입니다. 검색 후보를 조밀하게 만들어 적은 top-k 예산에서도 관련 기억을 유지합니다.
- 검색 증강 생성(Retrieval-Augmented Generation)
- — 현재 질의와 의미적으로 가까운 외부 기록을 검색한 뒤 그 결과를 언어 모델 입력에 넣어 응답을 만드는 방식입니다. VoiceMem은 일반적인 유사도 검색보다 정보·감정 그래프를 먼저 거쳐 후보 공간을 줄입니다.
- 온라인 온폴리시 증류(Online On-Policy Distillation)
- — 학생 모델이 실제로 생성한 응답을 교사 모델과 비교하고 검증하면서 학습 데이터를 반복적으로 만드는 증류 방식입니다. VoiceMem은 memory world 구성, black-box 교정, 검증, SFT Update를 순환해 ChatMem-400K를 구축합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





