본문으로 건너뛰기
HF Daily Papers조회 2

LightMem-Ego: 일상용 경량 스트리밍 멀티모달 메모리 시스템

LightMem-Ego는 스마트폰 및 착용형 장치의 시각·음성 스트림을 수집해 현재·단기·장기 계층 메모리로 조직하고 질의 시 적절한 계층을 선택해 근거 기반 응답을 생성한다.

용어 해설

1인칭 지각(Egocentric Perception)
사용자 착용형 카메라와 마이크로부터 얻는 시각·청각 스트림을 의미하며, 이 논문에서는 시간축에 정렬된 프레임과 오디오 청크를 통해 연속적 일상 경험을 포착하는 입력 소스로 활용된다. 실시간 캡처와 저지연 전송을 강조하기 때문에 클라이언트는 경량 샘플링·압축·타임스탬프 부여만 수행하고 백엔드에서 이벤트 구성과 후처리를 수행한다. 에지 장치에서의 처리 제약과 프라이버시 위험을 고려한 설계가 핵심이다.
이벤트 분할(Event Segmentation)
연속 스트림을 시간적인 연속성 및 프레임 간 변화 신호에 따라 연속 구간으로 분할해 '마이크로 이벤트' 단위를 생성하는 처리 과정이다. 각 세그먼트는 시간 범위, 대표 프레임, 임시 설명 및 정렬된 오디오 컨텍스트를 저장하여 이후 메모리 구성과 검색의 기본 단위가 된다. 스트리밍 조건에서 경량으로 동작하도록 설계되어 실시간 업데이트와 비동기 정제 단계를 분리한다.
계층적 메모리(Hierarchical Memory)
현재 문맥을 담는 current, 최근 이벤트를 담는 short-term, 그리고 통합된 에피소드·의미를 담는 long-term으로 구성된 다단계 메모리 구조를 의미한다. 질의 시에는 질의의 시간적 범위와 의도에 따라 적절한 계층에서 근거를 검색하고 증거 집합을 통합해 응답을 생성한다. 이 구조는 빠른 상호작용과 장기 보존 사이의 비용-지연 균형을 목적으로 한다.
ASR 보충 처리(ASR Backfilling)
초기에 업로드된 짧은 오디오 청크에 대해 경량 클라이언트는 타임스탬프만 전송하고, 백엔드가 비동기적으로 더 정교한 음성 인식(ASR)을 실행해 기존 이벤트 세그먼트에 전사 텍스트를 보충하는 절차를 의미한다. 이 방식은 실시간 응답성을 유지하면서도 후속 정제 단계에서 대화 내용 근거를 보강한다. 외부 ASR 서비스 의존으로 정확도·지연이 외부 요인에 민감해지는 단점이 존재한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.