섹션별 상세
Memories.ai는 엔비디아 GTC 컨퍼런스에서 엔비디아와의 협력을 발표하며 시각적 기억 기술 고도화에 나섰다. 엔비디아의 추론형 비전 언어 모델인 Cosmos-Reason 2와 비디오 검색 및 요약 애플리케이션인 Metropolis를 활용하여 웨어러블 및 로봇용 인프라를 구축한다.
공동 창업자인 Shawn Shen과 Ben Zhou는 메타의 레이밴 스마트 글래스 AI 시스템을 구축하던 중 사용자가 기록한 영상 데이터를 다시 불러올 수 없다는 문제점을 발견하고 창업을 결심했다. 텍스트 기반 메모리와 달리 비정형 영상 데이터를 구조화하고 인덱싱하는 솔루션이 부재하다는 점에 주목했다.
시각적 기억 구현을 위해 영상을 데이터 형식으로 임베딩 및 인덱싱하는 인프라 구축과 모델 학습을 위한 데이터 확보에 집중하고 있다. 2025년 7월 자체 대형 시각 기억 모델(LVMM)을 출시했으며, 이는 Gemini Embedding 2와 유사한 멀티모달 인덱싱 및 검색 기능을 수행한다.
데이터 수집을 위해 고화질보다는 데이터 효율성에 최적화된 자체 하드웨어 장치 'LUCI'를 개발하여 학습용 영상을 기록하고 있다. 또한 퀄컴과의 파트너십을 통해 올해 말부터 퀄컴 프로세서에서 LVMM이 구동될 수 있도록 최적화 작업을 진행 중이다.
용어 해설
- 비전 언어 모델(VLM)
- — 이미지나 영상의 시각적 정보와 텍스트를 동시에 이해하고 처리하는 AI 모델이다. 시각 데이터를 언어로 설명하거나 시각적 맥락에 기반한 질문에 답하는 데 사용되며 Memories.ai 기술의 핵심이다.
- 임베딩(Embedding)
- — 고차원의 영상이나 텍스트 데이터를 저차원의 수치 벡터로 변환하는 과정이다. AI가 데이터 간의 유사성을 계산하고 방대한 영상 정보 속에서 특정 장면을 검색하는 데 필수적인 기술이다.
- 인덱싱(Indexing)
- — 방대한 데이터 중에서 필요한 정보를 빠르게 찾을 수 있도록 체계적으로 정리하는 기술이다. Memories.ai는 비정형 영상 데이터를 검색 가능한 형태로 구조화하여 AI가 과거의 시각적 경험을 즉시 회상하게 한다.
- 멀티모달(Multimodal)
- — 텍스트, 이미지, 오디오 등 서로 다른 형태의 데이터를 동시에 처리하고 결합하는 기술이다. 시각적 기억 시스템이 현실 세계의 복합적인 정보를 통합적으로 이해하는 데 핵심적인 역할을 한다.
기술
- Nvidia Cosmos-Reason 2
- Nvidia Metropolis
- Qualcomm Processors
- LVMM (Large Visual Memory Model)
활용 사례
- 스마트 글래스의 시각 정보 회상
- 로봇의 환경 기억 및 경로 탐색
- 개인용 AI 비서의 시각 데이터 요약
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 17.수집 2026. 03. 17.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

