왜 중요한가
기존 시스템은 메모리를 외부 모듈로 관리해 백본과 목표가 분리되고 엔드투엔드 최적화가 어렵거나 실행 지연이 발생했습니다. Metis는 메모리 상태를 백본의 동적 파라미터로 저장하고 메모리 연산을 순전파에 통합해 이들 문제를 구조적으로 줄입니다. 이로써 메모리 읽기·쓰기 절차의 연산 병렬화와 중간 학습을 통한 절차 학습이 가능해져 응답 일관성과 실시간성 측면에서 이득을 얻을 수 있습니다.
관련 Figure

왼쪽 세로 분할은 외부(Decoupling) 대 네이티브(Coupling) 관점에서 아키텍처 차이를 시각화합니다. 중앙 패널은 옵티마이제이션 관점에서 외부는 gradient가 차단되는 반면 네이티브는 end-to-end gradient 연동이 가능함을 도식으로 표현하고, 오른쪽은 처리 효율성 면에서 외부는 추가 단계(검색·재정렬·전처리)가 필요하지만 네이티브는 병렬 처리가 가능함을 보여줍니다. 이 그림은 본문에서 주장하는 네이티브 메모리의 구조적·연산적 이점과 병목 완화 메커니즘을 한눈에 요약합니다.
Figure 1은 외부 메모리와 네이티브 메모리의 구조·최적화·효율성 차이를 비교한 다이어그램입니다.
핵심 기여
메모리 파운데이션 모델 개념화
논문은 메모리 기능을 외부 모듈이 아닌 백본 내부의 동적 파라미터와 계산 절차로 내재화하는 'memory foundation model' 개념을 도입합니다. 이 정의는 네이티브 메모리 상태와 네이티브 메모리 절차 두 축으로 구성되며 각 축의 역할과 요구조건을 기술합니다. 또한 이 개념을 기존의 TTT, MANN, RAG 등과 대비해 구조적·최적화적 차이를 명확히 구분합니다.
Metis 아키텍처 설계
Metis는 Transformer 블록 내부에 Metis block을 삽입해 로컬 메모리 블록과 하이퍼 메모리 블록으로 네이티브 메모리를 구현합니다. 하이퍼 블록은 입력 활성화에서 중요 토큰을 adaptive로 선택해 키·값을 생성하고 로컬 블록은 고정 크기 밀집 매트릭스 M과 정규화 벡터 S로 정보를 누적합니다. 메모리 읽기는 별도 메모리 쿼리와 정규화로 수행돼 원래 어텐션과 병렬로 합쳐집니다.
메모리 전용 중간학습 데이터와 목표 설계
대규모의 합성 메모리 데이터 세트를 구성해 기억·망각·수정·반영 네 연산을 다루는 primary 데이터(357,137 샘플, 406M 토큰)와 보조 데이터(609,443 샘플)를 생성했습니다. 학습 목표로는 저장 상한을 목표로 하는 memory reconstruction, 명령 기반 동작을 유도하는 memory operation, 안정성을 위한 정규화 목표를 병렬로 적용합니다. 학습 중 백본은 고정하고 네이티브 메모리 파라미터만 갱신하는 설계로 실시간 유지 비용을 낮춥니다.
온라인 그라디언트-프리 메모리 유지
Metis의 온라인 메모리 갱신은 추론 시 전방 계산만으로 수행되며 별도 역전파가 요구되지 않습니다. 로컬 메모리 업데이트는 감쇠 인자 λ와 선택된 키·값의 선형 결합 또는 GDN 기반 게이트 델타로 이루어지며 이는 한 단계의 포워드로 완료됩니다. 따라서 추론 시 추가적인 학습 비용 없이 상태 유지가 가능해 외부 저장을 통한 I/O 병목을 줄입니다.
핵심 아이디어 이해하기
Transformer의 표준 self-attention은 현재 입력 내 토큰 관계를 계산하지만 다단계 상호작용에서 과거 상호작용 정보는 외부 저장·검색으로 처리되는 경우가 많습니다. Metis는 과거 정보를 고정 크기 밀집 파라미터(로컬 메모리 M)로 압축하고, 하이퍼 블록이 입력 활성화에서 핵심 토큰을 선택해 키·값을 생성함으로써 이 파라미터를 업데이트합니다. 추론 시에는 학습된 메모리 쿼리로 M을 읽어 기존 어텐션과 병렬로 결합하여 과거 정보가 자연스럽게 현재 생성에 기여하도록 만듭니다.
방법론
입력 시 각 Transformer 레이어에 Metis block을 삽입해 하이퍼 메모리로 토큰 중요도를 Softmax(w_agg)로 계산하고 top-ρ 누적 질량 기준으로 토큰을 선택합니다. 선택된 히든은 키·값으로 투사되어 로컬 메모리 M을 λ 감쇠와 함께 식(2) 또는 GDN 기반 갱신으로 업데이트하며 이 과정은 포워드 패스만으로 수행됩니다. 이용 측면에서는 메모리 쿼리 W_Q~로 M을 읽어 메모리 어텐션을 계산하고 정규화한 값을 원래 토큰-토큰 어텐션과 γ 가중합(Eq.5)으로 병합합니다. 학습은 중간학습 단계에서 백본을 고정하고 메모리 관련 파라미터만 훈련해 reconstruction과 operation 목표로 네이티브 절차를 습득시킵니다.
관련 Figure

상단에는 다단계 상호작용과 메타 블록을 포함한 전체 모델 플로우가 있고, 중앙 패널은 메티스 블록의 내부로 들어가 하이퍼 블록의 중요도 스코어링, top-ρ 선택, 키·값 투사와 로컬 메모리의 M·S 갱신 절차를 차례로 표시합니다. 하단의 네이티브 저장·읽기 경로는 수식(2),(4),(5)과 매칭되며, GDN 교체 옵션과 선택기(straight-through) 처리 등 구현 세부가 시각적으로 정리되어 있어 메커니즘 이해에 유용합니다.
Figure 2는 Metis 블록 내부 구조와 전체 아키텍처(하이퍼/로컬 메모리, 저장·이용 흐름)를 상세히 보여주는 다이어그램입니다.
주요 결과
논문은 합성한 대규모 메모리 데이터와 다양한 실험으로 Metis가 네이티브 메모리 동작을 획득함을 보고합니다. 성능 평가는 기억·망각·수정·반영 유형에서 일관된 정답 일치성을 확보하는 쪽으로 나타났으며, 메모리 읽기·쓰기 연산이 순전파로 처리돼 레이턴시와 컨텍스트 부하를 줄입니다. 다만 장기 보관 과제에서는 고정 크기 압축으로 인한 정보 손실과 잠재적 의미 혼선이 관찰되어 한계가 명시되어 있습니다.
기술 상세
Metis는 각 Transformer 계층에 Metis block을 추가해 하이퍼 블록(정적 파라미터: w_agg, W~_K, W~_V, W~_Q)과 로컬 메모리(M, S)의 구조로 구현됩니다. 저장 과정은 PreNorm된 활성화에 대해 importance scoring, top-ρ 선택, 키·값 투사, 그리고 λ 감쇠와 (또는) GDN 기반 갱신으로 이루어지며 수식(2)(3)이 이를 정의합니다. 이용은 별도 메모리 쿼리로 M을 읽어 diag-정규화 형식의 메모리 어텐션을 계산하고 원래 어텐션과 γ로 결합하는 식(4)(5)로 처리됩니다. 학습 데이터는 primary(357,137 샘플, 406M 토큰)와 auxiliary(609,443 샘플)로 구성되며 학습은 backbone 고정, 메모리 파라미터만 최적화하는 mid-training으로 진행됩니다. 효율성 측면에서 메모리 읽기·저장은 원래 어텐션과 병렬로 실행되어 레이어 수준 지연을 max(orig, util, store)+fuse로 제한합니다.
한계점
논문 자체가 지적하는 주요 한계는 고정 크기 파라미터로 정보를 압축할 때 발생하는 장기 정보 손실입니다. 시간에 따라 누적된 다양한 단계의 정보가 단일 M 매트릭스에 블렌딩되어 의미 혼선이 나타날 수 있으며, 이는 일부 케이스에서 잘못된 응답이나 정보 누락으로 이어집니다. 또한 외부 메모리를 완전히 대체하려면 아직 충분치 않아 긴 역사나 엄밀한 추적이 필요한 응용에서는 외부 보조 저장과의 결합이 필요할 수 있습니다.
실무 활용
Metis는 백본 내부에 파라메트릭 메모리 상태를 유지하므로 대화형 에이전트에서 사용자별 장기 상태를 외부 데이터베이스 없이 낮은 지연으로 유지할 수 있습니다. 네이티브 메모리 절차는 포워드만으로 업데이트되므로 실시간 서비스에서 추가 학습 비용을 피할 수 있습니다. 또한 중간학습으로 도메인 특화 기억 동작을 학습하면 외부 RAG 파이프라인의 복잡도를 줄일 수 있습니다.
- 대화형 개인화 에이전트에서 사용자 선호·프로필을 온라인 상호작용으로 축적해 후속 응답에 반영하는 용도
- 반복 질의가 많은 고객지원 시나리오에서 불필요한 외부 검색과 프롬프트 길이 증가를 줄여 지연을 낮추는 용도
- 로컬 에이전시 환경에서 작은 메모리 상태로 빠른 상태 갱신이 필요한 실시간 보조 서비스
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

좌측 상단부터 다양한 메모리 연산 케이스(remember, multi-entity)와 우측에는 forget, distract 사례를 나란히 배치해 각 시나리오에서 모델의 메모리 상태가 어떻게 변하고 응답이 어떻게 달라지는지를 대화 예시로 제시합니다. 이 그림은 데이터 합성 규칙과 primary/auxiliary 샘플 구조를 연결해 주며, 연구자가 실제 상호작용에서 Metis가 처리해야 할 의도·잡음·갱신 패턴을 식별하는 데 실용적입니다.
Figure 5는 기억·망각·다중 엔티티·간섭 사례 등 데이터 샘플 템플릿과 모델 동작 예시를 대화 형태로 보여줍니다.
용어 해설
- 네이티브 메모리(Native Memory)
- — 네이티브 메모리는 모델의 백본 내부에 지속적으로 유지되는 동적 파라미터 상태로서 이전 상호작용의 정보를 밀집 표현으로 저장합니다. 이 상태는 추론의 일부로 직접 읽기·쓰기되어 모델의 순전파 동안 업데이트되며 외부 텍스트 컨텍스트를 대체합니다. 사전·중간 학습을 통해 정적 파라미터와 의미 공간을 정렬해 협업 계산이 가능하도록 설계됩니다.
- 메모리 어텐션(Memory Attention)
- — 메모리 어텐션은 현재 토큰의 쿼리와 모델 내부의 고정 크기 메모리 매트릭스 간의 유사도를 계산해 읽기 출력을 얻는 연산입니다. 이 결과는 원래의 토큰-토큰 어텐션과 병합되어 최종 어텐션 출력을 형성하고, 병렬 실행으로 지연을 최소화합니다. 정규화 항과 가중치 γ로 두 분기를 균형 조정합니다.
- 하이퍼 메모리 블록(Hyper Memory Block)
- — 하이퍼 메모리 블록은 입력 중간 활성화를 압축하고 로컬 메모리 매트릭스를 갱신할 파라미터 집합을 담고 있습니다. 중요도 스코어 w_agg로 토큰을 선별하고 키·값 프로젝션을 생성하여 native storage를 수행합니다. 중간 학습 동안 학습되는 정적 파라미터로서 온라인 추론 시에는 고정됩니다.
- 로컬 메모리 블록(Local Memory Block)
- — 로컬 메모리 블록은 고정 크기 밀집 행렬 M과 쿼리-키 정규화 벡터 S를 통해 시간에 따라 누적되는 동적 메모리 상태를 보관합니다. 이 매트릭스는 단계별로 하이퍼 블록이 생성한 키·값 투입으로 업데이트되며 이후 메모리 어텐션에서 읽힙니다. 초기 상태는 0으로 시작하고 감쇠 계수 λ로 과거 정보를 희석합니다.
- Top-ρ 선택(Top-ρ Selection)
- — Top-ρ 선택은 하이퍼 블록이 토큰별 중요도 분포를 Softmax로 계산한 뒤 누적 질량이 ρ에 도달할 때까지 상위 위치를 보존하는 비미분 가능한 선택입니다. 훈련에서는 straight-through estimator로 그라디언트를 전달해 스코어러를 학습합니다. 이는 저장할 토큰 수를 입력 길이 대비 크게 줄이는 압축 역할을 합니다.
- Gated Delta Network(Gated Delta Network (GDN))
- — GDN은 로컬 메모리 갱신 시 단순 선형 평균 대신 게이티드 델타 업데이트를 사용해 정보 보존과 노이즈 억제를 균형시킵니다. 메모리 성능이 더 안정적으로 유지되는 것으로 논문에서 보고되며 Metis의 기본 갱신 전략으로 채택되었습니다. GDN은 입력 특성에 따라 업데이트 강도를 적응적으로 조절합니다.
코드 예제
# Native storage update (Eq.2, pseudocode)
# M_{t+1} = lambda*M_t + (1-lambda)/L' * (K_t^T / sqrt(dk)) @ V_t
M_t1 = lambda_ * M_t + (1 - lambda_) / Lp * (K_t.T / math.sqrt(dk)) @ V_t이 코드는 논문 방정식(2)의 핵심 저장 업데이트를 간단히 재현합니다. 입력으로 선택된 키 K_t와 값 V_t를 받아 고정 크기 로컬 메모리 M을 지수 감쇠 λ와 함께 선형 결합으로 갱신합니다. 실제 구현에서는 GDN 기반의 게이트 업데이트로 교체되어 성능이 향상될 수 있습니다.
# Memory attention fusion (Eq.5, pseudocode)
# A = gamma * Softmax(QK^T/sqrt(dk)+mask) @ V + (1-gamma) * Norm(A_tilde)
orig = softmax((Q @ K.T)/sqrt(dk) + mask) @ V
mem = norm(A_tilde)
A = gamma * orig + (1-gamma) * mem이 스니펫은 원래 토큰-토큰 어텐션과 네이티브 메모리 어텐션을 γ로 가중합하는 과정을 보여줍니다. 메모리 읽기 A_tilde는 로컬 메모리 M과 메모리 쿼리 Q~를 사용해 계산되며 두 분기는 병렬로 처리되어 레이턴시를 낮춥니다. Norm 연산은 메모리 출력을 원래 어텐션 스케일에 맞춥니다.
Selection: p = softmax(H_t @ w_agg / tau); S = top_prefix(p, rho); H_bar = gather(H_t, S)이 텍스트 스니펫은 하이퍼 블록이 활성화 행렬에서 중요 토큰을 추출하는 파이프라인을 요약합니다. Softmax로 중요도를 얻고 누적 질량이 rho에 닿을 때까지 상위 프리픽스를 선택한 뒤 해당 위치의 히든을 집계해 키·값으로 투사합니다. 선택은 비미분이므로 straight-through estimator로 그라디언트를 전달합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.