챕터별 상세
00:00
Titans의 등장 배경과 기존 모델의 한계
구글 리서치에서 발표한 Titans 논문은 시퀀스 모델링에서 어텐션과 순환 모델(Recurrent models)의 장점을 결합하려는 시도이다. 기존 Transformer는 모든 토큰 간의 의존성을 정확히 모델링하지만 시퀀스 길이에 따라 계산 비용이 제곱으로 증가하는 한계가 있다. 반면 RNN 계열은 데이터를 고정된 크기의 은닉 상태(Hidden state)에 압축하여 선형적인 비용으로 처리하지만, 아주 긴 문맥 정보를 유지하지 못하고 망각하는 문제가 발생한다.
05:00
선형 트랜스포머와 커널 트릭의 기술적 이해
Transformer의 효율성을 높이기 위해 제안된 Linear Transformer는 Softmax 연산을 커널 함수로 대체하여 계산 순서를 바꾼다. 이를 통해 과거의 Key와 Value를 행렬 형태의 상태(Matrix-valued state)로 누적하여 저장할 수 있으며, 새로운 토큰이 들어올 때마다 전체 과거를 다시 계산할 필요 없이 선형적인 비용으로 업데이트가 가능하다. 하지만 이러한 방식도 결국 정보를 유한한 크기의 행렬에 압축해야 하므로 정보 밀도가 높은 긴 시퀀스에서는 성능 저하를 피하기 어렵다.
13:00
신경망 메모리(Neural Memory)의 핵심 원리
Titans는 정보를 벡터나 행렬에 저장하는 대신, 작은 신경망(MLP) 자체를 메모리로 사용한다. 이 신경망은 입력된 Key를 Value로 매핑하는 함수 역할을 수행하며, 새로운 정보가 들어올 때마다 경사 하강법(Gradient Descent)을 통해 신경망의 가중치를 업데이트한다. 이는 모델이 추론 시점(Test-time)에 실시간으로 새로운 지식을 자신의 파라미터에 '학습'하여 저장하는 방식이며, 이를 통해 고정된 벡터보다 훨씬 유연하고 방대한 정보를 기억할 수 있다.
18:00
Titans 아키텍처: MAC(Memory as Context) 구조
Titans의 대표적인 변체인 MAC 구조는 세 가지 메모리 층으로 구성된다. 첫째, 표준 Attention을 사용하는 단기 기억(Core) 모듈이 현재 컨텍스트를 처리한다. 둘째, 신경망 메모리 모듈이 과거의 긴 정보를 저장하고 필요할 때 Retrieval 과정을 통해 정보를 제공한다. 셋째, Persistent Memory가 데이터와 무관하게 작업 자체에 대한 일반적인 지식을 저장한다. 이 세 모듈에서 나온 결과값을 결합하여 최종 출력을 생성함으로써 정확도와 장기 기억 능력을 동시에 확보했다.
22:00
서프라이즈(Surprise) 지표를 이용한 메모리 업데이트
논문에서는 메모리 업데이트의 효율성을 위해 'Surprise'라는 개념을 도입했다. 이는 현재 입력된 데이터가 기존 메모리에 저장된 정보와 얼마나 다른지를 측정하는 지표로, 실제로는 손실 함수(Loss function)의 그래디언트 크기에 해당한다. 모델은 예상치 못한 정보(높은 Surprise)가 들어왔을 때 더 강하게 가중치를 업데이트하며, 여기에 모멘텀(Momentum) 기법을 추가하여 과거의 중요한 정보를 쉽게 잊지 않도록 설계했다. 이는 인간이 충격적인 사건을 더 잘 기억하는 방식에서 영감을 얻은 구조이다.
31:30
Titans의 성능 결과 및 실무적 의의
Titans는 언어 모델링, 상식 추론, 유전체 분석 등 다양한 태스크에서 기존 Transformer 및 최신 선형 순환 모델들을 능가하는 성적을 거두었다. 특히 200만 토큰 이상의 길이에서 수행된 Needle-in-a-haystack 테스트에서 다른 모델들이 정보를 놓치는 구간에서도 높은 정확도를 유지했다. 이는 RAG(검색 증강 생성) 없이도 모델 자체가 방대한 컨텍스트를 내재화할 수 있음을 시사하며, 추론 속도 또한 선형적으로 유지되어 실용성이 높다.
python
def update_memory(M_prev, k_t, v_t, eta, theta):
# M_prev: previous memory state (weights)
# k_t, v_t: current key and value
# eta: learning rate, theta: momentum
# Loss is the distance between memory output and actual value
loss = norm(M_prev(k_t) - v_t)**2
# Gradient of loss with respect to memory weights
grad = compute_gradient(loss, M_prev)
# Update memory weights using gradient descent with momentum
S_t = eta * S_prev + grad
M_next = M_prev - S_t
return M_nextTitans의 핵심인 신경망 메모리가 테스트 타임에 새로운 Key-Value 쌍을 학습하여 업데이트되는 로직의 개념적 예시
용어 해설
- 선형 트랜스포머(Linear Transformer)
- — 표준 Attention의 소프트맥스 연산을 커널 함수로 근사하여 시퀀스 길이에 따른 계산 복잡도를 이차(Quadratic)에서 선형(Linear)으로 줄인 아키텍처이다. 메모리 사용량을 획기적으로 줄일 수 있지만, 고정된 크기의 상태(State)에 정보를 압축해야 하므로 아주 긴 문맥에서는 성능이 저하되는 한계가 있다.
- 건더미 속 바늘 찾기(Needle-in-a-Haystack)
- — 방대한 양의 텍스트 데이터(건더미) 속에 아주 작은 특정 정보(바늘)를 삽입한 뒤, 모델이 이를 정확하게 찾아내는지 측정하는 벤치마크이다. 모델의 장기 기억 능력과 컨텍스트 윈도우 활용 능력을 평가하는 핵심 지표로 사용된다.
- 경사 하강법(Gradient Descent)
- — 모델의 오차를 최소화하기 위해 가중치를 반복적으로 업데이트하는 최적화 알고리즘이다. Titans 아키텍처에서는 이를 추론 시점(Test-time)에 사용하여 새로운 정보를 신경망 메모리에 즉석에서 학습시키는 메커니즘으로 활용한다.
- 프리픽스 튜닝(Prefix Tuning)
- — 모델의 모든 파라미터를 수정하는 대신 입력 시퀀스 앞에 학습 가능한 특정 벡터(Prefix)를 추가하여 모델의 동작을 제어하는 경량 파인튜닝 기법이다. Titans의 Persistent Memory 모듈이 이와 유사한 방식으로 작동하여 작업에 대한 일반적인 지식을 저장한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 15.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
