TL;DR
한 겹 MLP의 입력 가중치를 수작업으로 설정해 길이 2 시퀀스의 라벨을 암기시키는 실험에서 암기 가능한 사실 수는 90% 정확도 기준으로 모델 크기 d에 대해 대략 d^2/log(d)로 증가했고 학습된 모델·하이브리드·수작업 모델의 계수는 각각 약 8.33, 2.38, 0.861로 측정되었다. 수작업 구성은 입력을 외적 합으로 암호화하고 출력에서 선형 분류로 복원하는 방식으로 동작했으며 하이브리드는 출력만 학습해 선형 분류 문제로 환원되었다는 점에서 동작 원리가 명확했다. 계수 차이는 동일한 수의 가중치에서 학습된 모델이 더 많은 사실을 효율적으로 저장하고 있음을 시사하며 이 격차를 줄이기 위한 더 나은 수작업 구성 찾기가 연구적 도전으로 제시되었다. 이 결과는 중간층 MLP가 사실 조회를 저장하는 주요 장소일 수 있다는 기존 관찰들과 정량적으로 연결되며 메커니즘 해석 측면에서 암기 메커니즘의 설계 가능성과 한계를 모두 드러냈다.
섹션별 상세
이미지 분석

그래프는 가로축에 모델 크기 d(16,32,64,128,256), 세로축에 로그 축의 최대 암기 사실 수를 두고 세 집단의 측정값과 각 집단에 대한 최적 적합 곡선을 함께 표시한다. 레전드의 적합식은 각 군이 max facts ≈ c·d^2/log(d) 형태로 스케일하며 계수 c는 학습된 모델에 대해 약 8.33, 하이브리드는 약 2.38, 수작업 모델은 약 0.861으로 표기되어 동일한 함수형 형태에서 상수배 차이가 있음을 수치로 보여준다. 이 그림은 동일 정확도 기준(90%)에서 파라미터 수가 증가할수록 암기 용량이 급격히 증가한다는 점과 수작업 구성만으로는 학습 구성의 암기 효율을 완전히 복제하지 못함을 시각적으로 전달한다.
모델 크기 d에 따른 최대 암기 사실 수(max facts)를 학습된 모델, 하이브리드 모델, 수작업 모델로 비교한 로그 축 그래프이다.
용어 해설
- MLP
- — 입력층과 출력층 사이에 하나 이상의 완전연결 계층이 있는 신경망 구조로, 본문에서는 단일 은닉층 MLP가 길이 2 시퀀스의 라벨을 고정 가중치로 암기하도록 구성되어 기억 용량을 측정하는 실험적 대상이 되었다.
- Associative Memory
- — 여러 기억 항목을 가중치 행렬의 외적 합으로 저장하고 입력과의 유사도로 대응 레이블을 회수하는 방식으로, 본문에서는 Transformer 계층 및 MLP 행렬을 이런 관점에서 모델링해 기억 용량을 분석하는 이론적 배경으로 사용되었다.
- Key-Value Memory
- — 입력을 키로, 대응 출력을 값으로 매핑해 저장하고 조회 시 키와의 유사도로 값을 반환하는 구조를 말하며 본문에서는 Transformer의 feed-forward 레이어가 이런 형태의 기억소로 기능할 수 있다는 관련 문헌을 근거로 삼았다.
- Model Editing
- — 학습된 모델의 특정 사실 연관을 국소적으로 변경하는 기법을 가리키며, 본문에서는 ROME 및 MEMIT 같은 접근법이 중간 레이어 MLP를 대상으로 사실을 찾아내거나 삽입하는 선행작업으로 언급되었다.
- Memorization Capacity
- — 모델이 외우고 정확히 재생할 수 있는 사실의 최대 수를 의미하며 본문에서는 90% 정확도 기준에서 모델 파라미터 수에 따른 최대 암기 사실 수를 d^2/log(d) 형태로 피팅해 비교 대상으로 사용하였다.
근거 모음
- 수작업으로 설정한 한 겹 MLP가 길이 2 시퀀스의 라벨을 암기할 수 있으며 90% 정확도 기준에서 암기 가능한 사실 수가 모델 크기 d에 대해 대략 d^2/log(d)로 스케일한다. — 본문 첫 문단 및 Figure 0의 축과 레전드, 90% 정확도 조건 표기
- Figure 0의 최적 적합 계수는 학습 모델 8.33·d^2/log(d), 하이브리드 2.38·d^2/log(d), 수작업 0.861·d^2/log(d)로 표시되어 동일 형식에서 상수배 차이가 존재한다. — Figure 0의 레전드에 기재된 best fit 수식
기술
- MLP
- Transformer
활용 사례
- mechanistic interpretability experiments
- 모델의 암기 용량 정량화
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.