본문으로 건너뛰기

LLM 가중치를 ROM 카트리지에 담자는 제안

고정된 LLM 가중치를 ROM에 저장하고 LoRA diff만 DRAM에 두자는 메모리 설계 제안입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

배포된 LLM의 기본 가중치는 추론 중 거의 변하지 않으므로, 이를 HBM·DRAM 대신 Mask ROM에 저장하고 LoRA 방식의 작은 diff만 동적 메모리에 두자는 하드웨어 아키텍처입니다. 글은 ROM의 속도가 저장 셀의 물리적 한계가 아니라 인터페이스와 패키징의 선택에 달렸다고 보고, 64개 칩 daughter card에서 256–512 GB/s를 제공하는 계산을 제시합니다. ROM은 커패시터·refresh·쓰기 경로가 없어 같은 면적에서 더 높은 밀도와 낮은 비트당 전력을 얻을 수 있고, 4-bit 양자화와 무손실 압축으로 버스 효율도 높일 수 있다는 주장입니다. 다만 실제 ROM 기반 제품의 대역폭·전력·수율·업데이트 비용을 측정한 결과보다 기존 기술과 개념을 조합한 설계 제안에 가깝습니다.

섹션별 상세

01
이 글은 배포가 끝난 LLM의 기본 가중치가 추론 중에는 쓰이지 않는데도 HBM과 DRAM에 저장된다는 점을 비용 구조의 문제로 삼습니다. 학습이 끝난 기본 행렬 W를 Mask ROM에 고정하고, LoRA 방식의 작은 변화량 ΔW = BA만 동적 메모리에 두면 쓰기 작업이 필요한 데이터와 영구 데이터를 분리할 수 있다는 구상입니다. 본문은 LoRA 변화량이 흔히 전체 파라미터의 1% 미만이라고 설명하며, 모델 업데이트 때는 작은 diff만 교체하면 된다는 점을 근거로 듭니다.
02
ROM이 느리다는 반론에 대해 글은 저장 셀 자체보다 인터페이스 폭, 핀 속도, 프로세서와의 거리, 패키징이 대역폭을 결정한다고 반박합니다. HBM3의 1024비트 인터페이스와 HBM4의 2048비트 인터페이스를 예로 들면서, 같은 주변 회로와 연결 방식을 ROM 배열 뒤에 배치하면 DRAM과 같은 인터페이스 속도를 얻을 수 있다고 설명합니다. 28nm Mask ROM 칩 하나당 4–8 GB/s, 64개 칩을 묶은 카드에서 256–512 GB/s, 칩당 8GB 기준 총 512GB의 고정 가중치를 제시해 이 주장을 수치화합니다.
03
구체적인 하드웨어 형태로는 GPU 패키지 옆에 ROM 다이를 쌓는 읽기 전용 HBM과, VRAM GPU 옆에 Mask ROM daughter card를 연결하는 카트리지를 제시합니다. VRAM은 KV cache, activations, LoRA diff처럼 갱신되는 데이터를 맡고 ROM 카드는 고정 가중치를 NVLink급 링크로 공급하므로, 모델 버전이 바뀌면 카드 자체를 교체하는 흐름입니다. 8B–70B급 모델을 4-bit 정밀도로 한두 개 스택에 담을 수 있고, daughter card 연결은 대략 0.9–1.8 TB/s aggregate 링크까지 확장할 수 있다고 적었습니다.
04
글은 DRAM보다 ROM이 셀과 주변 회로 측면에서 더 효율적일 가능성도 근거로 듭니다. ROM에는 저장 커패시터, refresh, 비파괴 읽기를 위한 복원 경로, 쓰기 드라이버가 필요하지 않으므로 같은 면적에 더 많은 데이터를 넣고 비트당 읽기 전력도 낮출 수 있다는 설명입니다. 여기에 4-bit 양자화와 Huffman·arithmetic coding·ANS 같은 무손실 압축을 결합하면, 미리 분포를 아는 가중치의 압축률만큼 카트리지 링크의 유효 처리량이 증가한다는 결론입니다.

용어 해설

Mask ROM
Mask ROM은 제조 단계에서 데이터 패턴을 금속 배선이나 비아의 물리적 구조로 고정하는 읽기 전용 메모리입니다. 전하를 저장하거나 주기적으로 갱신할 필요가 없어, 대규모 고정 가중치를 낮은 전력과 높은 집적도로 보관하는 매체로 제안됐습니다.
저순위 적응(LoRA)
LoRA는 전체 가중치 행렬을 다시 학습하지 않고, 고정된 기본 행렬에 두 개의 작은 저순위 행렬로 만든 변화량을 더하는 Fine-tuning 방식입니다. 본문은 이 작은 변화량을 DRAM에 두고 기본 가중치를 ROM에 저장하는 구조로 연결합니다.
Mixture-of-Experts
Mixture-of-Experts는 입력 토큰마다 여러 전문가 모듈 가운데 일부만 선택해 계산하는 모델 구조입니다. 본문은 자주 쓰는 전문가와 라우터를 DRAM에 두고 덜 쓰는 전문가는 ROM에 저장해, 필요한 가중치만 불러오는 방식으로 메모리 부담을 나누자고 제안합니다.
메모리 내 연산(Compute-in-Memory)
Compute-in-Memory는 데이터를 메모리에서 프로세서로 옮긴 뒤 연산하는 대신, 데이터가 저장된 위치에서 곱셈 같은 계산을 수행하는 하드웨어 방식입니다. ROM 기반 가중치의 연산을 저장 장치 가까이에서 처리하면 보드와 인터커넥트로 가중치를 이동하는 병목을 줄일 수 있습니다.
엔트로피 부호화(Entropy Coding)
엔트로피 부호화는 값의 출현 빈도를 이용해 자주 나오는 값에는 짧은 코드를, 드문 값에는 긴 코드를 배정하는 무손실 압축 방식입니다. 미리 분포를 아는 고정 가중치에 적용하면 저장 용량뿐 아니라 동일한 버스에서 전달되는 유효 처리량도 높일 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.