본문으로 건너뛰기

HBF 플래시로 LLM 추론 용량을 넓히는 FLINT

FLINT는 HBF를 HBM과 결합해 LLM 추론의 메모리 용량을 확장하는 구조입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LLM inference는 연산 성능보다 accelerator에 장착된 메모리 용량 부족 때문에 모델 크기가 제한되는 상황에 놓여 있습니다. FLINT는 멀티테라바이트급 용량을 제공하는 HBF를 HBM과 함께 사용하고, hardware burst-buffer controller로 읽기를 동적 병합·파이프라인화해 NAND flash 대역폭을 활용합니다. 또한 phantom-plane refresh로 refresh 작업을 추론 임계 경로에서 분리하고, read-only FTL로 읽기 중심인 LLM weight workload에 맞지 않는 SSD급 임의 쓰기 관리 기능을 줄입니다. 논문 초록은 이 세 가지 메커니즘을 통해 flash의 지연과 관리 부담을 낮추면서 LLM inference의 용량 확장을 겨냥합니다.

섹션별 상세

01
LLM 추론은 연산 처리량보다 accelerator memory capacity 부족에 막히는 경우가 늘고 있으며, 특히 단일 accelerator나 소규모 노드에서는 제한된 on-package memory 때문에 배포 가능한 모델 크기가 줄어듭니다. HBF는 3D 적층 NAND flash로 멀티테라바이트급 용량을 accelerator 가까이에 제공해 LLM weight를 저장할 수 있는 추가 메모리 계층으로 활용됩니다. 따라서 HBM의 높은 대역폭과 HBF의 큰 용량을 결합하는 하드웨어 구조가 핵심 과제가 됩니다.
02
기존 HBF 기반 구조는 NAND flash의 마이크로초 수준 읽기 지연을 감추기 위해 coarse-grained static prefetching에 의존했지만, 실제 workload 변화에 유연하게 대응하기 어렵습니다. FLINT의 hardware burst-buffer controller는 읽기 요청을 동적으로 coalesce하고 pipeline으로 연결해 기존 NAND flash buffer를 활용하면서 HBF 대역폭을 유지합니다. 이 방식은 정적으로 미리 가져오는 양과 시점을 고정하는 대신 LLM weight 읽기 흐름에 맞춰 데이터 이동을 조정하는 구조입니다.
03
NAND flash의 refresh 작업이 accelerator가 보는 critical inference path에 노출되면 weight read가 관리 작업을 기다릴 수 있습니다. FLINT의 phantom-plane refresh mechanism은 저비용 리소스 복제를 사용해 refresh 관련 NAND flash 작업을 read foreground 바깥으로 이동합니다. 그 결과 flash 유지 관리가 추론 읽기와 직접 경쟁하지 않도록 경로를 분리합니다.
04
범용 SSD는 임의 쓰기와 복잡한 flash 관리 기능을 지원하지만, LLM weight 저장은 읽기 중심 workload라는 차이가 있습니다. FLINT의 read-only FTL은 논리 weight burst를 HBF의 물리 위치로 변환하는 compact table만 유지해 SSD급 임의 쓰기 지원을 대체합니다. workload에 필요하지 않은 관리 기능을 덜어내면서 HBF를 LLM inference 전용 용량 계층에 맞추는 접근입니다.

용어 해설

HBF
HBF는 3D 적층 NAND flash를 활용해 가속기 가까이에 멀티테라바이트급 용량을 제공하는 메모리 계층입니다. HBM보다 큰 용량으로 LLM weight를 저장하면서도 플래시의 읽기 대역폭을 추론에 활용하는 것이 핵심입니다.
HBM
HBM은 가속기와 가까운 위치에서 높은 대역폭을 제공하는 메모리입니다. 용량이 제한적이기 때문에 FLINT는 HBM을 유지하면서 더 큰 LLM weight를 담을 수 있는 HBF를 추가 용량 계층으로 배치합니다.
버스트 버퍼 컨트롤러(Burst-Buffer Controller)
버스트 버퍼 컨트롤러는 여러 플래시 읽기 요청을 동적으로 합치고 파이프라인으로 연결하는 하드웨어 제어기입니다. NAND flash 내부 버퍼를 활용해 마이크로초 수준의 읽기 지연을 숨기면서 높은 HBF 대역폭을 유지합니다.
Phantom-Plane Refresh
Phantom-Plane Refresh는 NAND flash의 refresh 작업을 추론 읽기 경로와 분리하는 메커니즘입니다. 저비용 리소스 복제로 refresh 관련 작업을 백그라운드로 이동해 accelerator가 기다리는 임계 경로에서 해당 부담을 제거합니다.
읽기 전용 FTL(Read-Only FTL)
Read-Only FTL은 임의 쓰기를 지원하는 SSD급 flash translation layer 대신 LLM weight burst의 논리 주소를 HBF의 물리 위치로 변환하는 간결한 테이블입니다. weight가 읽기 중심이라는 workload 특성에 맞춰 flash 관리 구조와 저장 공간을 줄입니다.

기술

  • LLM
  • HBF
  • 3D-stacked NAND flash
  • HBM
  • NAND flash
  • SSD

활용 사례

  • 단일 accelerator에서 대형 LLM 추론
  • 소규모 노드의 capacity-scalable LLM inference
  • HBM과 flash를 결합한 LLM weight 저장
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.