본문으로 건너뛰기

AMD Kria KV260에서 온칩 INT4 LLM 구동

온칩 URAM/BRAM에 1.5MB INT4 가중치를 올려 최대 59,965 tok/s, 운영형 약 21,300 tok/s를 실리콘에서 기록했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

글쓴이는 AMD Kria KV260 보드의 fabric만으로 INT4로 양자화된 3.16M 파라미터 모델을 온칩(URAM/BRAM)에 올려 실리콘에서 최대 59,965 tok/s(16 스트림, T=1)와 운영형 단일 스트림에서 약 21,300 tok/s를 달성했다. 핵심 원리는 DDR과의 AXI 왕복을 피하고 모든 가중치를 온칩에 상주시켜 메모리 대역폭 병목을 제거하는 것이며, 이를 위해 TinyStories 코퍼스와 전처리(Keviniser), RTL 기반의 폭넓은 GEMV·파이프라인 최적화를 적용했다. 한계는 온칩 용량(약 3 MB)으로, 대략 6.3M 파라미터 이상이면 DDR로 흘러 성능이 급감하고 긴 문맥 유지가 어려워진다는 점이다.

섹션별 상세

작업 목표는 $250짜리 AMD Kria KV260 보드의 fabric(온칩 로직)만으로 LLM을 돌려 초당 토큰 수(tok/s)를 극대화하는 것이며, 그 목표값을 100,000 tok/s로 잡았다. 방법은 모델 가중치를 DDR이 아닌 URAM/BRAM 같은 온칩 메모리에 올리고, INT4 양자화를 통해 모델 크기를 약 1.5 MB로 줄여 메모리 왕복을 제거하는 것이다. 이 접근은 메모리 대역폭이 병목인 ‘memory wall’을 직접 해결하는 방식으로, 실제 실리콘에서 최대 59,965 tok/s(16 스트림, T=1, 200 MHz)과 운영형으로 안정적인 약 21,300 tok/s를 기록했다.
하드웨어 관점에서 핵심 제약은 KV260의 온보드 DDR 컨트롤러가 약 20 GB/s로 A53 CPU와 fabric이 공유된다는 점이다. DDR에 머무르면 AXI 왕복으로 인해 fabric 가속기의 이점이 사라지며, 이를 피하려면 모델 전체가 온칩 메모리에 상주해야 한다. KV260은 온칩 메모리 예산이 대략 3 MB 수준이므로 가중치·활성화·KV 캐시를 모두 고려해 모델을 극단적으로 축소하거나 문맥을 제한하는 설계가 필요하다.
모델 축소를 위해 TinyStories 코퍼스를 사용하고, 텍스트를 어근 중심으로 정리하는 'Keviniser' 전처리를 적용해 출력 길이를 줄였다. 파라미터 수 자체는 아키텍처가 정하므로 압축이 모델 크기를 줄이지는 못했지만 출력 분포가 좁아져 같은 문장을 더 적은 문자로 생성하게 되어 실효 속도가 약 1.5배 개선됐다. 최종적으로 3.16M 파라미터 transformer를 INT4로 저장해 약 1.5 MB로 맞추었고, 이로써 온칩 실행이 가능해졌다.
성능 도달 과정은 단계별로 아키텍처적 병목을 하나씩 제거하면서 기록된 수치의 사다리형 계단을 통해 제시된다. 초기 A53 CPU 루프는 약 11 tok/s였고, CPU에서 매트멀 연산을 fabric으로 옮기고 HW sequencer를 넣고, GEMV 폭넓은 워드 처리와 파이프라인 최적화를 거치면서 집계 성능이 올라갔다. 최종적으로는 16 병렬 스트림(각각 T=1)에서 집계 59,965.5 tok/s를 달성했지만 이 구성은 문맥을 기억하지 못하는 '퇴행적' 텍스트를 내므로 실사용 데모는 단일 스트림(온칩 KV, T=128)으로 운영해 약 21,300 tok/s의 실사용 기록을 얻었다.
이 방식의 한계는 온칩 메모리에 모델이 들어가는 경우에만 성립하며, 이 문맥에서 crossover는 약 6.3M 파라미터다. 이 한계를 넘으면 DDR로 흘러들어가며 메모리 벽에 걸려 성능이 급격히 떨어진다. 또한 긴 문맥을 유지하려 하면 KV 캐시가 온칩을 넘치게 해버려 결과적으로 속도와 품질 사이에서 트레이드오프가 발생한다.
개발·배포 측면에서는 전체 RTL(Verilog) 구현과 모델·서빙 스택을 공개한 점이 강조된다. 보드는 재프로그래밍으로 모델을 교체하는 데 약 25초가 소요되며, 데모는 chat.mikeayles.com에서 운영 중이고 코드와 비트정확성 검증 스크립트는 github.com/MichaelAyles/kev-gpt에 공개돼 있다. 글쓴이는 수치가 실리콘에서 비트정확하게 측정됐음을 여러 번 명시하며, 반복 가능한 벤치와 스크립트를 제공해 결과를 검증할 수 있게 했다.

이미지 분석

AMD Kria KV260 보드 전경과 Kria 쿨링 하우징이 보이는 사진
Photo

사진은 KV260 SOM 위에 장착된 쿨러와 보드 주변의 USB-C 케이블, SD 카드 슬롯, 핀 헤더 배치 등 실제 하드웨어 구성을 확인할 수 있다. 보드가 핑크색 방진 폼 위에 놓여 있고 외부 전원·케이블 연결 상태가 보이므로 데모 환경의 물리적 제약과 접속 방식을 유추하는 데 유용하다. 하우징의 AMD KRIA KV260 레이블은 글에 적시된 하드웨어와 사진이 일치함을 뒷받침한다.

AMD Kria KV260 보드 전경과 Kria 쿨링 하우징이 보이는 사진

용어 해설

UltraRAM(URAM)
FPGA 내부의 대용량 온칩 SRAM 블록으로, 대역폭이 매우 높아 가중치를 상시 저장하고 읽어오는 데 적합하다. 이 프로젝트에서는 모델의 INT4 가중치 ~1.5 MB를 URAM에 상주시켜 DDR 접근을 피함으로써 토큰 생성 속도를 끌어올렸다.
Block RAM(BRAM)
FPGA의 작은 온칩 SRAM 블록으로 활성화(activations), 스크래치 공간, KV 캐시와 같은 임시 데이터를 저장하는 데 사용된다. KV 캐시와 활성화 동기 접근을 BRAM으로 처리해 메모리 병목을 낮췄다.
AXI 버스(AXI)
프로세서와 FPGA fabric을 연결하는 버스 프로토콜 계열로, DDR과의 왕복 접근이 이 버스를 거치며 지연과 대역폭 경쟁을 발생시킨다. 글에서는 AXI 왕복이 토큰 생성의 성능 병목을 만든다고 지적됐다.
INT4 양자화(INT4)
가중치를 4비트 정수로 표현해 모델 크기를 네 배 줄이는 양자화 방식으로, 온칩 메모리에 모델을 올리기 위한 핵심 수단이다. 글에서는 3.16M 파라미터 모델을 약 1.5 MB로 만들기 위해 INT4를 사용했다.
키-값 캐시(KV cache)
Transformer의 이전 토큰에 대한 key/value 행렬을 보관하는 캐시로, 긴 문맥을 유지하려면 온칩 메모리를 상당히 차지한다. 온칩 용량 한계 때문에 긴 문맥은 DDR로 흘러 성능 저하를 초래한다.

근거 모음

근거
  • 16 스트림, T=1 구성에서 측정된 집계 최고치가 59,965.5 tok/s(200 MHz, bit-exact, 3 runs of 3)라는 점 본문의 'The record build'와 'Act III' 섹션에 실리콘에서 측정한 수치와 실험 조건(200 MHz, bit-exact, 3 runs of 3)이 기술되어 있다.
  • 운영형 데모(단일 스트림, 온칩 KV, T=128)가 라이브 벤치에서 1~2,000 동시 연결 범위에서 약 21,300 tok/s를 유지했고 피크 21,479을 관찰했다는 점 본문의 'Act IV'와 운영 기록 설명에서 라이브 벤치 결과와 동시 연결 부하 시험 결과가 제시되어 있다.
  • 모델은 INT4 양자화로 3.16M 파라미터 트랜스포머를 약 1.5 MB로 저장해 온칩에 상주시켰다는 점 본문에서 '3.16M parameters, ~1.5 MB at INT4'로 모델 크기와 양자화 방식이 명시되어 있다.
  • 전체 구현과 모델, 서빙 스택을 github.com/MichaelAyles/kev-gpt에 공개했다는 점 본문 끝부분에서 공개 리포지토리 URL과 포함된 항목(모델, RTL, 서빙 스택, bit-exact gates)을 언급하고 있다. 출처

기술

  • URAM
  • BRAM
  • AXI
  • INT4
  • Verilog
  • Vitis
  • Arm Cortex-A53
  • DSP48E2
  • GEMV

활용 사례

  • 메모리 제약이 심한 엣지 장치에서 간단한 생성기나 스토리텔러 같은 서비스에 적용할 수 있다. 온칩으로 가중치를 유지하면 외부 DRAM 접근을 피해 지연과 전력 소비를 크게 줄일 수 있으므로, 저비용 보드에서 실시간 생성이 필요한 용도에 적합하다. 다만 문맥 길이와 품질 제약이 있기 때문에 보조적 보이스나 간단한 챗봇 등 제한된 역할에 유리하다.
  • 하드웨어·실리콘 성능 실험의 측정 도구로 유용하다. 실리콘에서의 bit-exact 벤치와 단계별 제거 실험은 어떤 최적화가 어느 정도의 이득을 주는지 정량적으로 보여주므로 아키텍처 설계 결정을 검증하는 데 도움이 된다. 연구·교육 현장에서 FPGA 성능 특성의 직관을 얻는 데 쓰기 적합하다.
  • 비전 AI용 디바이스에서 원래 의도했던 기능 대신 유휴 시간을 활용한 보조 서비스로 활용할 수 있다. 글쓴이는 원래 스테레오 비전 프로젝트용 보드를 가지고 있었고, 그 유휴 사이클을 LLM 추론으로 재할당해 데모를 운영했으므로 유사한 장비 재활용 시나리오에 적용 가능하다. 이 접근은 추가 하드웨어 없이 기능을 확장하려는 경우 현실적인 대안이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.