TL;DR
Transformer 추론의 전력 부담을 줄이기 위해 Extropic은 확률적 CMOS 칩 Z1과 FPGA를 결합한 sparse 모델 Z1T를 설계했습니다. Z1T는 Z1의 고정된 sparse connectivity에 맞춰 Gated Convolutional Attention과 4-bit weight를 사용하고, Z1에서 처리하기 어려운 연산은 FPGA로 분리합니다. Z1T가 GPT-2와 비슷한 손실에 도달하려면 약 한 자릿수 더 많은 학습 FLOPs가 필요하지만, Z1 연산 자체는 GPU보다 약 3자릿수 높은 에너지 효율을 보여 전체 모델에서는 약 2자릿수 개선을 기대할 수 있습니다. 다만 현재 구성에서는 FPGA가 에너지의 95% 이상을 차지해 병목으로 남으며, 이를 제거하면 GPU 대비 최대 1000배 에너지 효율을 목표로 할 수 있다는 추정이 제시됩니다.
섹션별 상세




용어 해설
- 확률적 하드웨어(Probabilistic Hardware)
- — 확률 회로의 상태 자체를 계산 과정에 활용하는 하드웨어입니다. Z1은 pbit 간 결합을 조절해 Ising model의 확률 분포를 샘플링하고, 여러 샘플의 통계적 평균을 고전적 벡터로 변환합니다. 낮은 전력에서 확률적 연산을 수행한다는 점이 Transformer 추론의 에너지 절감과 연결됩니다.
- 확률 비트(pbit)
- — 확률적으로 0과 1 또는 두 상태 사이를 오가는 이진 CMOS 회로 단위입니다. Z1의 각 pbit는 이웃 pbit의 상태와 programmable coupling에 따라 다음 상태의 확률을 정하며, 50 MHz 내부 업데이트 클록에서 Gibbs sampling을 수행합니다. 여러 pbit의 묶음은 저정밀 정수와 비슷한 표현을 구성할 수 있습니다.
- Gibbs 샘플링(Gibbs Sampling)
- — 주변 변수의 현재 상태를 조건으로 삼아 한 변수를 차례로 갱신하는 확률적 샘플링 방법입니다. Z1은 각 pbit가 이웃 상태에 조건부인 새 값을 메모리 내부에서 계산하도록 하며, 이를 통해 programmable Ising model의 상태 분포를 생성합니다. 글에서는 이 구조가 확률적 신경 연산을 하드웨어에 직접 배치하는 기반으로 쓰입니다.
- 게이트형 합성곱 어텐션(Gated Convolutional Attention)
- — Z1의 sparse하고 국소적인 연결 구조에 맞춰 설계한 attention 변형입니다. tanh와 선형 연산을 사용해 고정된 물리적 connectivity 안에서 Transformer와 유사한 표현을 만들며, Z1T의 핵심 구조로 적용됩니다. 글의 scaling 실험에서는 GCA 기반 Z1T 모델의 손실과 학습 FLOPs 관계를 GPT-2 기준선과 비교합니다.
- 분리형 추론(Disaggregated Inference)
- — 하나의 모델 추론 그래프를 여러 종류의 프로세서와 단계로 나눠 실행하는 방식입니다. Z1T는 Z1에서 sparse 연산을 처리하고 FPGA에서 Z1에 맞지 않는 연산을 수행하며, 두 장치 사이에 pipeline parallelism과 model parallelism을 결합합니다. 이 구조는 기존 GPU를 모두 대체하기보다 Z1과 dense matmul 가속기를 함께 사용해 토큰당 에너지 비용을 낮추려는 접근입니다.
기술
- Z1
- Z1T
- FPGA
- XPU
- Transformer
- Gated Convolutional Attention
- GPT-2
- OpenWebText
- GPT-2 BPE tokenizer
- Ising model
- Gibbs sampling
- RMS normalization
- GELU
활용 사례
- 대규모 Transformer 추론의 토큰당 전력 절감
- Z1과 FPGA를 결합한 이기종 decoding pipeline
- 고정 sparse connectivity에 맞춘 언어 모델 설계
- 확률적 하드웨어를 활용한 데이터센터 추론
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
