섹션별 상세
AMD RDNA 4 아키텍처의 AI 가속기를 활용하기 위해 VK_KHR_cooperative_matrix를 적극적으로 도입했다. Q4_K 및 Q6_K GEMM 연산을 RDNA 4의 128개 AI 가속기로 분산 처리하며, 타일 크기에 따른 런타임 셀렉터를 통해 최적의 파이프라인을 선택한다. 이를 통해 프리필(Prefill) 단계에서 llama.cpp의 90% 수준에 달하는 성능을 구현했다.
업계 최초로 VK_EXT_shader_float8을 통한 네이티브 FP8 E4M3 KV 캐시를 지원한다. 기존 FP16 대비 캐시 메모리 점유율을 50% 절감하면서도 디코딩 속도를 1~4% 향상시키는 성과를 거두었다. 15개의 벤치마크 프롬프트 테스트 결과 FP16과 동일한 수준의 출력 일관성을 유지함이 확인됐다.
CPU의 커맨드 기록과 GPU의 연산을 병렬로 처리하는 3단계 비동기 파이프라인 디코딩 루프를 구현했다. GPU가 현재 토큰을 계산하는 동안 CPU는 다음 토큰을 위한 커맨드 버퍼를 미리 기록하여 대기 시간을 숨긴다. 이 최적화를 통해 이전 버전 대비 디코딩 성능이 약 19.3% 향상되어 초당 100토큰 이상의 처리량을 달성했다.
SafeTensors 형식의 FP8 모델을 FP16이나 BF16으로 변환하지 않고 네이티브 상태 그대로 로드하여 실행한다. Meta-Llama-3.1-8B-Instruct-FP8 모델 기준 GPU 메모리 점유율을 7.48 GiB로 억제하며 초당 68.5토큰의 디코딩 속도를 기록했다. 이는 16GB VRAM을 가진 소비자용 GPU에서 14B급 모델까지 구동할 수 있는 기반을 마련한 것이다.
기술
- Rust
- Vulkan
- ash
- SafeTensors
- GGUF
- SPIR-V
활용 사례
- 로컬 LLM 챗봇 서비스
- GPU 메모리 제한 환경에서의 대규모 모델 추론
- Rust 기반 AI 애플리케이션 통합
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 04.수집 2026. 05. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
