TL;DR
OMLX의 실험적 dual-ANE/GPU 경로는 MLP와 GDN 일부를 ANE와 GPU에 나눠 Prefill을 병렬 처리합니다. Qwen3.8 27B q4와 M3 Ultra에서 프리필 처리량이 약 50% 높아졌다는 보고가 있으며, 게시자는 M1 Pro와 32GB RAM에서 9B 모델 기준 280에서 334로 약 19% 향상된 수치를 얻었습니다. 대신 최대 메모리 사용량이 약 2배로 늘어 27B 모델 실행이 어려웠고, 기능 사용에는 커스텀 커널을 포함한 소스 설치가 필요할 가능성이 있습니다.
실용적 조언
- 기능을 시험하려면 omlx를 소스에서 설치하고 OMLX_WITH_CUSTOM_KERNEL=1을 설정해야 할 가능성이 있습니다. 게시자는 이 기능이 custom kernels에 포함됐으며 다른 설치 경로에서 제공되는지는 확실하지 않다고 밝혔습니다. 메모리 사용량이 기존 방식보다 약 2배 늘 수 있으므로 27B 모델보다 작은 모델로 먼저 확인하는 접근이 필요합니다.
섹션별 상세
용어 해설
- Apple Neural Engine(ANE)
- — Apple Silicon에 탑재된 신경망 연산 프로세서로, GPU와 별도의 실행 장치입니다. 이 글에서는 모델 연산 일부를 ANE로 보내 GPU와 병렬 처리해 Prefill 처리량을 높이는 실험적 구성이 핵심입니다.
- 프리필(Prefill)
- — 모델이 입력 프롬프트의 여러 토큰을 한 번에 처리해 초기 KV cache를 만드는 단계입니다. 생성 단계보다 병렬성이 높아 ANE와 GPU의 작업 분할 효과를 측정하는 주요 지표로 쓰입니다.
- 다층 퍼셉트론 블록(MLP)
- — Transformer 내부에서 각 토큰의 표현을 독립적으로 변환하는 피드포워드 구성 요소입니다. 이 실험에서는 MLP의 일부를 다른 연산 장치로 분할해 GPU와 ANE의 동시 실행을 시도합니다.
- Gated Delta Network(GDN)
- — 순차적인 상태 갱신을 수행하는 신경망 구성 요소로, Qwen 계열 모델의 일부 구조에 포함됩니다. 글의 구현은 MLP와 함께 GDN의 일부를 분할해 장치 간 병렬 처리를 구성합니다.
- 커스텀 커널(custom kernels)
- — 기본 실행 경로 대신 특정 하드웨어와 연산 패턴에 맞춰 작성한 저수준 연산 코드입니다. 해당 기능은 커스텀 커널 경로에 포함되어 OMLX_WITH_CUSTOM_KERNEL=1 설정과 소스 설치가 필요할 가능성이 있습니다.
언급된 도구
ANE와 GPU에 모델 연산 일부를 분할해 실행하는 추론 프레임워크입니다.
게시자가 평소 사용하던 Apple Silicon용 모델 실행 라이브러리입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.