본문으로 건너뛰기

OMLX의 ANE·GPU 병렬 Prefill 실험

OMLX가 MLP와 GDN 일부를 ANE·GPU에 분할해 Prefill 처리량을 높였지만 메모리 사용량은 약 2배 늘었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OMLX의 실험적 dual-ANE/GPU 경로는 MLP와 GDN 일부를 ANE와 GPU에 나눠 Prefill을 병렬 처리합니다. Qwen3.8 27B q4와 M3 Ultra에서 프리필 처리량이 약 50% 높아졌다는 보고가 있으며, 게시자는 M1 Pro와 32GB RAM에서 9B 모델 기준 280에서 334로 약 19% 향상된 수치를 얻었습니다. 대신 최대 메모리 사용량이 약 2배로 늘어 27B 모델 실행이 어려웠고, 기능 사용에는 커스텀 커널을 포함한 소스 설치가 필요할 가능성이 있습니다.

실용적 조언

  • 기능을 시험하려면 omlx를 소스에서 설치하고 OMLX_WITH_CUSTOM_KERNEL=1을 설정해야 할 가능성이 있습니다. 게시자는 이 기능이 custom kernels에 포함됐으며 다른 설치 경로에서 제공되는지는 확실하지 않다고 밝혔습니다. 메모리 사용량이 기존 방식보다 약 2배 늘 수 있으므로 27B 모델보다 작은 모델로 먼저 확인하는 접근이 필요합니다.

섹션별 상세

01
작성자는 ANE 열풍이 있던 3월에 비슷한 구성을 시도했지만, 4B dense 모델에서 동기화를 생략하면 출력이 손상되고 동기화를 유지하면 기준선에 크게 못 미쳤다고 회고합니다. 이번 구현은 MLP와 GDN의 일부만 분할해 장치 간 작업량을 제한하고, 커스텀 커널과 기타 최적화를 결합하는 방식입니다. Qwen3.8 27B q4를 M3 Ultra에서 실행한 결과로 프리필 처리량이 약 50% 높아졌다는 보고가 나왔고, 다른 사용자와 maintainer도 향상을 확인했다는 내용입니다.
02
작성자는 평소 자체 수정 사항을 더한 mlx.vlm을 사용했지만, 이번 결과를 재현하기 위해 omlx를 내려받아 자신의 M1 Pro와 32GB RAM 환경에서도 시험했습니다. 27B 모델은 이 방식이 최대 메모리를 약 2배 사용해 q4에서도 실행하지 못했기 때문에 9B 모델로 바꿨고, 프리필 수치가 280에서 334로 올라 약 19% 증가했습니다. 따라서 장치 병렬화의 속도 이득과 함께 메모리 사용량 증가가 실제 적용 범위를 제한하는 요소로 드러납니다.

용어 해설

Apple Neural Engine(ANE)
Apple Silicon에 탑재된 신경망 연산 프로세서로, GPU와 별도의 실행 장치입니다. 이 글에서는 모델 연산 일부를 ANE로 보내 GPU와 병렬 처리해 Prefill 처리량을 높이는 실험적 구성이 핵심입니다.
프리필(Prefill)
모델이 입력 프롬프트의 여러 토큰을 한 번에 처리해 초기 KV cache를 만드는 단계입니다. 생성 단계보다 병렬성이 높아 ANE와 GPU의 작업 분할 효과를 측정하는 주요 지표로 쓰입니다.
다층 퍼셉트론 블록(MLP)
Transformer 내부에서 각 토큰의 표현을 독립적으로 변환하는 피드포워드 구성 요소입니다. 이 실험에서는 MLP의 일부를 다른 연산 장치로 분할해 GPU와 ANE의 동시 실행을 시도합니다.
Gated Delta Network(GDN)
순차적인 상태 갱신을 수행하는 신경망 구성 요소로, Qwen 계열 모델의 일부 구조에 포함됩니다. 글의 구현은 MLP와 함께 GDN의 일부를 분할해 장치 간 병렬 처리를 구성합니다.
커스텀 커널(custom kernels)
기본 실행 경로 대신 특정 하드웨어와 연산 패턴에 맞춰 작성한 저수준 연산 코드입니다. 해당 기능은 커스텀 커널 경로에 포함되어 OMLX_WITH_CUSTOM_KERNEL=1 설정과 소스 설치가 필요할 가능성이 있습니다.

언급된 도구

omlx추천

ANE와 GPU에 모델 연산 일부를 분할해 실행하는 추론 프레임워크입니다.

mlx.vlm중립

게시자가 평소 사용하던 Apple Silicon용 모델 실행 라이브러리입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.