이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
M4 칩의 Neural Engine이 독립된 프로세서가 아닌 CPU 내 SME2 유닛임을 벤치마크와 직접 구현한 도구로 입증했다.
배경
Apple M4 칩의 Neural Engine이 실제로는 CPU 내장 SME2 유닛임을 증명하기 위해 직접 개발한 인터프리터와 벤치마크 결과를 공유했다.
의미 / 영향
이 토론은 애플 실리콘의 폐쇄적인 하드웨어 가속 구조를 분석하여 표준 ARM 확장 기능과의 연관성을 밝혀냈다. 개발자들이 제조사의 프레임워크에 의존하지 않고 하드웨어 잠재력을 직접 제어할 수 있는 기술적 근거를 제시했다.
커뮤니티 반응
작성자의 기술적 분석과 리버스 엔지니어링 결과에 대해 놀라움을 표하며, 애플의 마케팅 용어와 실제 하드웨어 구조 간의 괴리에 대한 심도 있는 기술 토론이 이어졌다.
주요 논점
01찬성다수
벤치마크 결과와 하드웨어 특성이 일치하므로 ANE와 SME2가 동일한 자원이라는 주장에 동의한다.
합의점 vs 논쟁점
합의점
- M4 칩에서 SME2와 CoreML은 동일한 하드웨어 자원을 두고 경합한다.
- SME2를 직접 제어하면 CoreML 수준의 행렬 연산 성능을 구현할 수 있다.
논쟁점
- 애플이 기술적으로 동일한 유닛을 왜 독립된 하드웨어인 것처럼 마케팅했는지에 대한 의도 분석.
실용적 조언
- M4 환경에서 CoreML의 오버헤드를 피하고 싶다면 SME2를 직접 활용하는 로우레벨 접근 방식을 고려할 수 있다.
섹션별 상세
애플은 Neural Engine을 독립된 16코어 프로세서로 마케팅하지만 실제로는 CPU 내의 행렬 연산 유닛일 가능성이 크다. 마케팅 시트에는 38 TOPS 성능의 별도 칩으로 기재되어 있으나 하드웨어 수준에서는 CPU 코어와 밀접하게 결합된 구조이다. 이를 이해하면 CoreML 프레임워크를 거치지 않고도 하드웨어에 직접 접근하여 연산을 수행할 수 있다.
작성자는 CoreML 없이 M4 Pro Max의 ZA 타일 배열을 직접 구동하는 bare-metal ARM SME2 바이트코드 인터프리터를 구현했다. 이 인터프리터는 CPU를 스트리밍 모드로 전환하여 smstart와 smstop 명령어 사이에서 행렬 연산을 수행하도록 설계됐다. 스트리밍 모드는 메모리 로드 및 저장 작업을 최적화하여 행렬 유닛에 데이터를 효율적으로 공급하는 역할을 한다. 여러 명령어를 하나의 스트림 세션으로 묶어 어셈블리 커널을 매번 작성하지 않고도 연속적인 연산이 가능하다.
M4 Max 칩에서 GPU, CPU SME, CoreML(BNNS) 간의 자원 경합 벤치마크를 수행하여 두 유닛의 동일성을 확인했다. 실험 결과 CoreML이 네트워크를 처리할 때 SME2 유닛의 처리량이 정확히 절반으로 감소하는 현상이 반복적으로 나타났다. 이는 Neural Engine과 SME2가 동일한 실리콘 자원을 공유하며 서로 경쟁하고 있음을 입증하는 강력한 근거이다. 또한 두 유닛의 처리량 한계와 지원 정밀도(INT8 선호, FP8 미지원)가 완전히 일치함이 확인됐다.
결론적으로 M4의 Neural Engine은 CPU 코어에 내장된 SME2 하드웨어를 소프트웨어적으로 추상화한 명칭에 불과하다. 애플의 마케팅 부서가 동일한 하드웨어 기능을 별도의 이름과 성능 지표로 포장하여 소비자에게 전달한 것이다. 이러한 구조적 실체를 파악함으로써 개발자는 애플의 폐쇄적인 소프트웨어 스택을 우회하여 하드웨어의 잠재력을 직접 활용할 수 있는 길을 열었다.
용어 해설
- SME2
- — ARM 아키텍처에서 행렬 연산을 가속하기 위해 도입된 확장 기능이다. CPU 코어 내에서 대규모 행렬 곱셈 및 외적 연산을 효율적으로 처리하여 머신러닝 성능을 극대화하는 역할을 한다.
- ZA Tile
- — SME 아키텍처에서 행렬 데이터를 저장하고 연산하기 위해 사용하는 특수 레지스터 배열이다. 대량의 데이터를 한 번에 처리할 수 있는 누산기 상태를 유지하여 행렬 연산의 처리량을 높인다.
- CoreML
- — 애플 기기에서 머신러닝 모델을 통합하고 실행하기 위한 프레임워크이다. CPU, GPU, Neural Engine 등 최적의 하드웨어를 자동으로 선택하여 모델 추론을 수행하도록 돕는다.
- BNNS
- — 애플의 Accelerate 프레임워크에 포함된 신경망 연산 가속 라이브러리이다. CPU의 벡터 및 행렬 연산 기능을 활용하여 딥러닝 모델의 핵심 연산을 최적화하여 실행한다.
- TOPS
- — 하드웨어가 초당 수행할 수 있는 테라(1조) 번의 연산 횟수를 나타내는 지표이다. 주로 AI 가속기나 신경망 처리 장치의 성능을 비교할 때 사용되는 핵심 수치이다.
언급된 도구
M4 CPU의 ZA 타일을 직접 제어하기 위한 인터프리터
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 04.수집 2026. 04. 04.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.