AVX2+FMA 명령어
x86 계열 CPU에서 벡터 연산을 고속으로 수행하는 SIMD 명령어 세트로, AVX2는 넓은 레지스터 단위 병렬 처리를 제공하고 FMA는 곱셈-덧셈 결합 연산을 단일 명령으로 처리한다. 이 프로젝트에서는 블로킹·타일링과 RHS 패킹을 결합한 마이크로커널 최적화로 캐시 지역성을 높이고 AVX2+FMA 경로를 활용해 행렬곱 성능을 개선했다. CPU 전용 고성능 수치 연산을 구현할 때 명령어 세트 최적화는 핵심 성능 요소이다.