본문으로 건너뛰기

tensorengine-tiling

TensorEngine 타일링

Trainium의 매트릭스 연산 유닛에서 입력을 블록 단위로 분할해 처리하는 실행 패턴으로, 연산-메모리 접근 균형을 조정한다. 타일 크기와 레이아웃 선택이 TFLOPs 대비 메모리 대역폭 요구를 크게 바꿀 수 있다. 적절한 타일링은 계산 집약성 증가와 메모리 트래픽 감소 간의 트레이드오프를 제공한다.