본문으로 건너뛰기

kernel-overlap

커널 오버랩

서로 다른 GPU 커널이 동시에 실행되도록 스케줄링해 연산 자원을 겹치게 사용하는 기법으로, 개별 커널의 런치 지연을 숨기고 전체 처리량을 높이는 목적입니다. 세부적으로는 블록/타일 수준의 의존성을 관리해 어느 시점에 어떤 타일을 실행할지 동적으로 결정하는 방식이 핵심입니다. 하드웨어가 finer‑grained 의존성 트리거를 지원하면 오버랩으로 인한 이득이 커집니다.