협력적 커널 런치
협력적 커널 런치는 GPU에서 스레드 집단이 단일 커널 호출 내에서 협력해 여러 토큰 또는 단계의 연산을 처리하는 방식으로, 커널 호출 수를 줄이고 메모리·동기화 오버헤드를 낮춰 지연과 비용을 줄일 수 있다.