무작위 깊이 감독
B 루프 중 일부 깊이만 선택적으로 그래디언트를 흘려보내고, 나머지는 detach/no_grad로 처리함으로써 긴 루프에서도 메모리와 학습 안정성을 유지하는 학습 전략이다.