강화학습 셀프-플레이
강화학습 셀프-플레이는 에이전트들이 스스로 상호작용하면서 정책을 개선하는 학습 방식이다. 입력은 에이전트 초깃상태와 행동 공간이며, 과정은 에이전트들이 동일 환경에서 서로 역할을 수행하면서 에피소드를 생성하고 보상으로 정책을 갱신하는 루프이다. 출력은 상호 경쟁·협력으로 향상된 행동 정책으로, 논문 썸네일에는 '세 역할이 하나의 RL self-play 루프 안에서 공동 진화한다'고 표기되어 있다.