ESPO
확산 모델의 강화학습 과정에서 발생하는 모델 붕괴를 방지하기 위해 설계된 시퀀스 레벨 최적화 알고리즘이다. 개별 토큰 단위의 미세 조정 대신 전체 결과물의 품질을 평가하여 가중치를 업데이트함으로써 학습의 안정성을 확보한다. 순수 확산 아키텍처에서도 효과적인 성능 향상을 이끌어내는 핵심 기술이다.