Reflection-Based Planning
반성 기반 계획
모델이 스스로 실패를 텍스트로 비판·분석하고 그 정보를 바탕으로 출력을 반복 개선하는 방식이다. 입력(초기 답안)을 자기비판적 텍스트로 변환해 내부 상태를 갱신하고 재실행하여 출력 품질을 높인다. 보상 신호 대신 텍스트 기반 자기교정으로 학습·향상이 가능하다.
반성 기반 계획
모델이 스스로 실패를 텍스트로 비판·분석하고 그 정보를 바탕으로 출력을 반복 개선하는 방식이다. 입력(초기 답안)을 자기비판적 텍스트로 변환해 내부 상태를 갱신하고 재실행하여 출력 품질을 높인다. 보상 신호 대신 텍스트 기반 자기교정으로 학습·향상이 가능하다.