왜 중요한가
긴 수평 게임에서는 최종 승패만으로는 어떤 턴이 성공을 만들었는지 판별하기 어렵기 때문에 학습 신호가 희박합니다. CAST는 기존에 손쉽하게 얻을 수 있는 게임 솔버의 상태 가치 변화를 턴별 우선순위 신호로 변환해 RLVR에 주입함으로써 이 문제를 보완합니다. 이렇게 하면 로그 분포 전체가 아닌 스칼라 신호만으로도 교사의 행동 선호를 암묵적으로 반영할 수 있어 효율적이며 실제 실험에서 샘플 효율과 OOD 전이 성능이 개선되었습니다.
관련 Figure

왼쪽 막대그래프는 여러 폐쇄형 LLM의 Sokoban·Minesweeper 성능이 낮음을 비교하고 오른쪽 다이어그램은 outcome-only RL과 솔버 기반 턴 신호의 차이를 시각적으로 제시합니다. 이 도식은 최종 보상만으로는 턴별 책임 귀속이 불가능함을 드러내고, 솔버 가치 변화가 어떤 행동에 긍정적 또는 부정적 기여를 주는지를 직관적으로 보여줍니다. 방법 측면에서 이 그림은 논문의 핵심 동기와 solver-advantage 개념을 연결하는 역할을 합니다.
Figure 1: LLM 성능 바 차트와 방법 개요 다이어그램
핵심 기여
솔버 가치 변화로 턴 수준 크레딧 산출
CAST는 게임 솔버가 어느 정도로 목표에 가까운지를 나타내는 cost-to-go N(s)를 이용해 각 행동의 한스텝 영향력을 계산합니다. 행동 전후의 N(s) 차이를 shifted advantage로 정의하고, 이 값을 턴별 보조 신호로 사용해 희박한 최종 보상만으로는 얻기 힘든 세부적인 피드백을 제공합니다. 이 접근은 솔버가 주는 단일 스칼라 값만으로도 행동 우선순위를 반영할 수 있다는 실용적 메커니즘을 제공합니다.
로그잇 없이 이루어지는 온-폴리시 증류 해석
이론적으로 충분히 강한 소프트-옵티멀 솔버가 있을 때 논문은 솔버 어드밴티지가 교사의 로그 우선순위와 선형 관계임을 보였습니다. 즉 관계를 통해 단일 스칼라 신호로도 교사 분포의 정보를 암묵적으로 보존할 수 있습니다. 이 결과는 전체 logits를 요구하는 기존 증류법을 대체하는 'logit-free'한 온-폴리시 증류 관점으로 CAST를 정당화합니다.
신호 안정화를 위한 asinh·배치 RMS 처리
원시 solver 어드밴티지는 희귀한 치명적 페널티로 인해 꼬리 분포를 가지므로 학습 불안정을 초래할 수 있습니다. 논문은 먼저 로 대형 값을 로그-유사 방식으로 압축하고 이어서 배치 수준의 RMS로 정규화해 게임 간·배치 간 스케일 차이를 제거합니다. 이 두 단계는 학습 안정성 및 범용성 확보에 핵심 역할을 했고, 절제된 실험에서 제거 시 성능 하락이 관찰되었습니다.
3개 고전 게임에서의 일관된 성능 우위
Sokoban, Minesweeper, Rush Hour 세 게임에서 CAST는 동일한 0/1 최종 보상을 사용하는 학습 기반 방법들보다 모든 게임과 평가 설정에서 높은 Avg@4 성능을 냈습니다. 예컨대 훈련 도메인 평균은 DAPO의 44.7%에서 CAST의 62.1%로 향상되었고 미지 난이도 평균도 18.7%에서 28.4%로 상승했습니다. 또한 DAPO의 최종 검증 성능에 도달하는 데 필요한 학습 단계 수를 1.7–2.0× 단축했습니다.
현실적 적용성: 솔버 비용 무시 가능한 수준
실험 측정에서는 솔버 쿼리가 환경 단계당 약 8.4%의 상대 비용을 차지했지만 LLM 생성이 전체 시간의 대부분을 차지해 최종적으로 전체 훈련 시간에서 차지하는 비중은 0.01% 수준으로 매우 작았습니다. 따라서 정확한 솔버를 사용하더라도 엔드투엔드 학습 속도에는 거의 영향이 없었습니다. 또한 근사된 학습 기반 가치망(DQN)으로도 상당한 이득이 유지되어 솔버가 없는 환경에도 확장 가능함을 보였습니다.
핵심 아이디어 이해하기
LLM 에이전트가 긴 에피소드에서 행동별 공헌을 판단하기 어려운 이유는 최종 보상이 에피소드 전체로 균일하게 할당되기 때문입니다. CAST는 상태별 cost-to-go N(s)를 가진 게임 솔버를 턴별 교사로 삼아, 행동 전후의 N(s) 차이를 shifted solver advantage로 변환해 각 행동에 즉각적인 신호를 부여합니다. 이 신호를 asinh로 압축하고 배치 RMS로 정규화한 뒤 기존 RLVR 손실에 가감하면, 학습은 최종 보상을 유지하면서도 턴 수준에서 어떤 행동이 성공으로 이어지는지를 더 잘 학습하게 됩니다.
방법론
문제 입력으로는 텍스트로 인코딩한 게임 상태와 LLM의 샘플링 행동이 들어옵니다. 각 턴에서 CAST는 해당 상태를 솔버에 쿼리해 cost-to-go N(s)와 다음 상태의 N(s')를 얻고, shifted advantage 를 계산합니다. 이 값을 먼저 로 압축한 뒤 배치 내 RMS로 나누어 스케일을 맞추고, 그 결과에 계수 α(기본값 0.1)를 곱해 GRPO의 경사에 더하는 방식으로 최종 학습 신호를 구성합니다.
관련 Figure

곡선은 α 값 변화에 따른 Sokoban의 Avg@4 변화를 보여주며 α=0.1이 검증 성능과 학습 안정성 측면에서 최적임을 나타냅니다. α가 너무 작으면 프로세스 신호가 희석되어 outcome-only와 유사해지고, 너무 크면 초기에는 빠르지만 후반에 성능 저하와 보상 불안정성이 관찰됩니다. 따라서 α는 과정 신호와 최종 보상 사이의 균형을 맞추는 중요한 하이퍼파라미터임을 시사합니다.
Figure 4-left: α(솔버 가중치) 민감도 실험

세 실험 조건(기본, asinh 제거, RMS 제거)을 비교한 결과 asinh 제거 시 성능 저하가 가장 심하고 RMS 제거 시 후반 수렴이 불안정한 양상을 보입니다. 이는 큰 음수·양수 꼬리 값을 제어하는 압축과 배치 스케일 일관화가 서로 보완적인 역할을 함을 의미합니다. 따라서 두 변환은 함께 사용될 때 학습의 안정성과 최종 성능을 확보하는 데 필요합니다.
Figure 4-right: asinh 및 배치 RMS 정규화의 기여도 실험
주요 결과
동일한 0/1 최종 보상을 사용한 조건에서 CAST는 모든 훈련 게임과 평가 설정에서 가장 높은 Avg@4 성공률을 기록했습니다. 훈련 도메인 평균은 기존 DAPO의 44.7%에서 CAST의 62.1%로 상승했고, 미지 난이도 평균은 18.7%에서 28.4%로 개선되었습니다. 또한 CAST는 DAPO가 도달하던 검증 성능을 Sokoban, Minesweeper, Rush Hour에서 각각 약 120, 200, 140 단계에서 달성해 학습 단계 수를 1.7–2.0배 단축했습니다.
관련 Figure

상단 행은 Avg@4 검증 성능을, 하단 행은 학습 보상을 에포크별로 보여주며 CAST(오렌지 계열)가 대부분의 지점에서 더 높은 검증 성능을 기록합니다. 그래프 상에서 CAST는 DAPO의 최고 성능에 도달하는 데 필요한 단계 수를 줄였고, 특히 Minesweeper에서 훈련 보상과 검증 성능 모두에서 우위를 점합니다. 이 결과는 solver-advantage가 샘플 효율과 최종 성능에 동시에 기여함을 실험적으로 뒷받침합니다.
Figure 3: 세 게임(Sokoban, Minesweeper, Rush Hour)의 Avg@4 및 학습 보상 곡선

DQN 기반의 근사 가치망을 솔버 대신 사용할 때 검증 Avg@4 곡선이 정확한 솔버 버전과 근사하게 추종하는 모습을 보여줍니다. 이 관찰은 정확한 솔버가 없더라도 학습 기반 가치망으로부터 유의미한 턴 신호를 얻을 수 있음을 의미합니다. 다만 근사 버전은 최종 성능에서 약간의 격차를 보이며 솔버 품질이 결과에 영향을 줄 수 있음을 시사합니다.
Figure 5: 학습된 가치망(DQN) 대체 솔버 실험의 Rush Hour 검증곡선

종합 비교 곡선은 CAST가 학습 초기부터 중후반까지 다른 훈련 기반 기법보다 높은 Avg@4를 보이며 최종적으로 상위에 머무르는 특성을 보여줍니다. 표준 편차 밴드를 포함해 안정성과 재현성을 함께 제시하여 단일 시드의 우연성 가능성을 낮추었습니다. 이 그림은 논문의 주된 실험 주장인 '턴 수준 솔버 신호가 일관된 이득을 준다'는 점에 대한 시각적 근거를 제공합니다.
Figure: 여러 방법 비교에서 CAST의 Avg@4 학습 곡선
기술 상세
각 게임에 대해 논문은 상태별 cost-to-go N(s)를 정확하게 반환하는 전용 솔버를 구축했고, 이 값을 이용해 행동의 한스텝 이득 를 계산했습니다. 이 신호는 로 먼저 압축된 뒤 배치 단위의 RMS로 나누어 스케일을 맞추고, 계수 α로 조정해 GRPO의 trajectory-level outcome advantage에 합산해 토큰 수준으로 방송합니다. 이론적으로는 소프트-옵티멀 솔버 가정 하에 관계가 성립하여 단일 스칼라가 교사의 로그 우선순위를 암묵적으로 전달하며, 이로부터 최종적으로 교사와의 크로스엔트로피(distillation) 항이 형성되는 것이 증명되었습니다.
한계점
CAST는 상태별로 정확한 cost-to-go를 반환할 수 있는 솔버가 있거나 학습으로 근사할 수 있어야 가장 효과적입니다. 복잡하거나 연속적인 제어 문제에서 정확한 솔버를 확보하기 어렵다면 학습된 가치망의 품질에 성능이 의존하며, 논문 실험에서도 Minesweeper의 미지 난이도 성능은 여전히 낮아 난이도 일반화에 한계가 남았습니다. 또한 α 하이퍼파라미터와 신호 변환의 민감성 때문에 도메인 별로 안정적인 튜닝이 필요합니다.
실무 활용
CAST는 게임별로 접근 가능한 정확한 솔버가 있을 때 턴 수준의 학습 신호를 거의 추가 비용 없이 얻는 방법을 제공합니다. 훈련 중에는 각 롤아웃 상태에서 솔버를 한 번만 쿼리하면 되므로 LLM 생성 비용에 비해 솔버 비용은 미미합니다. 솔버가 없을 경우에는 학습된 가치망을 대체 소스로 사용해도 상당한 이득을 유지할 수 있습니다.
- LLM 기반 에이전트를 긴 수평의 규칙적 환경(예: Sokoban, Rush Hour)에서 빠르게 튜닝할 때 적용할 수 있습니다.
- 부분 관찰 문제(예: Minesweeper)에서 턴별 정보가 부족해 생기는 크레딧 할당 문제를 완화하는 데 유용합니다.
- 정확한 도메인 솔버가 존재하는 시뮬레이션 또는 시나리오에서 신속한 샘플 효율 개선을 위해 도입할 수 있습니다.
- 정책의 교사 역할을 하는 외부 평가기가 있으면 로짓 없이도 온-폴리시 증류 효과를 얻으려는 연구용으로 적합합니다.
- 솔버를 대체하는 근사 가치 네트워크를 함께 학습하는 전통적 RL 파이프라인에도 통합할 수 있습니다.
코드 공개 여부: 공개
코드 저장소 보기관련 Figure

그림은 솔버 쿼리가 환경 단계에서 차지하는 상대적 비용과 전체 훈련에서의 희석 효과를 계층적으로 분해해 보입니다. 솔버 쿼리는 환경 단계 내에서는 유의미한 비중을 가질 수 있지만, LLM 생성과 최적화가 전체 시간의 대부분을 차지하여 엔드투엔드 관점에서는 매우 작은 오버헤드로 귀결됩니다. 따라서 실무 적용 시 솔버 쿼리 비용은 일반적으로 병목이 되지 않습니다.
Figure 6: 솔버 쿼리의 런타임 기여도 분석
키워드
용어 해설
- 솔버 어드밴티지(Solver Advantage)
- — 솔버 어드밴티지는 상태 s에서 행동 a가 비용-투-고(cost-to-go) N(s)를 얼마나 줄이는지를 수치로 표현한 값입니다. 구체적으로는 한 단계 이동 후 기대되는 N(s_{t+1}) 차이를 이용해 A= N(s_t)-E[N(s_{t+1})]로 계산합니다. 이 값은 양수면 진전, 0이면 무효 혹은 정체, 음수면 해가 되는 행동을 의미하므로 턴별 신호로 활용할 수 있습니다.
- asinh 변환(asinh Transformation)
- — asinh 변환은 큰 절대값을 가진 드문 신호를 부드럽게 압축하면서 작은 값 영역의 해상도를 유지하는 비선형 스케일링 기법입니다. 논문에서는 g(x)=asinh(x)=ln(x+sqrt(x^2+1))를 사용해 드문 치명적 페널티가 기울기를 지배하는 문제를 완화합니다. 이 변환은 음수와 양수를 모두 정의하므로 진전·중립·해악 신호의 부호 정보를 보존합니다.
- 배치 RMS 정규화(Batch-level RMS Normalization)
- — 배치 RMS 정규화는 한 배치 내 모든 턴에 대해 변환된 신호의 제곱평균의 제곱근으로 값을 나누어 도메인 간 스케일 차이를 제거하는 방법입니다. 논문에서는 asinh로 압축한 뒤 RMS로 나누어 서로 다른 난이도·게임 간 신호 범위를 일관되게 맞춥니다. 평균을 빼지 않아 0이 '진전 없음'이라는 의미를 유지하도록 설계했습니다.
- 온-폴리시 증류(On-Policy Distillation)
- — 온-폴리시 증류는 학생 정책이 자신의 온-폴리시 방문 분포에서 교사 정책의 행동 선호도를 학습하도록 하는 방법입니다. 본 논문은 솔버의 로그 우선순위가 행동 어드밴티지와 비례한다는 관계을 이용해 게임 솔버로부터 logit 없이 증류하는 방식을 제시합니다. 이로써 교사 분포 전체를 요구하지 않고 스칼라 신호만으로 교사 선호를 암묵적으로 반영합니다.
- Reinforcement Learning with Verifiable Rewards(RLVR)
- — RLVR은 검증 가능한 최종 보상(예: 승패 0/1)을 사용하는 강화학습 설정을 가리킵니다. 게임처럼 결과 보상이 희박한 환경에서는 턴별 책임 귀속 문제가 발생하므로 단순한 결과 기반 학습만으로는 효과가 제한적입니다. CAST는 RLVR의 여기에 턴 수준의 솔버 신호를 추가하여 희박 보상 문제를 보완합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.