4.1 PlanningBench를 평가 체계로 사용한 결과, 가장 강력한 모델인 GPT-5.4-xhigh가 All-pass 63.17% 및 Avg-pass 92.35%를 달성했다. 그다음으로 GPT-5.4-high 58.56% All-pass, 84.60% Avg-pass, GPT-5.4-medium 58.09% All-pass, 90.03% Avg-pass를 보였다. Open-source 모델의 경우 Seed-2.0-pro-high가 All-pass 44.33%, Avg-pass 84.02%로 상위권이었고, DeepSeek-V3.2-thinking 등이 37.13% All-pass와 80.21% Avg-pass를 기록했다. 실패 원인은 주로 Wrong Calculation / Assignment가 지배적이며, Constraint Omitted 비율은 4.2%~19.9%, State Tracking 4.≤% ~11.3% 등으로 나타났다. 4.2 Training 데이터로 PlanningBench를 활용한 일반화 실험에서 Syn-PlanningBench는 ChinaTravel에서 Avg-pass를 84.88%에서 88.12%로, All-pass를 50.92%에서 58.36%로 향상시켰다. TravelPlanner의 경우 Avg-pass가 80.84%에서 88.99%로 증가했고 All-pass는 28.85%에서 46.86%로 향상됐다. 일반 지시-이행 벤치마크(Multi-Challenge, Inverse IFEval, Collie)에서도 Syn-PlanningBench가 평균 성능 향상을 이끌었고, 특히 Collie에서 38.33%에서 53.17%로 큰 증가를 보였다. Syn-NotDetOptimal은 전이 효과가 작았고, Human-Authored 데이터와의 비교에서도 제약 구성과 검증 신호가 학습에 유효한 PlanningBench 데이터의 우수성을 시사한다. 4.2.4 Training Dynamics에서 Syn-PlanningBench는 solve-none 비율이 더 빨리 감소하고 solve-all 비율이 더 안정적으로 증가하며, 크리틱 보상도 더 매끄럽게 수렴했다. 전체적으로 Determinacy 있는 보상 신호가 PlanningBench 기반 강화학습의 안정성과 전이 성능을 높인다. 5 결론 PlanningBench는 real planning 시나리오에서 파생된 Task/Constraint Taxonomy와 Constraint-driven synthesis를 통해 확장 가능하고 검증 가능한 데이터를 생성하며, 평가와 planning-oriented training에 활용할 수 있는 데이터 풀을 제공한다. 실험적으로 PlanningBench는 강력한 모델에서도 All-pass 비율이 여전히 크게 남아 있음을 보였고, 제약 결합 및 전역 일관성의 중요성을 확인했다. 또한 GRPO 기반 학습은 외부 벤치마크로의 일반화와 일반 지시-이행 벤치마크로의 전이에서 긍정적 효과를 나타냈으며, 데이터의 Determinacy가 안정적이고 방향성 있는 보상을 가능하게 한다. 결론적으로, PlanningBench의 제약 기반 데이터 생성, 자동 검증, 보상 결정성은 LLM의 계획 능력 진단 및 개선에 유의미한 신호를 제공한다.