힌트 기반 유도
샘플링 단계에서는 쿼리 앞에 텍스트 힌트를 덧붙여 탐색을 유도하되 최적화 단계에서는 힌트를 제거하는 전략이다. 힌트는 수동 주석이나 LLM 생성으로 얻을 수 있으며 학습된 정책이 힌트에 의존하지 않도록 설계된다. 논문에서는 HBG가 일부 탐색 개선을 제공하지만 포맷 민감성 문제를 완전히 해소하지는 못하는 것으로 보고되었다.