본문으로 건너뛰기

실행 전에 확인하기: 트리 탐색을 행동 평가로 증류해 동결 VLA 성능을 개선한 SVA

동결된 Vision-Language-Action 정책에서 MCTS로 얻은 장기 보상 신호를 경량 Q-평가기로 증류해 후보 행동을 재점검함으로써 테스트타임 계산만으로 일반화 성능과 성공률을 크게 향상시켰다.

용어 해설

패스@k(Pass@k)
여러 번의 독립된 정책 샘플링 중 최소 하나가 성공할 확률을 추정하는 지표로, 출력을 여러 번 샘플링해 상위 성공 확률을 평가하여 모델의 잠재적 행동 분포에 존재하는 성공 사례를 정량화한다.
몬테카를로 트리 서치(MCTS)
정책을 시뮬레이터에서 반복적으로 전개하여 각 분기별 누적 보상으로 노드 가치를 추정하는 탐색 기법으로, PUCT 같은 바이어스 규칙으로 우선순위를 조정하고 롤아웃 결과를 백업해 고보상 경로를 집중 탐색한다.
Q값(행동 가치)(Q-value)
주어진 상태와 후보 행동이 장기적으로 얻을 것으로 기대되는 할인 누적 보상값으로, 본문에서는 MCTS로 수집한 실험적 수익을 학습 대상 타깃으로 하여 경로의 장기적 결과를 예측하는 예측기로 사용된다.
LoRA
대형 언어·비전 모델의 파라미터 전부를 갱신하지 않고 저순위 적응 행렬만 학습하는 기법으로, 본문에서는 경량 Q-평가기 학습 시 백본 고정 상태에서 효율적으로 파라미터를 조정하는 데 사용된다.
테스트타임 스케일링(Test-Time Scaling)
배포 시점에 후보 행동 수를 늘려 계산을 확장하는 전략으로, 후보를 더 많이 생성한 뒤 학습된 평가기로 재점검해 높은 품질 행동을 선택함으로써 모델 크기 확장이 아닌 계산 할당으로 성능을 향상시키는 방법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 04.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.