용어 해설
- 패스@k(Pass@k)
- — 여러 번의 독립된 정책 샘플링 중 최소 하나가 성공할 확률을 추정하는 지표로, 출력을 여러 번 샘플링해 상위 성공 확률을 평가하여 모델의 잠재적 행동 분포에 존재하는 성공 사례를 정량화한다.
- 몬테카를로 트리 서치(MCTS)
- — 정책을 시뮬레이터에서 반복적으로 전개하여 각 분기별 누적 보상으로 노드 가치를 추정하는 탐색 기법으로, PUCT 같은 바이어스 규칙으로 우선순위를 조정하고 롤아웃 결과를 백업해 고보상 경로를 집중 탐색한다.
- Q값(행동 가치)(Q-value)
- — 주어진 상태와 후보 행동이 장기적으로 얻을 것으로 기대되는 할인 누적 보상값으로, 본문에서는 MCTS로 수집한 실험적 수익을 학습 대상 타깃으로 하여 경로의 장기적 결과를 예측하는 예측기로 사용된다.
- LoRA
- — 대형 언어·비전 모델의 파라미터 전부를 갱신하지 않고 저순위 적응 행렬만 학습하는 기법으로, 본문에서는 경량 Q-평가기 학습 시 백본 고정 상태에서 효율적으로 파라미터를 조정하는 데 사용된다.
- 테스트타임 스케일링(Test-Time Scaling)
- — 배포 시점에 후보 행동 수를 늘려 계산을 확장하는 전략으로, 후보를 더 많이 생성한 뒤 학습된 평가기로 재점검해 높은 품질 행동을 선택함으로써 모델 크기 확장이 아닌 계산 할당으로 성능을 향상시키는 방법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





