용어 해설
- 프로세스 보상 모델(PRM)
- — 최종 결과뿐만 아니라 추론의 각 중간 단계에 대해 점수를 부여하는 모델이다. 수학이나 의료와 같이 논리적 과정이 중요한 분야에서 오류가 누적되는 것을 방지하고 추론의 신뢰성을 높이는 역할을 한다.
- 빔 서치(Beam Search)
- — 생성 모델이 다음 토큰을 선택할 때 가장 확률이 높은 상위 B개의 경로(빔)를 유지하며 탐색하는 알고리즘이다. 단일 경로만 쫓는 탐욕적 방식보다 더 최적의 전체 문장을 생성할 확률이 높다.
- 테스트 시점 스케일링(Test-time Scaling)
- — 모델을 새로 학습시키지 않고 추론(테스트) 단계에서 연산량을 늘려 성능을 높이는 기법이다. 여러 경로를 탐색하거나 외부 지식을 검색하는 등의 방식을 통해 모델의 잠재력을 끌어낸다.
- 마진 시프트(Margin Shift)
- — 외부 정보가 주어졌을 때 모델이 판단하는 정답과 오답 사이의 확률 격차 변화를 의미한다. 이 변화가 클수록 해당 정보가 모델의 의사결정에 중요한 영향을 미쳤음을 나타내는 지표로 활용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
