용어 해설
- 지도 미세 조정(SFT)
- — 사람이 작성한 정답 데이터(질문-도구 호출-결과-최종 답변)를 모델에 직접 학습시키는 방식이다. 모델에게 정답 경로를 명시적으로 보여주어 초기 성능을 확보하지만, 고품질 데이터를 대량으로 구축하는 데 막대한 비용과 시간이 소요된다는 단점이 있다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 모델(Value Model) 없이, 하나의 질문에 대해 생성된 여러 응답 그룹 내에서 상대적인 보상을 비교하여 모델을 업데이트하는 강화학습 알고리즘이다. 연산 자원을 절약하면서도 모델의 추론 능력을 효과적으로 향상시킬 수 있어 최근 대형 모델 학습에 널리 사용된다.
- 롤아웃(Rollout)
- — 강화학습 과정에서 현재의 모델(정책)을 사용하여 실제로 질문에 대한 답변이나 행동 경로를 끝까지 생성해보는 단계를 의미한다. 이 단계에서 생성된 결과물에 대해 보상을 부여하고, 그 보상을 바탕으로 모델의 가중치를 업데이트하여 더 나은 결과를 내도록 유도한다.
- 손실 마스킹(Loss Masking)
- — 학습 과정에서 특정 토큰 구간에 대한 손실(Loss) 계산을 의도적으로 제외하는 기법이다. 이 논문에서는 외부 도구가 반환한 정보처럼 모델이 직접 생성하지 않은 텍스트 구간을 마스킹하여, 모델이 오직 자신의 추론 로직과 도구 호출 문법을 개선하는 데만 집중하게 한다.
- 다단계 추론(Multi-hop Reasoning)
- — 단순한 지식 인출을 넘어, 여러 단계의 정보 검색과 논리적 결합이 필요한 복잡한 사고 과정을 의미한다. 예를 들어 'A의 고향에서 열리는 축제의 이름은?'이라는 질문에 답하기 위해 A의 고향을 먼저 찾고, 그 지역의 축제를 다시 검색하는 식의 연속적인 도구 활용 능력이 요구된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.