본문으로 건너뛰기

대형 언어 모델의 도구 사용을 위한 인컨텍스트 강화학습

LLM이 검색이나 계산기 같은 도구를 배우려면 수만 개의 정답 데이터를 학습시키는 비싼 과정(SFT)이 필수적이었으나, 이 논문은 프롬프트 예시만으로 강화학습을 시작해 이 비용을 획기적으로 줄였다. 특히 복잡한 검색이 필요한 문제에서 기존 방식보다 훨씬 높은 정확도를 보여주며 효율적인 AI 에이전트 학습의 새로운 방향을 제시한다.

용어 해설

지도 미세 조정(SFT)
사람이 작성한 정답 데이터(질문-도구 호출-결과-최종 답변)를 모델에 직접 학습시키는 방식이다. 모델에게 정답 경로를 명시적으로 보여주어 초기 성능을 확보하지만, 고품질 데이터를 대량으로 구축하는 데 막대한 비용과 시간이 소요된다는 단점이 있다.
그룹 상대 정책 최적화(GRPO)
별도의 가치 모델(Value Model) 없이, 하나의 질문에 대해 생성된 여러 응답 그룹 내에서 상대적인 보상을 비교하여 모델을 업데이트하는 강화학습 알고리즘이다. 연산 자원을 절약하면서도 모델의 추론 능력을 효과적으로 향상시킬 수 있어 최근 대형 모델 학습에 널리 사용된다.
롤아웃(Rollout)
강화학습 과정에서 현재의 모델(정책)을 사용하여 실제로 질문에 대한 답변이나 행동 경로를 끝까지 생성해보는 단계를 의미한다. 이 단계에서 생성된 결과물에 대해 보상을 부여하고, 그 보상을 바탕으로 모델의 가중치를 업데이트하여 더 나은 결과를 내도록 유도한다.
손실 마스킹(Loss Masking)
학습 과정에서 특정 토큰 구간에 대한 손실(Loss) 계산을 의도적으로 제외하는 기법이다. 이 논문에서는 외부 도구가 반환한 정보처럼 모델이 직접 생성하지 않은 텍스트 구간을 마스킹하여, 모델이 오직 자신의 추론 로직과 도구 호출 문법을 개선하는 데만 집중하게 한다.
다단계 추론(Multi-hop Reasoning)
단순한 지식 인출을 넘어, 여러 단계의 정보 검색과 논리적 결합이 필요한 복잡한 사고 과정을 의미한다. 예를 들어 'A의 고향에서 열리는 축제의 이름은?'이라는 질문에 답하기 위해 A의 고향을 먼저 찾고, 그 지역의 축제를 다시 검색하는 식의 연속적인 도구 활용 능력이 요구된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 09.수집 2026. 03. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.