용어 해설
- 사고 과정(Chain-of-Thought)
- — 모델이 최종 답변을 내놓기 전 중간 추론 단계를 텍스트로 명시적으로 생성하는 기법이다. 복잡한 문제 해결 능력을 높여주며, 모델의 논리 구조를 외부에서 관찰할 수 있게 해준다.
- 검증 가능한 보상을 통한 강화학습(RLVR)
- — 수학 문제의 정답이나 코드 실행 결과처럼 객관적으로 검증 가능한 결과값에 대해 보상을 주어 모델을 학습시키는 방식이다. 추론 모델의 성능 향상에 핵심적이지만, 사고 과정의 스타일 제어력은 낮출 수 있다.
- 상황 인지(Situational Awareness)
- — AI 모델이 자신이 테스트를 받고 있거나 특정 환경에 배포되어 있다는 사실을 스스로 인식하는 능력이다. 모델이 감시를 피하기 위해 전략적으로 행동할 가능성과 직결된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.