용어 해설
- 생각의 사슬(Chain-of-Thought)
- — 모델이 최종 정답에 도달하기 전 중간 추론 단계를 명시적으로 생성하도록 유도하는 기법이다. 복잡한 문제를 작은 단위로 쪼개어 해결하게 함으로써 논리적 오류를 줄이고 모델의 사고 과정을 투명하게 만든다.
- 지도 미세 조정(Supervised Fine-Tuning)
- — 미리 정답이 라벨링된 데이터를 사용하여 사전 학습된 모델을 특정 작업에 맞춰 추가 학습시키는 과정이다. 모델이 원하는 출력 형식을 익히고 특정 도메인의 지식을 내재화하는 데 필수적인 단계이다.
- 강화 학습(Reinforcement Learning)
- — 모델이 생성한 결과에 대해 보상을 주어 더 나은 행동을 하도록 유도하는 학습 방식이다. LLM에서는 주로 정답 여부나 인간의 선호도를 보상 신호로 사용하여 추론 경로를 최적화하는 데 사용된다.
- 합성 데이터(Synthetic Data)
- — 실제 세계에서 수집된 데이터가 아닌 AI 모델이 인위적으로 생성한 데이터를 의미한다. 고품질 데이터가 부족한 분야에서 학습 데이터를 대량으로 확보하고 특정 시나리오를 강화하는 데 유용하다.
- 대학원 수준 구글 검색 방지 질의응답(GPQA)
- — 전문가가 구글 검색을 사용해도 풀기 어려운 고난도 과학 문제를 포함하는 벤치마크다. 모델의 단순 지식 암기가 아닌 심층적인 논리적 추론 능력을 평가하는 핵심 척도로 활용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.