용어 해설
- 재귀적 자기 개선(Recursive Self-Improvement)
- — AI 시스템이 자신의 실행 경험과 평가 결과를 다음 학습 단계의 데이터와 업데이트 방향으로 다시 사용하는 반복 과정입니다. NeoHorse-1은 Routing Harness가 능력 요구량, 실행 궤적, 결과 신호를 수집하고 이를 학습 데이터 재배분에 연결하는 방식으로 이 과정을 구성합니다.
- 에이전트형 사후 학습(Agentic Post-Training)
- — 사용자 요청에 대한 답변만이 아니라 추론, Tool Call, 환경 관찰, 오류 복구가 포함된 에이전트 실행 궤적을 이용해 모델을 추가 학습하는 방법입니다. 모델이 실제 작업 진행과 외부 도구 사용을 학습하도록 만드는 점이 핵심입니다.
- 라우팅 하네스(Routing Harness)
- — 에이전트의 Context, Tool, 환경 상호작용을 관리하면서 각 요청을 적절한 서비스 등급이나 모델로 보내는 실행 계층입니다. 이 논문에서는 요청별 능력 요구량과 실행 결과를 기록해 학습 데이터 구성과 모델 평가에 활용합니다.
- 온폴리시 증류(On-Policy Distillation)
- — Student가 직접 생성한 Prefix와 응답에 대해 Teacher의 다음 Token 확률 분포를 제공하는 Distillation 방식입니다. 기록된 Teacher 궤적만 모방하는 대신 Student가 실제로 방문한 상태에서 감독하므로 배포 시 생성 분포와 학습 분포의 차이를 줄입니다.
- 커리큘럼 학습(Curriculum Learning)
- — 예제의 난이도나 능력 요구량을 기준으로 학습 순서를 구성하는 방법입니다. NeoHorse-1은 Router가 예측한 C0~C3 요구량 점수를 이용해 낮은 요구량에서 높은 요구량으로 3단계 학습을 진행하되, 낮은 점수 예제도 후반 단계에 남깁니다.
- 역방향 KL 발산(Reverse KL Divergence)
- — Student 분포를 기준으로 Teacher 분포와의 차이를 계산하는 Distillation 손실입니다. 이 논문에서는 Student와 Teacher의 Top-K Token 및 나머지 확률 질량을 포함한 K+1개 구간의 분포를 비교해 Student의 생성 확률을 Teacher 쪽으로 조정합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

