용어 해설
- 모호한 목표 기반 자기 진화(Vague-goal-driven Self-evolution)
- — 사람이 구체적인 데이터셋·학습 과제·평가 지표를 정하지 않고 능력 방향만 제공하면, 에이전트가 개선할 대상을 정의하고 데이터·업데이트 방식·검증 기준을 함께 구성하는 자기 개선 방식입니다. 고정된 목표를 최적화하는 기존 자기 진화보다 목표 운용화와 평가 설계까지 탐색 범위에 포함합니다.
- 목표 운용화(Target Operationalization)
- — 광범위한 능력 목표를 학습 가능한 과제, 데이터, 업데이트 목적, 검증 기준으로 변환하는 과정입니다. Aspire에서는 에이전트가 어떤 능력을 먼저 개선할지와 이를 측정할 자체 신호를 결정해야 하므로, 단순한 학습 실행보다 앞선 의사결정 단계가 됩니다.
- 비공개 평가(Hidden Evaluation)
- — 평가 문항·정답·채점 기준을 에이전트에게 숨긴 채 외부 평가자가 성능을 측정하는 방식입니다. 에이전트가 자체 검증 데이터에 과적합하거나 평가 문항을 학습 데이터로 재사용하는 경로를 차단하고, 자체 프록시 성능이 실제 목표 능력으로 전이되는지 확인하는 데 쓰입니다.
- 에이전트 하네스(Agent Harness)
- — 모델 주변에서 런타임 지시문, 도구 정책, 워크플로, 메모리, 검증 절차를 관리하는 실행 구조입니다. Aspire의 하네스 진화 실험에서는 모델 가중치를 고정한 채 이 구조만 편집하고 동결한 뒤, 비공개 평가에서 후속 하네스의 성능을 비교합니다.
- 체크포인트 롤백(Checkpoint Rollback)
- — 학습으로 생성된 후보 체크포인트가 기준 모델보다 높은 비공개 평가 점수를 얻고 사전 조건도 충족할 때만 후보를 유지하고, 그렇지 않으면 이전 상태로 되돌리는 보존 절차입니다. 시도한 업데이트의 품질과 최종적으로 남은 개선을 분리해 측정합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

