추가 이미지 분석

이 타임라인은 합성 편집이 성공적으로 validation best를 갱신한 시점과 실패한 반복을 구분해 보여준다. 성공적인 런은 실패 원인을 가시적 롤아웃 단서로 귀속하고 구조적 수정을 통해 점프를 만든 반면, 실패 런은 토폴로지 치환이 반복되거나 동일 토폴로지 내에서 비생산적 튜닝이 이어진 패턴을 드러냈다. 따라서 이 그림은 피드백-귀속-수정의 흐름이 실제로 어떻게 작동했는지를 사례 수준에서 연결한다.
CarRacing 과제의 코드-페이즈 타임라인으로 합성 편집·파라메트릭 편집·롤백·재시험 이벤트를 예산 축에 따라 표기한 그림이다.

이 표는 개별 제출의 증거와 에이전트가 내린 귀속, 적용한 정책 수정, 그리고 그 결과를 한 행에 집약해 비교 가능하게 만든다. 복수 에이전트의 로그를 나란히 제시함으로써 어떤 귀속 전략이 롤백 또는 새로운 최고점 발견으로 이어졌는지 판별할 수 있도록 했다. 이 자료는 정성적 사례 근거를 제공해 앞선 정량적 편집 성공률 해석과 상호 보완된다.
증거·귀속·정책 수정·결과를 연결한 표로 여러 에이전트의 제출 사례와 최종 결과 상태를 정리한 표형 피드백-활용 로그이다.
용어 해설
- 자율 정책 진화(Autonomous Policy Evolution)
- — 에이전트가 실행 가능한 정책 번들을 반복적으로 편집하고 유한한 에피소드 예산과 서버 피드백을 통해 성능을 향상시키는 평가 설정을 말한다. 본 논문 맥락에서는 에이전트가 workspace에 패치를 쓰고 서버가 롤아웃 요약과 궤적을 반환하는 루프가 핵심이다. 이 설정은 최종 점수뿐 아니라 정책 개선 궤적과 검증 선택을 통제된 방식으로 측정하는 데 중요하다.
- 정책 시스템(Policy System)
- — 실행 가능한 Python 아티팩트로 제출되는 정책 본체로서 reset 및 act(obs) 진입점을 포함한다. 이 번들은 상태, 헬퍼 모듈, 상수, 진단 코드, 학습된 파라미터 등을 포함할 수 있으며 서버가 해당 번들을 실행해 에피소드를 평가한다. 평가에서는 이 번들이 반복 제출과 수정의 단위가 되어 에이전트의 개선 경로를 기록한다.
- 가시성 경계(Visibility Boundary)
- — 학습 반복에서 에이전트가 접근 가능한 훈련 피드백과 서버가 보유하는 검증 및 홀드아웃 증거를 분리하는 규칙을 말한다. 에이전트는 제출한 트레인 에피소드의 요약·궤적만 볼 수 있고, 검증 선택과 최종 홀드아웃 평가는 서버 내부에서 수행되어 노출되지 않는다. 이 경계는 탐색 과다적합과 검증 누출을 방지하면서 에이전트의 일반화 능력을 평가한다.
- 구조적 합성(Structural Synthesis)
- — 정책 번들 수준에서 새로운 제어 구조, 시각 추출기, 메모리, 플래너 등 기능적 모듈을 도입하는 편집 유형을 말한다. 본 실험에서는 AST 토폴로지가 숫자 상수 제거 후 변경되면 합성 편집으로 분류해 성공률을 평가했다. 합성 편집은 픽셀 기반·기호 계획형 작업에서 성능 향상 핵심 요인으로 나타났다.
- 파라메트릭 튜닝(Parametric Tuning)
- — 기존 정책 구조를 유지한 채 게인·임계값·상수 같은 수치 파라미터만 조정하는 편집 유형을 말한다. 논문은 같은 토폴로지 내 변경을 튜닝으로 분류해 각 작업군에서의 효용을 비교했다. 튜닝은 저차원 제어 작업에서 작은 성능 이득을 안정적으로 제공하는 경향이 있었다.
- 궤적 진단(Trajectory Diagnostics)
- — 에이전트의 제출-롤아웃-수정 반복 전 과정을 기록해 예산 소모에 따른 best-so-far 검증 점수 변화를 복원하는 분석 절차를 말한다. 이 진단은 개선이 발생한 시점, 판정 근거, 롤백·재시도 패턴을 드러내며 단일 최종 점수로는 포착되지 않는 실패 모드를 밝힌다. 논문에서 이 진단은 합성 대 튜닝 편집의 시공간적 분포를 가시화하는 데 사용되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


