용어 해설
- 세계 모델(World Model)
- — World Model은 과거 관찰과 사용자의 행동을 입력받아 이후 세계의 관찰을 생성하는 모델입니다. 내부 상태를 행동에 맞게 갱신하고 시간이 지나도 객체·물리·장면의 일관성을 유지해야 하므로 단순한 영상 생성보다 상호작용과 인과성을 함께 평가해야 합니다.
- 에이전트 기반 평가(Agentic Evaluation)
- — Agentic Evaluation은 고정된 점수 규칙을 모든 사례에 적용하지 않고, 평가 에이전트가 사례의 맥락을 읽어 필요한 평가 기술과 증거 수집 절차를 선택하는 방식입니다. 하위 에이전트가 세부 질문을 나누어 처리하고 상위 에이전트가 결과를 통합하므로 복합적인 영상 평가 과정을 추적할 수 있습니다.
- 증거 트리(Evidence Tree)
- — Evidence Tree는 최종 점수에 이르는 평가 질문, 하위 에이전트의 관찰, 도구가 제공한 시각적 근거, 점수 통합 과정을 계층적으로 저장한 구조입니다. 전체 점수만 남기는 방식과 달리 어떤 세부 질문이 실패했는지 역추적할 수 있어 평가 결과의 검증과 오류 진단에 쓰입니다.
- 세계 지속성(World Persistence)
- — World Persistence는 모델이 시간에 따라 세계 상태를 갱신하면서도 변하지 않아야 할 객체와 장면 특성을 보존하고, 행동이나 시간에 따라 변해야 할 과정은 일관되게 계속하는 능력입니다. HarnessEval-W는 장기 rollout의 drift, 떠났다가 돌아온 장소의 일관성, 보이지 않는 동안 진행되는 사건을 각각 평가합니다.
- Bradley–Terry 모델(Bradley–Terry Model)
- — Bradley–Terry Model은 두 항목의 대결 결과를 바탕으로 각 항목의 상대적 강도를 추정하는 통계 모델입니다. 이 논문에서는 사람이 고른 5,000건의 영상 쌍별 선호를 모델별 강도 점수로 변환해 HarnessEval-W의 순위와 비교하는 기준으로 사용했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






