TL;DR
최근 'world model'이라는 용어가 원래의 물리적 동작을 내포한 모델 의미에서 마케팅이 잘 된 비디오 생성기로 옮겨갔고 이로 인해 주장 근거와 실제 능력 사이에 괴리가 생겼다. 업체들이 제시하는 선호도 비교 평가는 사람이 선택한 클립 비율을 제시할 뿐이며 원문에서는 FLUX 3의 77%와 93% 수치를 예로 들면서 평가 절차·샘플·심사자 정보가 공개되지 않아 재현과 외부 검증이 불가능하다고 지적했다. 선호도 평가는 시각적 취향을 측정하는 반면 물리적 이해나 실세계 행동 예측을 직접 측정하지 못하므로 로봇 팔이나 자율주행 같은 실제 적용에서 해당 수치가 예측력을 가지리라는 보장은 없다.
섹션별 상세
용어 해설
- Preference Test
- — 사람 평가자를 대상으로 두 개 이상의 생성 결과를 제시하고 선택 비율을 집계하는 방법으로, 평가자는 제시된 샘플 중 선호하는 항목을 고른다. 입력은 모델이 생성한 클립 집합이고 처리 과정은 평가자가 지정된 시간(예: 5초) 내에 선택을 수행하는 것이며 출력은 선택 비율(예: 77%)이다. 시각적 품질이나 취향 기반 우열을 빠르게 측정하는 데 유용하나 재현성·물리적 거동 측정에는 제한이 있다.
- Public Benchmark
- — 평가 프로토콜, 데이터셋, 프롬프트와 채점 기준을 공개해 누구나 동일 조건으로 재현 가능한 성능 비교를 가능하게 하는 평가 체계이다. 입력과 처리, 채점 절차가 문서화되어 있어 다른 연구자나 개발자가 동일한 절차로 실행해 결과를 검증하거나 반론을 제기할 수 있다. 재현성과 공격 가능성이 있어 모델 간 실질적 차이를 논증할 수 있는 근거가 된다.
- Midtraining Evaluation
- — 학습 과정 중간 단계에서 후보 모델을 대상으로 수행되는 예비 평가로, 최종 모델이 아니라 학습 중의 상태를 측정한다. 입력은 중간 체크포인트의 생성물이고 처리 과정은 제한된 샘플·평가자·조건으로 시험하는 것이며 출력은 임시 성능 지표로 해석될 가능성이 높다. 최종 성능 예측력이 낮을 수 있어 공개적 비교나 배포 전 의사결정 근거로 쓰일 때 주의가 필요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
