용어 해설
- 실행 가능한 세계 표현(Executable World Representation)
- — 물리적 세계의 구성, 시간에 따른 변화, 시각적 외관을 코드 구조로 묶은 표현입니다. 객체·질량·마찰 같은 물리 속성과 초기 상태·사건·카메라 조건을 명시하고, 이를 simulator에서 실행해 상태 궤적과 관측 영상을 생성합니다. 관측과 물리 메커니즘을 연결해 수정·검증·데이터 생성에 활용하는 것이 핵심입니다.
- 귀추적 추론(Abductive Reasoning)
- — 불완전하거나 잡음이 있는 관측을 가장 잘 설명하는 가설을 찾는 추론 방식입니다. Code-as-World에서는 텍스트나 영상에서 얻은 제약을 바탕으로 세계 가설을 만들고, simulator 실행 결과와 입력 증거를 비교한 뒤 오차를 줄이는 방향으로 가설을 수정합니다.
- 시뮬레이션-현실 전이(Sim-to-Real)
- — 시뮬레이션에서 생성한 구조적 상태와 움직임을 실제 영상과 유사한 외관으로 옮기는 과정입니다. 이 논문에서는 executable world의 물리 궤적을 유지하면서 video generation model이 객체, 재질, 배경, 조명을 보강해 현실적인 영상을 생성합니다.
- 단안 영상(Monocular Video)
- — 한 대의 카메라에서 얻은 영상으로, 픽셀 관측만으로는 실제 세계의 크기나 속도 단위를 직접 알기 어렵습니다. QuantiPhy 과제에서는 알려진 기준 물리량을 픽셀 측정값과 비교해 상대 스케일을 구하고, 객체의 크기·변위·속도·가속도를 world-space 단위로 환산합니다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 여러 후보 응답의 상대적 보상을 이용해 모델 정책을 조정하는 강화학습 방법입니다. 이 논문에서는 executable world에서 얻은 정답과 모델 예측의 상대 오차를 수치 보상으로 계산하고, 단위와 응답 형식 보상을 더해 Code-as-World-VL을 학습합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.








