TL;DR
게시물은 Robotic World Model 관련 페이지로 연결되며 첨부 이미지에는 시점 기반 순환 구조를 통해 다음 관측을 예측하고 예측 오류 L_o로 학습하는 흐름이 포함되어 있다. 은닉 상태 h가 행동 a와 관측 o를 받아 다음 관측 o'을 생성하고 실제 관측과의 오차가 손실로 돌아오는 입력→처리→출력 경로가 핵심이다. 상단과 하단 패널의 비교는 롤아웃 시작 시점이 예측 경로와 손실 적용 위치에 어떤 차이를 만드는지 구조적으로 나타낸다.
섹션별 상세
이미지 분석

그림은 행동 a_t와 관측 o_t가 은닉 상태 h_t로 통합된 뒤 h_t에서 예측된 관측 o'_{t+1}이 생성되고, 이 예측과 실제 관측 o_{t+1}의 차이를 L_o로 계산하는 처리 흐름을 시각화한다. 상단과 하단 패널은 각각 시점 t와 시점 t+1에서 시작한 롤아웃을 대비해 배치되어 있으며, 점선 화살표는 더 먼 미래로 예측을 이어가는 선택적 경로를 나타낸다. 이런 배치는 초기화 시점이 예측 연쇄와 손실 분포에 미치는 구조적 차이를 확인하기에 적합하다.
시점 기반 롤아웃을 도식화한 다이어그램으로, 은닉 상태 h와 관측 o 간의 예측 연결 및 손실 L_o의 흐름을 포함한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

