용어 해설
- 테스트 시점 학습(Test‑Time Training)
- — 학습 중과 추론 중 모두 일부 매개변수(빠른 가중치)를 그래디언트로 갱신하여 최신 문맥 정보를 파라미터 공간에 압축하는 기법으로, 긴 시퀀스의 문맥을 메모리에 유지하지 않고도 조건화할 수 있게 해 주어 로봇의 온라인 적응과 문맥 검색을 가능하게 한다.
- 빠른 가중치(Fast Weights)
- — 추론 시에도 학습률로 업데이트되는 작은 서브네트워크의 파라미터로, 입력 시퀀스의 키-값 쌍을 내부 파라미터로 압축해 이후 쿼리에서 해당 문맥을 재검색하도록 작동하며 장기 문맥을 일정한 추론 비용으로 유지하는 핵심 수단이다.
- 절단된 역전파(Truncated BPTT)(TBPTT)
- — 긴 시퀀스를 여러 세그먼트로 나누어 각 세그먼트 내부에서만 역전파를 허용하고 세그먼트 경계에서는 활성화 메모리를 해제하되 빠른 가중치는 이어서 전달하여 전체 시퀀스 학습을 메모리 한도 내에서 확장하는 학습 전략이다.
- 시퀀스 액션 포싱(Sequence Action Forcing)
- — 시퀀스 훈련에서 각 액션 청크별로 독립된 노이즈 레벨을 샘플링해 흐름 매칭(flow-matching) 손실을 계산하는 방식으로, 시퀀스 전체에 동일한 노이즈를 적용할 때 발생하는 학습 불안정성을 완화해 장기 시퀀스의 안정적 학습을 가능하게 한다.
- DAgger 증류(DAgger Distillation)
- — 부적절한 로봇 행동을 문맥으로 남기고 인간의 보정만을 학습 목표로 삼아 빠른 가중치가 실패-수정 대응을 학습하도록 하는 절차로, 실패 자체를 문맥으로 활용해 온라인 복구 능력을 얻도록 설계된 메타학습 방식이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


