TL;DR
세계-행동 모델은 행동 생성과 미래 세계 예측을 결합해 로봇 제어에서 물리적 합리성 점검과 계획 인터페이스 역할을 수행한다. 본 논문은 이 결합이 작은 시각적 교란으로 인해 상상과 행동의 동기화가 깨지며 그 결과 안전 판정이 실패할 수 있음을 실험적으로 입증했다. 이 발견은 미래 예측만으로는 로봇 제어의 안전을 보장하기에 불충분하다는 점을 시사한다.
왜 중요한가
세계-행동 모델은 행동 생성과 미래 세계 예측을 결합해 로봇 제어에서 물리적 합리성 점검과 계획 인터페이스 역할을 수행한다. 본 논문은 이 결합이 작은 시각적 교란으로 인해 상상과 행동의 동기화가 깨지며 그 결과 안전 판정이 실패할 수 있음을 실험적으로 입증했다. 이 발견은 미래 예측만으로는 로봇 제어의 안전을 보장하기에 불충분하다는 점을 시사한다.
핵심 기여
세계-행동 드리프트 공격의 정의와 위협 모델화
논문은 상상(predicted future)과 행동(action) 사이의 정렬 자체를 공격 목표로 삼는 World-Action Drift Attack 개념을 도입했다. 이 위협은 블랙박스 접근에서 관측에 ℓ∞ 유한한 교란을 가해 행동 출력은 크게 바꾸되 상상은 보존되도록 최적화할 수 있음을 보였다. 위협 모델은 행동만 관찰 가능한 설정과 상상도 관찰 가능한 설정을 모두 포함하며 실무 배포 상황을 반영했다.
BadWAM 프레임워크와 두 가지 공격 인스턴스화
BadWAM은 쿼리 기반의 온라인 제로스 차 최적화를 사용하여 각 재계획 단계에서 공격 교란을 검색하는 통합 프레임워크이다. 프레임워크는 실행 파괴를 최대화하는 action-only 공격과 상상을 보존하면서 행동을 변조하는 imagination-preserving 공격 두 가지를 구현했다. imagination-preserving 공격은 Lagrangian 형태로 행동 편이와 예측 미래 거리의 균형을 λ로 조절한다.
폐쇄 루프 실험에서 WAM 취약성 실증
LIBERO와 RoboTwin 폐쇄 루프 벤치마크에서 BadWAM은 여러 WAM 변종의 성공률을 크게 낮추었다. 예컨대 action-only 공격은 한 WAM 변종의 성공률을 96.5%에서 43.1%로 감소시켰다. 실험은 채널별 행동 변화, 시간 축 분포, 상상 보존 정도, 전이성 등 다양한 지표를 통해 실패 메커니즘을 규명했다.
방어 가능성 평가와 전이성 분석
비적응적 전처리 기법들(Gaussian blur, JPEG-noise ensemble 등)이 공격을 약화시킬 수 있지만 완전한 방어가 되지는 못한다는 결과가 제시되었다. 서로 다른 WAM 변종 간에 최적화된 교란이 전이되며 이는 관측 공간의 공통 민감 방향이 존재함을 의미한다. 단순한 증강 일관성 검사기는 낮은 허위양성률을 유지하는 조건에서 공격을 놓치는 경우가 많았다.
핵심 아이디어 이해하기
세계-행동 모델은 현재 관측과 목표를 받아 내부적으로 미래 상태를 상상하고 그 상상을 조건으로 행동을 생성하는 구조를 가진다. 이때 상상과 행동은 동일한 표현을 공유하거나 상상 결과에 조건부로 행동을 생성하도록 학습되어 정렬(alignment)이 기대된다. 그러나 학습상 정렬이 완전 결속적이지 않으므로 두 출력 경로는 서로 다르게 민감해질 수 있다. BadWAM의 핵심 직관은 이 분리 취약성을 표면화하는 것이다. 공격자는 관측에 작은 ℓ∞ 제한 교란을 넣어 행동 생성 경로를 크게 흔들면서 상상 경로의 출력은 비교적 가깝게 유지하도록 최적화할 수 있다. 이를 통해 모델은 그럴듯한 미래를 '상상'하지만 실제 실행은 그 상상을 실현하지 못하는 비동기화된 행동을 내보내게 된다. 공격 목적은 행동 편이 D_act 를 최대화하면서 예측된 미래와의 거리 D_img 를 제약하거나 페널티로 제어하는 것이다. 이 목적은 Lagrangian 완화로 구현되며 λ 가 클수록 상상 보존이 강화되어 은밀성이 높아지는 반면 공격 강도는 약해지는 트레이드오프가 나타난다.
방법론
위협 모델은 배포된 WAM의 관측 입력만 수정할 수 있는 공격자로 설정되며 공격자는 각 재계획(replan) 단계에서 블랙박스 쿼리를 통해 모델 출력을 관찰한다. 공격자는 행동만 관찰 가능한 설정과 상상도 관찰 가능한 설정을 모두 고려하며 교란은 ‖δ‖∞ ≤ ε 로 제한된다. 목적 함수는 행동 거리 D_act 를 최대화하거나 행동 거리에서 λ·D_img 를 뺀 값을 최대화하는 형태로 정의된다. 악성 교란 최적화는 제로스 차 표본 기반 방식으로 수행된다. 구체적으로 무작위 방향 u_i 를 표본하고 중앙차분 유사추정기를 통해 목적 함수의 방향 도함수를 근사한 후 학습률 η 로 교란을 갱신하고 ℓ∞ 공집합으로 투영한다. 구현 기본값은 재계획당 8번의 최적화 반복으로, 각 반복은 양방향 평가를 포함하여 재계획당 총 17개의 WAM 포워드 쿼리를 필요로 한다. 평가 프로토콜은 폐쇄 루프 실행을 사용하여 공격의 장기 누적 효과를 측정한다. 성능 지표로는 종합 폐쇄 루프 성공률, 행동 거리 및 채널별 통계, 예측 미래 거리 및 데코이 검출 관련 지표가 포함된다. 또한 방어 실험에서는 Gaussian blur, JPEG-noise ensemble, resize-crop ensemble 같은 비적응적 전처리를 시험하여 실무적 영향과 허위양성률을 관찰했다.
관련 Figure

이 그림은 WAM 입력·상상·행동 인터페이스와 BadWAM이 쿼리 기반으로 교란을 최적화하는 흐름을 보여준다. 공격 목표가 행동 편이 최대화와 예측 미래 보존 사이의 트레이드오프로 표현되는 점이 시각적으로 강조되어 있으며 이것이 논문의 핵심 위협 모델과 직접 연결된다. 또한 폐쇄 루프 실행에서 상상과 행동이 비동기화되는 사례를 오른쪽에 배치해 실험적 동기를 보강한다.
BadWAM 프레임워크와 공격 스펙트럼(action-only 및 imagination-preserving)을 개괄적으로 나타내는 다이어그램이다.
주요 결과
주요 폐쇄 루프 실험에서 BadWAM은 WAM 변종 전반에 걸쳐 유의한 성능 저하를 유도했다. 예컨대 action-only WAM에서는 action-only 공격이 성공률을 96.5%에서 43.1%로 감소시켰고 joint 및 IDM WAM에서도 수십 퍼센트포인트 수준의 하락이 관찰되었다. imagination-preserving 공격은 예측 미래 드리프트를 상대적으로 줄이면서도 실행 실패를 유사한 수준으로 유도했다. 정밀 분석에서 공격은 연속적 행동 채널과 후반 재계획 구간에 주로 영향을 주었고 실패한 에피소드는 성공 에피소드에 비해 누적 행동 편이가 훨씬 컸다. 전이성 실험에서는 소스 모델에서 최적화된 교란이 다른 WAM 변종에서도 유의미한 성공률 저하를 일으켜 관측 공간의 공통 취약 방향이 존재함이 확인되었다. 방어 실험에서는 JPEG-noise ensemble과 Gaussian blur가 비적응적 공격에 대해 일부 회복을 제공했으나 적응형 공격에 대한 완전한 해결책은 아니었다. 민감도 실험에서 교란 크기 ε 는 공격 강도에 가장 큰 영향을 미쳤고 쿼리 예산은 실행 시간 대비 성능 개선을 제공하지만 과도한 예산은 추가적인 폐쇄 루프 실패로 반드시 이어지지 않는 비모노토닉성을 보였다. 이 결과들은 상상 보존 항으로 λ 를 조정하면 은밀성과 파괴성 사이의 실질적 트레이드오프가 존재함을 보여주었다.
관련 Figure

이 스크린샷은 imagination-preserving 공격이 예측된 프레임을 비교적 보존하면서도 실행 행위는 영향을 주는 정성적 사례를 제시한다. 절대 차이를 8배 증폭한 이미지가 오른쪽에 있어 범위가 작은 픽셀 수준 변화가 존재함을 확인하게 해 준다. 이 그림은 상상 보존 항이 실제 시각적 출력에 미치는 영향을 직관적으로 연결하는 증거로 기능한다.
원래(깨끗한) 미래 예측과 공격 후 예측의 시각적 비교와 절대 차이를 증폭한 스냅샷을 보여주는 롤아웃 스크린샷이다.

이 패널은 다양한 시간 점에서의 예측 차이를 제시하여 공격이 특정 타이밍과 공간에서 어떻게 축적되는지를 시사한다. 여러 시간대의 비교가 실패가 점진적으로 누적된다는 정량적 주장과 정성적으로 일치한다. 또한 행동 편이는 작지만 물리적 결과에 영향을 주는 경우가 있음을 시각적으로 뒷받침한다.
다른 장면에서의 clean vs adversarial 미래 프레임 비교와 증폭된 절대 차이를 연속적으로 보여주는 추가 롤아웃 스크린샷이다.

이 그래프는 다양한 과제군(Spatial, Object, Goal, Long-horizon)에 대해 공격이 성공률을 어떻게 낮추는지를 수치적으로 보여준다. 그래프는 action-only, joint, IDM 등의 모델 변종과 action-only 대 imagination-preserving 공격의 성능 차이를 한눈에 비교하게 해 준다. 수치적 증거는 공격이 특정 과제 유형과 장기-호라이즌 설정에서 특히 취약하다는 결론과 직접 연결된다.
쿼리 수, 재계획 횟수, 과제 유형별로 공격이 폐쇄 루프 성공률에 미치는 영향을 그래프로 요약한 결과 플롯이다.
기술 상세
전체 아키텍처 관점에서 논문은 세 가지 WAM 변종을 실험했다. action-only WAM은 관측과 목표에서 바로 행동을 예측하는 구조이고 joint WAM은 행동과 미래 비디오를 공동으로 예측하며 IDM WAM은 미래 표현을 먼저 구성한 뒤 행동을 디코딩한다. 이 세 변종은 상상-행동 인터페이스가 어떻게 노출되는지에 따라 공격 실험 조건을 분리하는 역할을 했다. 핵심 수학적 구성은 두 거리 측정 D_act 와 D_img 이다. D_act 는 공격 전후 행동 청크 간의 거리로 정의되어 행동 편이의 크기를 측정하고 D_img 는 디코딩된 프레임 단위 또는 잠재공간 거리의 평균으로 계산되어 예측 미래의 드리프트를 정량화한다. imagination-preserving 목적은 max_{‖δ‖∞≤ε} D_act(a^δ,a) - λ D_img(z^δ,z) 의 형태로 Lagrangian 완화를 사용하며 λ 가 은밀성의 강도를 결정한다. 최적화는 제로스 차 추정기와 ℓ∞ 투영을 조합한다. 구체적으로 m 개의 랜덤 방향 u_i 를 표본하고 중앙차분을 사용해 ∇̂J(δ) 를 근사한 뒤 학습률 η 로 갱신하고 Π_{[-ε,ε]} 로 투영한다. 구현상 기본 하이퍼파라미터는 재계획당 m 및 c 값과 반복 횟수 8, ε=0.06, 각 재계획에서 총 17 WAM 포워드 쿼리(양방향 평가 포함)로 설정되어 실험에서 사용되었다.
한계점
연구는 배포된 WAM에 대한 온라인 블랙박스 공격만 다루며 훈련시간 공격, 모델 추출, 보상 해킹, 또는 환경 물리적 변조와 같은 위협은 고려하지 않았다. 제안된 전처리 기반 방어 실험은 비적응형 공격에 한정되어 있으며 적응형 공격에 대한 견고성은 평가하지 않았다. 또한 물리적 세계에서의 이식성이나 실시간 제약 조건을 고려한 최적화 비용 절감은 본 논문의 범위를 벗어난다.
실무 활용
코드와 실험 자료는 공개 저장소에 존재하므로 연구자와 엔지니어는 BadWAM을 안전성 평가 벤치마크로 활용할 수 있다. 공개 구현은 블랙박스 쿼리 기반 제로스 차 최적화와 재계획당 공격 워크플로를 포함한다. 실무에서는 이 도구를 사용해 WAM 기반 제어 스택의 상상-행동 동기화 취약성을 진단할 수 있다.
- WAM 기반 로봇 제어기의 배포 전 적대적 내구성 테스트와 취약 구간 식별
- 미래 예측을 이용하는 런타임 모니터의 설계 시 상상-행동 동기화 검사 기준 평가
- 방어 알고리즘 개발을 위한 비적응 및 적응 공격 대비 성능 검증
- 다중 카메라 입력에서 관측 민감 방향과 채널별 취약성 진단
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- World-Action Model
- — 세계-행동 모델은 관측과 목표를 입력으로 받아 미래 세계 상태와 함께 행동 시퀀스를 생성하는 모델 계열이다. 이 모델들은 미래 상태 예측을 행동 생성 과정에 결합하여 물리적 합리성 검증이나 계획 인터페이스로 활용한다. 본 논문에서는 이 결합 인터페이스가 작은 시각적 교란으로 인해 상상과 실제 실행 사이의 동기화가 깨질 수 있음을 다룬다.
- World-Action Drift Attack
- — 세계-행동 드리프트 공격은 WAM의 상상(future prediction)과 실행(action) 사이의 정렬을 고의로 깨뜨려 모델이 그럴듯한 미래를 상상하면서 실패하는 행동을 선택하게 만드는 공격 형태이다. 공격은 관측에 작은 ℓ∞ bounded 교란을 넣어 행동 출력은 크게 변하게 하되 예측된 미래는 비교적 보존되도록 설계된다. 이 공격은 상상만을 모니터링하는 안전 검사기에서 탐지되지 않을 위험을 가진다.
- Imagination-Preserving Attack
- — 상상 보존 공격은 행동 변화량을 최대화하면서 예측된 미래와의 거리 D_img 를 제약하거나 보정 항으로 페널티를 부과하여 상상 보존 수준을 유지하는 공격이다. Lagrangian 형태로 행동 편이와 이미지-미래 차이를 균형시키며 λ 하이퍼파라미터로 은밀성과 파괴력을 조절한다. 이 기법은 WAM이 상상과 실행을 분리하여 악용될 수 있음을 실험적으로 입증하는 데 사용된다.
- Zeroth-Order Optimization
- — 제로스 차 최적화는 모델 파라미터이나 그래디언트를 직접 사용하지 않고 함수값만으로 입력공간에서 최적화를 수행하는 방법이다. BadWAM은 임의 방향 표본과 중앙차분 유사 추정기를 사용하여 쿼리 기반으로 공격 목표를 추정하고 ℓ∞ 투영으로 교란을 갱신한다. 이 방식은 배포된 WAM의 블랙박스 API에 적용 가능하여 기울기 접근이 없더라도 공격을 실행할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.