본문으로 건너뛰기

BadWAM: 상상은 유지되지만 실행은 어긋나는 세계-행동 모델의 취약성

BadWAM은 작은 ℓ∞ 제한 시각적 교란을 통해 WAM의 예측 미래는 보존하면서도 실행 행동을 크게 변경하여 폐쇄 루프 성공률을 크게 낮춘다.

용어 해설

세계-행동 모델(World-Action Model)
세계-행동 모델은 관측과 목표를 입력으로 받아 미래 세계 상태와 함께 행동 시퀀스를 생성하는 모델 계열이다. 이 모델들은 미래 상태 예측을 행동 생성 과정에 결합하여 물리적 합리성 검증이나 계획 인터페이스로 활용한다. 본 논문에서는 이 결합 인터페이스가 작은 시각적 교란으로 인해 상상과 실제 실행 사이의 동기화가 깨질 수 있음을 다룬다.
세계-행동 드리프트 공격(World-Action Drift Attack)
세계-행동 드리프트 공격은 WAM의 상상(future prediction)과 실행(action) 사이의 정렬을 고의로 깨뜨려 모델이 그럴듯한 미래를 상상하면서 실패하는 행동을 선택하게 만드는 공격 형태이다. 공격은 관측에 작은 ℓ∞ bounded 교란을 넣어 행동 출력은 크게 변하게 하되 예측된 미래는 비교적 보존되도록 설계된다. 이 공격은 상상만을 모니터링하는 안전 검사기에서 탐지되지 않을 위험을 가진다.
상상 보존 공격(Imagination-Preserving Attack)
상상 보존 공격은 행동 변화량을 최대화하면서 예측된 미래와의 거리 D_img 를 제약하거나 보정 항으로 페널티를 부과하여 상상 보존 수준을 유지하는 공격이다. Lagrangian 형태로 행동 편이와 이미지-미래 차이를 균형시키며 λ 하이퍼파라미터로 은밀성과 파괴력을 조절한다. 이 기법은 WAM이 상상과 실행을 분리하여 악용될 수 있음을 실험적으로 입증하는 데 사용된다.
제로스 차 최적화(Zeroth-Order Optimization)
제로스 차 최적화는 모델 파라미터이나 그래디언트를 직접 사용하지 않고 함수값만으로 입력공간에서 최적화를 수행하는 방법이다. BadWAM은 임의 방향 표본과 중앙차분 유사 추정기를 사용하여 쿼리 기반으로 공격 목표를 추정하고 ℓ∞ 투영으로 교란을 갱신한다. 이 방식은 배포된 WAM의 블랙박스 API에 적용 가능하여 기울기 접근이 없더라도 공격을 실행할 수 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.