본문으로 건너뛰기

Vera: 실행 가능 사례·적응형 실행·증거 기반 검증으로 대규모 에이전트 안전성을 평가하는 프레임워크

Vera는 문헌 기반 리스크 탐색과 조합적 사례 생성, 샌드박스 적응형 실행 및 환경 증거 기반 검증을 결합해 에이전트의 런타임 안전성을 자동화하고 Vera-Bench 1,600개 실행 사례와 코드를 공개했다.

용어 해설

실행 가능한 안전성 사례(Executable Safety Case)
실행 가능한 안전성 사례는 구체적 안전 목표, 프로그램적으로 초기 상태를 구성하는 s0, 그리고 실행 후 궤적과 환경 상태를 입력으로 받아 위반 여부를 결정하는 결정적 검증기 Vg로 구성되는 삼중 구조이다. 이 구조는 공격 성공을 단순한 텍스트 의도와 분리하고 실제 도구 호출과 환경 변화라는 관찰 가능한 증거에 근거해 성공을 판단하도록 설계되어 있다. 자동화 가능한 형식으로 보존·재생할 수 있어 대규모·지속적 안전 테스트 파이프라인의 기본 단위로 작동한다.
도구 게이트웨이(Tool Gateway)
도구 게이트웨이는 에이전트와 외부 서비스 사이의 중재 계층으로서 모든 도구 호출을 기록하고 원본 응답 fi,j와 에이전트에게 반환되는 관찰값 f~i,j를 분리하여 보관한다. 게이트웨이는 append/prefix/override 같은 변형 연산을 적용해 다중 채널 공격을 시뮬레이션하고 감시 증거를 구축함으로써 검증자의 근거자료를 확보한다. 이 설계는 도구 결과의 변조 여부와 실제 환경 변화 사이의 인과를 분리하여 증거 기반 판정을 가능하게 한다.
컨트롤 에이전트(Control Agent)
컨트롤 에이전트는 테스트 드라이버 역할을 수행하는 자동화된 주체로서 주어진 안전 사례 σ와 관찰값을 입력으로 받아 다음 사용자 메시지와 게이트웨이 주입 규칙을 선택하는 정책 πctrl을 운용한다. 각 턴에서 r_i, L_i, Δs_i 등의 관찰을 누적해 상태 c_i를 갱신하며 거부 응답, 예기치 않은 도구 사용, 미획득 콘텐츠에 대응해 요청을 재구성하거나 주입 지점을 조정한다. 제한된 상호작용 예산 내에서 observe–adapt–act 루프를 반복해 실행 궤적을 안전 목표 쪽으로 유도한다.
다중 채널 공격(Multi-Channel Attack)
다중 채널 공격은 사용자 메시지 채널과 더불어 도구 결과 채널까지 공격자가 통제하는 위협 모델로서 도구 응답을 append/prefix/override 방식으로 조작해 에이전트의 계획과 행동을 유도한다. 이 공격은 신뢰 기반 채널을 통해 전달되는 정보가 방어를 우회할 수 있음을 이용하며 단일 채널 공격에서 관찰되지 않는 취약점을 드러낼 수 있다. Vera는 게이트웨이 변형 연산을 통해 이 공격 범주를 재현하고 환경 증거로 결과를 검증한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 04.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.