용어 해설
- 실행 가능한 안전성 사례(Executable Safety Case)
- — 실행 가능한 안전성 사례는 구체적 안전 목표, 프로그램적으로 초기 상태를 구성하는 s0, 그리고 실행 후 궤적과 환경 상태를 입력으로 받아 위반 여부를 결정하는 결정적 검증기 Vg로 구성되는 삼중 구조이다. 이 구조는 공격 성공을 단순한 텍스트 의도와 분리하고 실제 도구 호출과 환경 변화라는 관찰 가능한 증거에 근거해 성공을 판단하도록 설계되어 있다. 자동화 가능한 형식으로 보존·재생할 수 있어 대규모·지속적 안전 테스트 파이프라인의 기본 단위로 작동한다.
- 도구 게이트웨이(Tool Gateway)
- — 도구 게이트웨이는 에이전트와 외부 서비스 사이의 중재 계층으로서 모든 도구 호출을 기록하고 원본 응답 fi,j와 에이전트에게 반환되는 관찰값 f~i,j를 분리하여 보관한다. 게이트웨이는 append/prefix/override 같은 변형 연산을 적용해 다중 채널 공격을 시뮬레이션하고 감시 증거를 구축함으로써 검증자의 근거자료를 확보한다. 이 설계는 도구 결과의 변조 여부와 실제 환경 변화 사이의 인과를 분리하여 증거 기반 판정을 가능하게 한다.
- 컨트롤 에이전트(Control Agent)
- — 컨트롤 에이전트는 테스트 드라이버 역할을 수행하는 자동화된 주체로서 주어진 안전 사례 σ와 관찰값을 입력으로 받아 다음 사용자 메시지와 게이트웨이 주입 규칙을 선택하는 정책 πctrl을 운용한다. 각 턴에서 r_i, L_i, Δs_i 등의 관찰을 누적해 상태 c_i를 갱신하며 거부 응답, 예기치 않은 도구 사용, 미획득 콘텐츠에 대응해 요청을 재구성하거나 주입 지점을 조정한다. 제한된 상호작용 예산 내에서 observe–adapt–act 루프를 반복해 실행 궤적을 안전 목표 쪽으로 유도한다.
- 다중 채널 공격(Multi-Channel Attack)
- — 다중 채널 공격은 사용자 메시지 채널과 더불어 도구 결과 채널까지 공격자가 통제하는 위협 모델로서 도구 응답을 append/prefix/override 방식으로 조작해 에이전트의 계획과 행동을 유도한다. 이 공격은 신뢰 기반 채널을 통해 전달되는 정보가 방어를 우회할 수 있음을 이용하며 단일 채널 공격에서 관찰되지 않는 취약점을 드러낼 수 있다. Vera는 게이트웨이 변형 연산을 통해 이 공격 범주를 재현하고 환경 증거로 결과를 검증한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



