본문으로 건너뛰기
HF Daily Papers조회 1

환경 진화로 확장하는 에이전트 레드팀

OpenART는 환경 상태를 진화시켜 75개 에이전트 구성의 장기 안전 취약점을 측정합니다.

용어 해설

상태ful 환경(Stateful Environment)
에이전트의 작업 과정에서 도구 호출, 메모리, 파일, 권한 같은 공유 상태가 계속 읽히고 바뀌는 실행 공간입니다. 한 시점의 변화가 이후 판단과 출력에 누적 영향을 주므로 단일 프롬프트보다 긴 상호작용 전체의 안전성을 평가해야 합니다.
공격 성공률(Attack Success Rate (ASR))
공격이 목표한 안전 위반을 일으킨 실행의 비율입니다. OpenART의 Strict ASR은 결정론적 evaluator와 GLM-5.2 judge가 모두 공격 성공으로 판정한 경우만 성공으로 세어 판정 불일치를 실패로 처리합니다.
대상 어댑터(Target Adapter)
동일한 시나리오의 작업 목표, 안전 계약, evaluator를 각 에이전트가 사용하는 고유 인터페이스로 옮기는 실행 계층입니다. 지원되는 Workspace, Tools, MCPs, 메모리 등의 위치에만 상태 변경을 투영해 런타임 간 비교 가능성을 유지합니다.
하이퍼그래프(Hypergraph)
하나의 연결선이 여러 선행 노드와 여러 후속 노드를 동시에 연결할 수 있는 그래프 구조입니다. EMHA는 공격 하위 목표와 의존 관계를 하이퍼그래프로 구성하고, 활성화된 목표에 따라 다음 환경 변경 경로를 선택합니다.
블랙박스 정책(Black-Box Policy)
대상 모델의 내부 가중치나 gradient를 사용하지 않고 외부에서 관찰 가능한 상태와 evaluator 피드백만으로 다음 행동을 선택하는 정책입니다. EMHA는 대상 모델 파라미터를 갱신하지 않은 채 외부 attacker state에 경로 값과 실행 결과를 저장해 탐색을 조정합니다.
품질 다양성 탐색(Quality-Diversity Search)
높은 점수만 찾는 대신 서로 다른 행동 특성을 가진 후보를 여러 영역에 보존하는 탐색 방식입니다. EMHA는 공격을 behavior cell에 배치하고 각 cell에서 가장 높은 fitness를 유지해 이미 성공한 경로와 다른 그래프 구조를 함께 발전시킵니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 01.수집 2026. 08. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.