용어 해설
- 상태ful 환경(Stateful Environment)
- — 에이전트의 작업 과정에서 도구 호출, 메모리, 파일, 권한 같은 공유 상태가 계속 읽히고 바뀌는 실행 공간입니다. 한 시점의 변화가 이후 판단과 출력에 누적 영향을 주므로 단일 프롬프트보다 긴 상호작용 전체의 안전성을 평가해야 합니다.
- 공격 성공률(Attack Success Rate (ASR))
- — 공격이 목표한 안전 위반을 일으킨 실행의 비율입니다. OpenART의 Strict ASR은 결정론적 evaluator와 GLM-5.2 judge가 모두 공격 성공으로 판정한 경우만 성공으로 세어 판정 불일치를 실패로 처리합니다.
- 대상 어댑터(Target Adapter)
- — 동일한 시나리오의 작업 목표, 안전 계약, evaluator를 각 에이전트가 사용하는 고유 인터페이스로 옮기는 실행 계층입니다. 지원되는 Workspace, Tools, MCPs, 메모리 등의 위치에만 상태 변경을 투영해 런타임 간 비교 가능성을 유지합니다.
- 하이퍼그래프(Hypergraph)
- — 하나의 연결선이 여러 선행 노드와 여러 후속 노드를 동시에 연결할 수 있는 그래프 구조입니다. EMHA는 공격 하위 목표와 의존 관계를 하이퍼그래프로 구성하고, 활성화된 목표에 따라 다음 환경 변경 경로를 선택합니다.
- 블랙박스 정책(Black-Box Policy)
- — 대상 모델의 내부 가중치나 gradient를 사용하지 않고 외부에서 관찰 가능한 상태와 evaluator 피드백만으로 다음 행동을 선택하는 정책입니다. EMHA는 대상 모델 파라미터를 갱신하지 않은 채 외부 attacker state에 경로 값과 실행 결과를 저장해 탐색을 조정합니다.
- 품질 다양성 탐색(Quality-Diversity Search)
- — 높은 점수만 찾는 대신 서로 다른 행동 특성을 가진 후보를 여러 영역에 보존하는 탐색 방식입니다. EMHA는 공격을 behavior cell에 배치하고 각 cell에서 가장 높은 fitness를 유지해 이미 성공한 경로와 다른 그래프 구조를 함께 발전시킵니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

