semantic-manipulation
의미 조작 공격
텍스트의 표면적 형식과는 별개로 모델의 의미 해석을 왜곡해 의도한 동작을 유발하는 공격으로, 단순 키워드 탐지로는 차단이 어려운 경우가 많다. 예컨대 자연스러운 문장 안에 교묘히 삽입된 지시가 모델 내부의 의미 흐름을 바꾸는 방식으로 동작한다. 방어 방법은 의미 수준의 검증이나 입력 출처 기반의 권한 제한을 포함한다.
의미 조작 공격
텍스트의 표면적 형식과는 별개로 모델의 의미 해석을 왜곡해 의도한 동작을 유발하는 공격으로, 단순 키워드 탐지로는 차단이 어려운 경우가 많다. 예컨대 자연스러운 문장 안에 교묘히 삽입된 지시가 모델 내부의 의미 흐름을 바꾸는 방식으로 동작한다. 방어 방법은 의미 수준의 검증이나 입력 출처 기반의 권한 제한을 포함한다.