본문으로 건너뛰기

semantic-manipulation

의미 조작 공격

중급

텍스트의 표면적 형식과는 별개로 모델의 의미 해석을 왜곡해 의도한 동작을 유발하는 공격으로, 단순 키워드 탐지로는 차단이 어려운 경우가 많다. 예컨대 자연스러운 문장 안에 교묘히 삽입된 지시가 모델 내부의 의미 흐름을 바꾸는 방식으로 동작한다. 방어 방법은 의미 수준의 검증이나 입력 출처 기반의 권한 제한을 포함한다.