본문으로 건너뛰기

적대적 피드가 LLM 에이전트의 기본 결정을 왜곡하는 방식

LLM 에이전트가 의사결정 전 소비하는 외부 피드의 구성과 순서가 에이전트의 판단을 왜곡할 수 있음을 입증하고, 이에 대한 보안적 시사점을 제시함.

섹션별 상세

LLM 에이전트는 의사결정 전 외부 정보를 수집하며, 이 정보의 순서와 구성이 판단에 개입한다. 연구는 모델, 페르소나, 주제를 고정하고 10턴의 스크롤링 단계에서 피드 내용만 변수로 설정하여 인과관계를 분석했다.
4개의 오픈 소스 instruct LLM을 대상으로 2,785회의 의사결정 실험을 진행했다. 실험 결과, 적대적 피드는 에이전트의 결정을 왜곡하는 세 가지 반응 체계(적대적 굴복, 기본값 포화, 기본값 방향 비대칭성)를 유도했다.
모델이 불확실한 상태일 때 편향된 피드는 결정을 5%에서 100%까지 변화시켰다. 반면, 모델이 확고한 기본값을 가진 경우에는 피드에 의한 결정 변경이 어려웠다.
근거
  • 모델이 불확실한 상황에서 편향된 피드는 결정을 5%에서 100%까지 변화시켰다. Abstract, 'three response regimes' section 출처
이러한 왜곡 효과는 보안 관련 설정(배포 승인 게이트 제거, 접근 제어 완화 등)을 포함한 다양한 도메인에서 나타났다. 피드 수준의 방어 기법으로 일부 완화가 가능하며, frontier 모델은 상대적으로 기본값을 더 잘 유지했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.