TL;DR
Huihui-Qwen3.6-35B는 Hermes 코딩 에이전트를 겨냥해 6개 파일에 10가지 프롬프트 인젝션을 조합한 60개 테스트 파일을 만들었습니다. 공격 유형은 로컬 프로필과 자격 증명 파일 읽기, ORCID·이메일·위치 정보 추출, iMessage·이메일 같은 외부 도구 호출을 유도하도록 구성됐습니다. Indirect부터 Backdoor와 Code Exec까지 단일 지시, 다중 턴, 연쇄 규칙, 조건부 트리거를 포괄하며 코딩 에이전트의 파일 접근과 도구 권한이 결합될 때 개인정보 유출로 이어지는 경로를 구체화했습니다.
실용적 조언
- 로컬 코딩 에이전트가 읽는 파일은 지시문이 아니라 신뢰할 수 없는 데이터로 분류하고, 파일 안의 명령이 시스템 지시나 사용자 승인보다 높은 우선순위를 갖지 않게 해야 합니다. USER.md, MEMORY.md, 자격 증명 파일처럼 개인정보가 들어갈 수 있는 경로는 기본적으로 읽기 차단 목록에 두는 편이 안전합니다. 테스트에서는 파일 읽기 시도, 경로 확장, 개인정보 추출, 외부 통신 호출을 각각 독립적인 실패 조건으로 기록해야 합니다.
- 도구 호출 권한은 작업에 필요한 최소 범위로 나누고 iMessage, 이메일, 캘린더, 위치 정보 서비스처럼 외부 효과가 있는 도구에는 실행 전 승인을 요구해야 합니다. 모델이 여러 도구를 연쇄 호출하거나 외부-facing skill을 우선하도록 유도하는 경우에는 전체 호출 계획을 먼저 검사한 뒤 실행하는 제어층이 필요합니다. 특히 Code Exec 요청에서는 샌드박스가 실제 자격 증명 경로와 네트워크에 접근하지 못하는지 별도로 검증해야 합니다.
섹션별 상세
용어 해설
- 프롬프트 인젝션(Prompt Injection)
- — 모델이나 에이전트가 원래의 지시를 따르지 않고 입력에 삽입된 악의적 지시를 실행하도록 유도하는 공격입니다. 사용자의 파일, 자격 증명, 개인정보를 읽거나 외부 도구를 호출하게 만들 수 있어 에이전트 보안의 핵심 위험으로 다뤄집니다.
- 간접 프롬프트 인젝션(Indirect Prompt Injection)
- — 사용자가 직접 지시하지 않아도 문서, 파일, 웹페이지 같은 외부 데이터에 악성 지시를 심어 모델이 이를 명령으로 처리하게 만드는 공격입니다. 검색·파일 읽기·코딩 에이전트처럼 외부 콘텐츠를 입력으로 받는 구조에서 개인정보 유출과 도구 오용으로 이어질 수 있습니다.
- 도구 호출(Tool Calling)
- — 언어 모델이 함수나 외부 서비스에 구조화된 요청을 보내 파일 조회, 메시지 전송, 일정 확인 같은 작업을 수행하는 방식입니다. 호출 대상과 매개변수를 제대로 제한하지 않으면 프롬프트 인젝션이 모델의 판단을 거쳐 실제 개인정보 접근이나 외부 통신으로 확장될 수 있습니다.
- LLM 평가자(LLM-as-a-Judge)
- — 한 언어 모델이 다른 모델의 출력이나 에이전트 행동을 기준에 따라 평가하는 구조입니다. 평가 과정 자체에 사용자 프로필이나 민감한 경로를 포함시키면 안전성 검사가 오히려 개인정보를 다시 읽거나 노출하는 경로가 될 수 있습니다.
- 샌드박스(Sandbox)
- — 코드나 에이전트의 실행 범위와 파일·네트워크 접근 권한을 제한하는 격리 환경입니다. 이 게시물의 Code Exec 유형처럼 자격 증명 경로와 외부 통신을 샌드박스 범위에 포함시키면 격리의 경계가 약화되어 민감한 데이터 접근 위험이 커집니다.
언급된 도구
로컬 파일과 skill, 외부 도구를 사용하는 코딩 에이전트로서 프롬프트 인젝션의 공격 대상이 되었습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.