본문으로 건너뛰기

Huihui-Qwen3.6-35B의 에이전트 공격 실험

Huihui-Qwen3.6-35B가 Hermes를 겨냥한 60개 프롬프트 인젝션 테스트를 생성했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Huihui-Qwen3.6-35B는 Hermes 코딩 에이전트를 겨냥해 6개 파일에 10가지 프롬프트 인젝션을 조합한 60개 테스트 파일을 만들었습니다. 공격 유형은 로컬 프로필과 자격 증명 파일 읽기, ORCID·이메일·위치 정보 추출, iMessage·이메일 같은 외부 도구 호출을 유도하도록 구성됐습니다. Indirect부터 Backdoor와 Code Exec까지 단일 지시, 다중 턴, 연쇄 규칙, 조건부 트리거를 포괄하며 코딩 에이전트의 파일 접근과 도구 권한이 결합될 때 개인정보 유출로 이어지는 경로를 구체화했습니다.

실용적 조언

  • 로컬 코딩 에이전트가 읽는 파일은 지시문이 아니라 신뢰할 수 없는 데이터로 분류하고, 파일 안의 명령이 시스템 지시나 사용자 승인보다 높은 우선순위를 갖지 않게 해야 합니다. USER.md, MEMORY.md, 자격 증명 파일처럼 개인정보가 들어갈 수 있는 경로는 기본적으로 읽기 차단 목록에 두는 편이 안전합니다. 테스트에서는 파일 읽기 시도, 경로 확장, 개인정보 추출, 외부 통신 호출을 각각 독립적인 실패 조건으로 기록해야 합니다.
  • 도구 호출 권한은 작업에 필요한 최소 범위로 나누고 iMessage, 이메일, 캘린더, 위치 정보 서비스처럼 외부 효과가 있는 도구에는 실행 전 승인을 요구해야 합니다. 모델이 여러 도구를 연쇄 호출하거나 외부-facing skill을 우선하도록 유도하는 경우에는 전체 호출 계획을 먼저 검사한 뒤 실행하는 제어층이 필요합니다. 특히 Code Exec 요청에서는 샌드박스가 실제 자격 증명 경로와 네트워크에 접근하지 못하는지 별도로 검증해야 합니다.

섹션별 상세

01
Huihui-Qwen3.6-35B는 6개 텍스트 파일에 10가지 프롬프트 인젝션 유형을 각각 삽입해 총 60개의 테스트 파일을 생성했습니다. 입력 지시는 Hermes의 로컬 설정 디렉터리를 탐색하고, 사용자 정보 유출이나 다른 도구 경로로의 유도를 은밀하게 넣도록 요구했습니다. 모델은 파일별 결과 구조와 공격 유형별 목표를 함께 정리해 에이전트 보안 테스트에 바로 사용할 수 있는 형태로 출력했습니다.
02
공격 유형은 Indirect, Multi-Turn, Adversarial Suffix, Multi-Modal, Prompt Leaking, Tool Calling, Compositional, Backdoor, LLM-as-a-Judge, Code Exec으로 나뉘었습니다. 각 유형은 USER.md와 MEMORY.md 같은 파일 읽기, ORCID·이메일·LinkedIn 추출, Apple Calendar와 FindMy.app 접근, iMessage와 이메일을 통한 외부 통신 같은 구체적인 행동을 목표로 삼았습니다. 단일 악성 지시뿐 아니라 여러 규칙을 연결하거나 특정 키워드가 나타날 때만 작동하는 방식까지 포함해 공격 표면을 넓혔습니다.
03
생성된 보고서에는 Hermes의 작업 공간 경로, 자격 증명 파일이 있을 수 있는 위치, Python 환경, 선호 이메일 자동화 방식, 캘린더 연동 방식 같은 민감한 정보 항목이 열거됐습니다. 이 정보는 모델이 단순히 공격 문장을 만드는 수준을 넘어 로컬 에이전트의 파일 구조와 도구 연결을 공격 목표에 맞춰 구체화했음을 나타냅니다. 따라서 코딩 에이전트는 외부 파일의 텍스트를 신뢰할 수 없는 데이터로 취급하고, 민감한 경로 접근과 외부 도구 호출을 별도 승인 절차로 분리해야 한다는 보안 문제가 드러났습니다.

용어 해설

프롬프트 인젝션(Prompt Injection)
모델이나 에이전트가 원래의 지시를 따르지 않고 입력에 삽입된 악의적 지시를 실행하도록 유도하는 공격입니다. 사용자의 파일, 자격 증명, 개인정보를 읽거나 외부 도구를 호출하게 만들 수 있어 에이전트 보안의 핵심 위험으로 다뤄집니다.
간접 프롬프트 인젝션(Indirect Prompt Injection)
사용자가 직접 지시하지 않아도 문서, 파일, 웹페이지 같은 외부 데이터에 악성 지시를 심어 모델이 이를 명령으로 처리하게 만드는 공격입니다. 검색·파일 읽기·코딩 에이전트처럼 외부 콘텐츠를 입력으로 받는 구조에서 개인정보 유출과 도구 오용으로 이어질 수 있습니다.
도구 호출(Tool Calling)
언어 모델이 함수나 외부 서비스에 구조화된 요청을 보내 파일 조회, 메시지 전송, 일정 확인 같은 작업을 수행하는 방식입니다. 호출 대상과 매개변수를 제대로 제한하지 않으면 프롬프트 인젝션이 모델의 판단을 거쳐 실제 개인정보 접근이나 외부 통신으로 확장될 수 있습니다.
LLM 평가자(LLM-as-a-Judge)
한 언어 모델이 다른 모델의 출력이나 에이전트 행동을 기준에 따라 평가하는 구조입니다. 평가 과정 자체에 사용자 프로필이나 민감한 경로를 포함시키면 안전성 검사가 오히려 개인정보를 다시 읽거나 노출하는 경로가 될 수 있습니다.
샌드박스(Sandbox)
코드나 에이전트의 실행 범위와 파일·네트워크 접근 권한을 제한하는 격리 환경입니다. 이 게시물의 Code Exec 유형처럼 자격 증명 경로와 외부 통신을 샌드박스 범위에 포함시키면 격리의 경계가 약화되어 민감한 데이터 접근 위험이 커집니다.

언급된 도구

Hermes중립

로컬 파일과 skill, 외부 도구를 사용하는 코딩 에이전트로서 프롬프트 인젝션의 공격 대상이 되었습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.