본문으로 건너뛰기

약한 LLM을 거친 추론 흔적 탈취

암호화된 추론 블록의 모델 간 호환성이 LLM 추론 탈취와 데이터 유출 경로로 악용됐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

일부 LLM 제공업체는 Chain-of-Thought를 서버에 보관하는 대신 암호화된 텍스트 블록으로 클라이언트에 반환하고, 클라이언트는 다음 요청에 이 블록을 다시 전달합니다. 연구진은 같은 제공업체 안에서 이 암호화 블록이 세션과 사용자, 모델 사이에서 호환된다는 구조적 취약점을 이용해 약한 모델이 강한 모델의 추론 흔적을 평문으로 출력하게 만드는 공격을 구축했습니다. 이 방식은 Anthropic, OpenAI, Google 모델의 Anti-Distillation 방어 우회, 공개 저장소의 315,320개 추론 블록에서 367개의 PII 아티팩트와 182개의 자격 증명 회수, 숨겨진 위험 정보 노출, 암호화 블록을 이용한 보이지 않는 Prompt Injection으로 이어질 수 있습니다. 연구진은 책임 있는 공개 절차를 거쳐 클라이언트 측 추론을 보호하기 위한 암호학적·시스템 수준의 완화책을 마련했습니다.

섹션별 상세

01
LLM 제공업체는 모델의 단계별 추론을 숨기기 위해 이를 암호화된 텍스트 블록으로 만들어 클라이언트에 반환하고, 이후 요청마다 해당 블록을 다시 받는 구조를 사용합니다. 문제는 이 블록이 같은 제공업체의 서로 다른 세션, 사용자, 모델 사이에서도 호환된다는 점입니다. 따라서 공격자는 보호 수준이 높은 모델을 직접 공격하지 않고, 같은 생태계의 더 약하고 덜 보호된 모델에 블록을 주입해 원래 추론을 평문으로 출력하게 만들 수 있습니다.
02
이 공격은 강력한 모델의 추론을 수집해 다른 모델을 학습시키는 Anti-Distillation 방어를 우회하는 데 쓰일 수 있습니다. 연구진은 Anthropic, OpenAI, Google의 모델을 대상으로 이 경로를 확인했으며, 암호화된 블록을 약한 모델의 입력으로 옮긴 뒤 복호화된 내용을 그대로 출력하게 만들었습니다. 모델 간 블록 호환성이 유지되는 한, 제공업체가 강한 모델의 직접적인 탈옥을 막아도 추론 흔적 자체를 보호하기 어렵다는 의미입니다.
03
암호화 블록에는 모델의 내부 추론뿐 아니라 세션 데이터와 자격 증명이 섞일 수 있습니다. 연구진은 공개 저장소에서 수집한 315,320개의 추론 블록을 복호화해 367개의 PII 아티팩트와 182개의 자격 증명을 회수했습니다. 개발자가 세션 로그를 공개할 때 암호화 블록의 내용을 인식하지 못하면, 암호화가 개인정보와 인증 정보의 안전한 삭제를 보장하지 못합니다.
04
이 취약점은 최종 답변이 악성 요청을 안전하게 거부한 경우에도 추론 과정에 남은 위험 정보를 노출할 수 있습니다. 공격자는 더 나아가 악성 페이로드를 암호화 블록 안에 삽입해 에이전트 실행 기록에 보이지 않는 Prompt Injection을 심을 수 있습니다. 연구진은 책임 있는 공개 이후 클라이언트 측 추론을 보호하려면 암호 설계와 시스템 구조를 함께 수정해야 한다고 정리했습니다.

용어 해설

사고 연쇄(Chain-of-Thought)
대규모 언어 모델이 최종 답변에 이르기까지 거치는 단계별 추론 흔적입니다. 일부 제공업체는 이를 지식재산 보호와 정보 유출 방지를 위해 암호화된 텍스트 블록으로 감춰 클라이언트에 전달하며, 클라이언트는 다음 요청에 해당 블록을 다시 포함합니다.
지식 증류 방지(Anti-Distillation)
강력한 모델의 출력이나 내부 추론을 수집해 더 작은 모델을 학습시키는 행위를 막는 보호 기법입니다. 이 논문에서는 약한 모델이 같은 제공업체의 암호화된 추론 블록을 평문으로 출력하면서 이러한 방어를 우회하는 경로가 발생합니다.
프롬프트 주입(Prompt Injection)
모델의 입력이나 외부 데이터에 악성 지시를 삽입해 정상적인 처리 흐름을 바꾸는 공격입니다. 연구진은 암호화 블록 안에 악성 페이로드를 숨겨 에이전트 실행 기록을 오염시키는 보이지 않는 주입이 가능하다고 설명합니다.
개인 식별 정보(Personally Identifiable Information)
개인을 직접 또는 간접적으로 식별할 수 있는 이름, 연락처 등의 정보입니다. 연구진은 공개 저장소에서 수집한 추론 블록을 복호화해 367개의 PII 아티팩트를 회수했다고 보고합니다.
클라이언트 측 추론(Client-Side Reasoning)
모델의 추론 흔적을 서버에만 보관하지 않고 클라이언트가 암호화된 블록 형태로 전달받아 이후 요청에 재전송하는 구조입니다. 블록이 세션과 사용자, 모델 사이에서 호환되면 클라이언트 측 데이터가 공격 표면으로 바뀔 수 있습니다.

기술

  • LLM API
  • Chain-of-Thought
  • 암호화된 텍스트 블록
  • Anti-Distillation
  • Prompt Injection
  • 클라이언트 측 추론

활용 사례

  • LLM 추론 흔적 탈취
  • 공개 세션 로그의 개인정보 및 자격 증명 추출
  • 에이전트 실행 기록 오염
  • 악성 요청 처리 과정의 위험 정보 노출
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.