본문으로 건너뛰기

암호화된 AI 추론 흔적의 API 노출

암호화된 CoT를 복원하는 API 취약점과 소형 로컬 에이전트 모델 경쟁이 동시에 부상했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

프론티어 모델의 암호화된 reasoning trace는 API 응답의 서명 블록을 다른 세션이나 약한 모델에 재생하고 prefill과 반복 샘플링을 적용하는 방식으로 복원될 수 있으며, 공개 trace에서는 API 키와 비밀번호까지 노출된 사례가 나왔습니다. 이 사건은 숨겨진 CoT가 대규모 모델 증류에 바로 쓰인다는 뜻은 아니지만, 공개 세션과 도구 인터페이스가 내부 추론을 다시 노출할 수 있고 이를 안전 모니터링에 의존하기 어렵다는 점을 드러냅니다. 같은 기간 Nemotron 3.5 Lightning, Muse Glimmer 30B, Ling-3.0-tiny 같은 소형·고처리량 모델과 Unsloth Desktop이 로컬 에이전트 실행을 겨냥해 출시됐으며, DFlash와 낮은 KV Cache 사용량이 긴 문맥 처리 비용을 낮추는 축으로 부상했습니다. 기업 문서 추출과 장기 에이전트 평가는 단발성 정답률보다 반복 성공률, recall, 도구 호출 정확성을 중시하고, Attestable과 정수 연산 추론은 실행 결과를 검증하고 하드웨어 간 재현성을 확보하려는 방향을 보여줍니다.

섹션별 상세

프론티어 모델 제공업체는 지식 증류와 정보 유출을 막기 위해 Chain-of-Thought를 암호화된 reasoning 블록으로 감추고 있지만, 이 구조가 완전한 비밀 보장을 뜻하지는 않습니다. 연구진은 API 응답에서 유효한 서명 reasoning 블록을 얻은 뒤 다른 세션이나 더 약한 모델의 assistant turn에 재삽입하고, prefill과 반복 샘플링으로 원래 추론을 전사하는 절차를 사용했습니다. Claude에서는 Haiku 4.5에 블록을 재생하고, GPT에서는 최대 50회 출력과 청크 단위 연속 생성을 활용하며, Gemini에서는 thought_signature와 반복 샘플링을 조합하는 식으로 모델별 우회가 이뤄졌다는 점에서 API 설계와 모델 계열의 결합이 핵심 위험 지점으로 드러납니다.
Anthropic, OpenAI, Gemini API에서 숨겨진 reasoning 토큰과 복원된 thinking 토큰의 관계를 비교한 세 개의 산점도입니다.
Chart세 패널은 API가 반환한 reasoning 토큰과 복원된 토큰의 양을 각각 비교하며, 여러 모델에서 점들이 y=x 대각선 부근에 모이는 양상을 보여줍니다. 이는 기사에서 언급한 복원 토큰 수와 청구된 thinking 토큰 수의 일치 주장을 시각적으로 뒷받침하는 자료입니다.
동일한 광학 공동 문제에서 Opus 4.8, Kimi-K3 등 모델의 decoded reasoning과 최종 답변을 나란히 비교한 화면입니다.
Screenshot이미지는 Opus 4.8과 Kimi-K3가 같은 문제를 풀 때 prefilled reasoning 유무에 따라 내부 추론과 답변이 어떻게 달라지는지 비교합니다. 암호화된 reasoning 블록을 다른 모델 요청에 삽입하고 반복 출력으로 복원하는 공격의 작동 맥락을 구체적으로 보여줍니다.
근거
  • 연구진은 다른 세션이나 더 약한 모델에 reasoning 블록을 재생하고 반복 샘플링해 암호화된 추론을 복원했습니다. 기사의 기술 절차 설명과 Claude, GPT, Gemini별 공격 템플릿 단락
공개된 Claude Code와 Codex 세션에 포함된 암호화 reasoning 블록은 복원 과정에서 개인정보를 노출할 수 있습니다. 연구진이 약 7,000개의 공개 trace를 예비 조사한 결과 62개의 고유 API 키, 33개의 이메일 주소, 33개의 비밀번호와 기타 민감 정보가 발견됐고, 이 가운데 64개 정보는 화면에 보이는 세션이 아니라 reasoning 블록 안에서만 나타났습니다. 복원된 CoT가 짧고 단편적이거나 여러 언어가 섞인 neuralese 형태라면 안전 모니터링이 더 어려워지므로, 공개 trace 공유와 도구 인터페이스의 출력 범위를 별도로 제한해야 한다는 실무적 문제가 남습니다.
근거
  • 약 7,000개의 공개 trace에서 62개의 API 키, 33개의 이메일 주소, 33개의 비밀번호가 발견됐습니다. Reasoning-Trace Exposure 단락의 공개 trace 스캔 수치
이번 공격은 숨겨진 CoT를 대규모 학습 데이터로 곧바로 전환할 수 있다는 뜻과는 구분해야 합니다. 일부 논의에서는 암호화가 강력한 기밀성 장치라기보다 상태 비저장 분산 추론을 위한 프로토콜 최적화에 가깝다고 보며, 반복 요청과 거부 응답 제거가 필요한 현재 절차가 대량 수집에 적합하지 않다는 점을 지적합니다. 그럼에도 COT 요약기가 답을 감추거나, 모델이 이해하기 어려운 내부 언어를 사용하거나, 웹사이트 공격과 부정행위에 추론 흔적이 악용될 수 있다는 사례는 숨겨진 추론을 신뢰할 수 있는 감시 인터페이스로 보기 어렵게 만듭니다.
openai-codex/gpt-5.6-luna API에 deep_think 도구를 요청한 Python 실행 화면으로, 장문의 내부 reasoning 출력이 노출된 사례입니다.
Screenshot화면에는 reasoning effort가 off인 상태에서도 deep_think 호출 결과로 긴 내부 추론 문자열이 반환되는 과정이 나타납니다. 기사에서 숨겨진 사고를 감추더라도 도구 인터페이스가 내부 형식의 CoT를 다시 노출할 수 있다는 지적과 직접 연결됩니다.
NVIDIA Nemotron 3.5 Lightning은 전체 31.6B에서 약 3.6B만 활성화하는 MoE 모델로, 고빈도 도구 호출과 상시 실행 에이전트를 겨냥합니다. Artificial Analysis의 사전 엔드포인트 측정에서 중앙값 서빙 속도는 약 670 tok/s였고, Intelligence Index 점수는 24였으며, GDPval-AA v2 Elo는 824, Terminal-Bench v2.1은 24%로 기록됐습니다. Harvey의 Legal Agent Bench 후속 학습에서는 보류 과제 점수가 0%에서 8.3%로 올라가고 평균 출력이 90k 토큰에서 37k 토큰으로 줄어, 더 작은 실행 모델과 강한 계획 모델을 라우팅하는 구성이 실용적 대안으로 부상합니다.
근거
  • Nemotron 3.5 Lightning은 31.6B 전체와 3.6B 활성 파라미터를 사용하고 사전 측정에서 약 670 tok/s 중앙값을 기록했습니다. Nemotron 3.5 Lightning 단락의 Artificial Analysis 수치
Unsloth Desktop은 로컬 모델 실행을 위한 단순 채팅 화면을 넘어 Mac, Windows, Linux에서 MLX, GGUF, diffusion, audio, CPU와 다중 GPU 환경을 함께 지원하는 오픈소스 데스크톱 도구로 확장됐습니다. OpenAI 호환 API, tool calling, sandboxed code execution, private search, RAG, MCP, 모델 export를 한 작업 공간에 묶고, 학습 속도 2배와 VRAM 70% 감소를 내세웁니다. Meta Muse Glimmer의 DFlash 지원과 llama.cpp 및 Transformers 연동, OpenAI의 Linux용 ChatGPT 데스크톱과 프로젝트 및 skills 동기화가 이어지면서 로컬 추론과 에이전트 작업의 진입 경로가 런타임 중심으로 재편되고 있습니다.
Meta Muse Glimmer 30B는 Apache 2.0 기반의 30B dense multimodal 모델로, 텍스트와 이미지 입력을 처리하고 controllable reasoning effort와 도구 사용, 장기 작업, 실패 복구를 겨냥해 학습됐습니다. 약 4비트 양자화로 언어 모델을 20GB 미만으로 줄일 수 있고, 한 RTX 3090 24GB에서 DFlash와 256k 문맥을 함께 실행했다는 사용자 측정에서 약 22~23GB VRAM과 64~124 tok/s 생성 속도가 보고됐습니다. 한 실험은 F16 KV Cache가 131k 문맥에서 약 1.8GiB를 사용하고 150k 토큰 needle retrieval을 통과했다고 전했지만, 코딩 능력과 BF16 품질은 작업별 편차가 있다는 초기 평가도 함께 나왔습니다.
근거
  • Muse Glimmer 30B는 RTX 3090에서 약 22~23GB VRAM으로 256k 문맥과 DFlash를 실행했다는 사용자 측정이 나왔습니다. AI Reddit Recap의 단일 RTX 3090 실행 사례
Qwen 3.8-27B의 출시 예고와 inclusionAI Ling-3.0-tiny의 공개는 30B급 dense 모델과 소형 MoE 모델 사이의 경쟁이 빨라지고 있음을 보여줍니다. Ling-3.0-tiny는 8B 전체와 약 1.3B 활성 파라미터를 사용하며, FP8 기준 DGX Spark에서 약 100~105 tok/s, M4 Pro에서 86~90 tok/s, 8K 문맥에서 약 8.34GiB peak memory가 보고됐고 256K 문맥도 지원합니다. 비교 자료에서는 IFBench 63.61, Multi-IF 83.15, BFCL-v4 62.72를 기록해 작은 메모리와 모바일 환경에서 빠른 tool use 모델을 찾는 수요를 겨냥합니다.
에이전트 평가는 한 번의 답변 품질보다 긴 작업을 끝까지 안정적으로 수행하는지와 문서 처리 결과가 정확한지를 측정하는 방향으로 이동합니다. LlamaIndex ExtractBench는 370개 문서, 4,869페이지, 67개 문서 유형을 대상으로 하며 50페이지를 넘는 문서에서 상용 VLM의 precision은 유지돼도 행과 목록을 조용히 잘라 recall이 35% 아래로 떨어질 수 있다는 결과를 제시합니다. AA-AnalystAgent의 pass^5 reliability에서는 Claude Opus 5가 54%, GPT-5.5가 50%, Claude Fable 5가 49%, Kimi K3가 39%를 기록해 단발성 점수보다 반복 성공률과 workflow correctness가 중요해졌습니다.
근거
  • ExtractBench에서는 50페이지를 넘는 문서에서 상용 VLM의 recall이 35% 아래로 떨어졌습니다. LlamaIndex ExtractBench 결과 단락
검증 가능한 추론과 하드웨어 간 결정성도 에이전트 인프라의 주요 연구 방향으로 제시됩니다. Attestable은 올바른 모델이 올바른 입력을 받아 올바른 도구를 호출했는지 증명하는 zero-knowledge proof를 제품화하려 하며, 현재 방식의 오버헤드가 일부 환경에서 raw inference 대비 한 자릿수 배 미만일 수 있다는 평가가 나왔습니다. 별도 실험에서는 비선형 연산까지 정수 산술로 처리해 A100, H100, Apple M5 Max, AMD EPYC, Intel Xeon에서 Qwen3-0.6B의 logits hash를 동일하게 만들었고, WikiText2 perplexity 20.72와 A100 batch 1에서 106 tok/s가 보고돼 재현성과 증명 친화적 추론의 가능성을 열었습니다.
근거
  • 정수 연산 기반 Qwen3-0.6B 추론은 여러 하드웨어에서 동일한 logits hash와 WikiText2 perplexity 20.72를 기록했습니다. Deterministic integer-only inference 단락

용어 해설

추론 흔적(Reasoning Trace)
대규모 언어 모델이 답변을 만들기까지 생성한 단계별 내부 추론 토큰의 기록입니다. 최근 모델 제공업체는 이를 암호화된 블록이나 별도 API 항목으로 감춰 직접 노출을 줄이고 있지만, API 처리 과정과 모델 간 호환성에 따라 간접적인 복원이 가능해질 수 있습니다.
연쇄적 사고(Chain-of-Thought)
복잡한 문제를 여러 중간 단계로 나누어 해결하는 언어 모델의 추론 방식입니다. 모델의 정답률과 작업 수행 과정을 파악하는 데 유용하지만, 내부 추론을 그대로 공개하면 개인정보 유출이나 보안 취약점 노출로 이어질 수 있어 모니터링과 공개 범위가 쟁점이 됩니다.
추측 디코딩(Speculative Decoding)
작은 초안 모델이 다음 토큰을 먼저 예측하고 큰 대상 모델이 이를 검증해 생성 속도를 높이는 추론 기법입니다. 초안 모델의 예측을 병렬로 확인해 대상 모델의 순차 계산을 줄이며, Muse Glimmer와 같은 로컬 모델의 긴 응답 처리량을 높이는 데 활용됩니다.
Mixture-of-Experts 구조(Mixture-of-Experts)
모델 전체 파라미터를 매번 모두 실행하지 않고 입력마다 일부 전문가 네트워크만 활성화하는 구조입니다. 전체 파라미터 규모를 유지하면서 실제 계산량을 줄일 수 있어 Nemotron 3.5 Lightning과 Ling-3.0-tiny처럼 고처리량 에이전트와 저메모리 추론을 겨냥한 모델에 사용됩니다.
KV 캐시(KV Cache)
Transformer가 긴 문맥을 생성할 때 앞서 계산한 Key와 Value를 저장해 이전 토큰의 어텐션 계산을 반복하지 않도록 하는 메모리 구조입니다. 캐시 크기가 문맥 길이와 함께 커지기 때문에 로컬 모델의 실제 메모리 한계를 좌우하며, Muse Glimmer는 낮은 캐시 사용량으로 긴 문맥 실행에 유리하다는 실험 보고가 나왔습니다.

기술

  • Claude
  • Haiku 4.5
  • GPT
  • Gemini
  • Nemotron 3.5 Lightning
  • Unsloth Desktop
  • MLX
  • GGUF
  • llama.cpp
  • Transformers
  • DFlash
  • Muse Glimmer 30B
  • vLLM
  • Qwen3-0.6B
  • Ling-3.0-tiny
  • LlamaIndex
  • LlamaParse
  • Attestable
  • Qdrant 1.19

활용 사례

  • 암호화된 reasoning trace의 보안 점검
  • 공개 AI 세션의 개인정보 유출 탐지
  • 고빈도 tool calling 에이전트
  • 로컬 장기 문맥 및 멀티모달 에이전트
  • 기업 문서 추출과 스프레드시트 분석
  • 하드웨어 간 재현 가능한 LLM inference
  • zero-knowledge 기반 모델 및 도구 실행 검증

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.