본문으로 건너뛰기

Split-LLM gradient가 decoy 행을 드러내다

Split-LLM에서 decoy 행을 숨기던 gradient의 0 값이 실제 학습 행의 위치를 그대로 노출합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Split-LLM 학습에서 실제 행과 decoy 행을 섞어도, loss가 decoy를 무시하면 반환 gradient의 정확한 0 값이 실제 행의 위치를 드러낼 수 있습니다. 사전 등록한 측정 절차에서 9개 seed 모두 프레임마다 4,096개 중 4,096개의 실제 행을 찾아냈고, 프레임 내용 복원 공격도 상수 추측 기준보다 0.65~1.50 percentage points 높았습니다. 순방향 채널 프라이버시와 모델 품질 검사를 통과한 설정도 반환 gradient까지 포함하면 같은 검사에서 실패했습니다. 행별 gradient clipping과 noise는 약 0.01 nats의 보류 데이터 cross-entropy 손실로 누출을 닫았지만, 여러 학습 단계에 걸친 관찰을 포함한 다섯 종류의 공격은 아직 측정되지 않았습니다.

섹션별 상세

01
Split-LLM 학습은 Trusted Local Node가 보호된 activation을 Untrusted Cloud Node로 보내고, 클라우드가 계산한 출력을 반환하면 로컬 노드가 비공개 loss를 이용해 output gradient를 다시 보내는 두 노드 구조입니다. 프레임에는 실제 행과 decoy 행이 함께 들어가며, decoy는 loss 계산에서 제외됩니다. 이때 decoy의 gradient가 정확히 0이 되면서 입력 보호를 위해 섞은 가짜 행의 위치가 역방향 통신에서 식별 가능한 신호로 바뀝니다.
02
누출 측정은 미리 정한 프로토콜에 따라 진행됐습니다. 알려진 세기의 누출을 주입해 측정 장치가 신호를 잡는지 확인하고, label을 섞은 대조군으로 누출이 없을 때 오탐을 내지 않는지 검사한 뒤, 실행 전에 임계값을 고정했습니다. 아홉 개 seed에서 모든 프레임마다 4,096개 중 4,096개의 실제 행을 찾아내면서 0 gradient 패턴의 식별력이 확인됐습니다.
03
행의 위치뿐 아니라 프레임 내용에도 공격을 적용한 결과, 상수 추측 기준보다 토큰 복원이 약 0.65~1.50 percentage points 높아졌습니다. 반면 shuffled-label 대조군에서는 복원이 전혀 일어나지 않았습니다. 별도의 실행에서는 모델 품질 예산 안에 들어오는 배치를 사용했으므로, 아무도 배포하지 않을 비현실적인 설정에서만 나타나는 현상으로 보기 어렵습니다.
04
기존 평가가 순방향 채널만 확인한 점이 핵심적인 문제로 남습니다. 두 데이터셋에서 실험한 설정은 모두 forward-channel privacy 검사와 품질 검사를 통과했지만, 반환 gradient를 평가 범위에 넣자 같은 검사에서 실패했습니다. 따라서 activation과 출력만 안전하게 보이는지 확인하는 절차만으로는 Split-LLM의 전체 통신 경로에서 발생하는 구조적 누출을 포착하기 어렵습니다.
05
방어책으로 각 행의 gradient에 clipping과 noise를 적용하자 누출은 약 0.01 nats의 held-out cross-entropy 비용으로 차단됐습니다. 이는 gradient를 그대로 반환하지 않고 크기를 제한한 뒤 무작위 잡음을 더해 0 값의 완전한 패턴을 흐리는 방식입니다. 다만 학습 단계 사이에서 관찰을 누적하는 공격을 포함해 다섯 가지 공격 부류는 측정 대상에서 제외됐으므로, 이 조치만으로 시스템 전체의 안전성이 확정되지는 않습니다.

용어 해설

Split-LLM 학습(Split-LLM Training)
Split-LLM 학습은 모델과 데이터를 여러 노드에 나누어 처리하는 분산 학습 방식입니다. 이 논문에서는 Trusted Local Node가 보호된 activation을 Untrusted Cloud Node로 보내고, 클라우드가 반환한 출력의 gradient를 다시 로컬 노드로 전달합니다. 데이터와 loss를 로컬에 남길 수 있지만, 반환 gradient 자체가 입력 구조를 노출할 수 있다는 점이 핵심입니다.
Decoy 행(Decoy)
Decoy 행은 실제 학습 대상이 아닌 가짜 입력 행을 프레임에 섞어 관찰자가 실제 데이터의 위치를 알아내지 못하도록 만드는 보호 장치입니다. 이 구조에서는 loss 계산에서 decoy를 제외하므로 해당 행의 gradient가 정확히 0이 됩니다. 따라서 gradient의 0 패턴이 오히려 실제 행과 가짜 행을 구분하는 신호로 바뀝니다.
순방향 채널 프라이버시(Forward-Channel Privacy)
순방향 채널 프라이버시는 로컬 노드가 클라우드 노드로 보내는 activation과 클라우드가 반환하는 출력만 관찰했을 때 입력 정보가 노출되지 않는지를 평가하는 기준입니다. 이 논문에서는 해당 평가를 통과했지만, 출력 gradient가 반환되는 전체 프로토콜에서는 실제 행의 위치가 드러났습니다. 즉 순방향 메시지만 검사하면 역방향 gradient에 남은 누출을 놓칠 수 있습니다.
보류 데이터 교차 엔트로피(Held-out Cross-Entropy)
Held-out cross-entropy는 학습에 사용하지 않은 데이터에서 모델의 예측 분포와 정답 분포가 얼마나 어긋나는지 측정하는 손실입니다. 값이 낮을수록 보류 데이터에 대한 예측 품질이 좋다는 뜻입니다. 논문에서는 gradient에 clipping과 noise를 적용해 누출을 막으면서 이 손실 증가를 약 0.01 nat로 제한했습니다.

기술

  • split-LLM
  • Trusted Local Node
  • Untrusted Cloud Node
  • gradient clipping
  • gradient noise

활용 사례

  • 분산 LLM 학습의 프라이버시 평가
  • 클라우드 노드와 로컬 노드가 분리된 학습 시스템
  • gradient 기반 데이터 누출 방어
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.