본문으로 건너뛰기

OpenAI가 고객 데이터 없이 여러 대화의 AI 악용을 감시하는 방식

OpenAI가 대화 원문을 보관하지 않고 여러 세션의 악용 징후를 찾는 안전 체계를 시험한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 모델의 오용 위험이 커지는 가운데 OpenAI가 고객 데이터를 보관하지 않고 여러 대화와 세션의 입력·출력을 함께 확인하는 Private Safety Processing을 일부 고객에게 시험한다. 기존 Zero Data Retention이 개별 세션을 감시했다면, 새 방식은 요청을 여러 세션으로 나눠 탐지를 피하는 악성 사용 패턴까지 포착하고 위험 발생 시 구체적인 활동 유형만 신호로 전달한다. Anthropic은 covered models의 세션과 대화를 30일 보관하고 승인 검토자의 인간 검토를 허용하는 정책을 운영해 OpenAI와 다른 프라이버시·안전 균형을 택했다. 두 회사의 접근 차이는 기업 고객 확보 경쟁과 AI 안전 정책의 차별화로 이어지고 있다.

섹션별 상세

01
AI 모델의 성능이 높아질수록 악성코드 개발 같은 오용 가능성도 커져, 기업 고객의 민감한 데이터를 지키면서 악용 행위를 찾는 안전 체계가 중요해졌습니다. OpenAI는 일부 고객을 대상으로 Private Safety Processing을 시험하며 이 문제에 대응합니다. Anthropic이 특정 모델의 세션과 대화를 30일 동안 보관할 수 있도록 한 정책과 대비되는 접근입니다.
근거
  • OpenAI가 고객 데이터를 보관하지 않으면서 여러 대화의 악용 징후를 감시하는 Private Safety Processing을 일부 고객에게 시험하고 있다. 기사 첫 문단과 Private Safety Processing 소개 문단
  • Anthropic은 covered models의 세션과 대화 데이터를 30일 동안 보관할 수 있는 정책을 운영한다. Anthropic의 데이터 보존 정책과 Mythos-class models를 설명한 문단
02
OpenAI의 기존 Zero Data Retention은 API 내부 agent가 개별 세션 단위로 악용 여부를 확인하고 고객 데이터를 회사에 남기지 않는 방식입니다. Private Safety Processing은 여러 대화의 입력과 출력을 함께 살피는 장기 범위 모니터링으로 ZDR의 적용 범위를 넓히며, 여러 세션에 요청을 흩어 감시를 피하려는 패턴을 포착합니다. 시스템이 위험 신호를 감지하면 대화 원문 대신 특정 활동 유형을 가리키는 좁게 정의된 신호를 OpenAI에 보내고, OpenAI는 추가 조치가 필요한지 판단합니다.
근거
  • Private Safety Processing은 개별 세션을 확인하던 Zero Data Retention의 범위를 여러 대화와 세션으로 넓힌다. Zero Data Retention과 long-horizon safety monitoring을 비교한 중간 문단
  • 악용이 감지되면 OpenAI에는 구체적인 활동 유형을 가리키는 좁게 정의된 신호가 전달되고, 고객은 필요할 때 데이터를 자발적으로 공유할 수 있다. 시스템 작동 후 신호 전달과 고객 연락 절차를 설명한 문단
03
Private Safety Processing이 작동하더라도 OpenAI가 고객 대화를 직접 검토하는 구조는 아니며, 추가 맥락이 필요할 때 고객에게 연락해 자발적인 데이터 공유를 요청할 수 있습니다. 반면 Anthropic은 승인된 소수의 검토자가 통제된 접근 경로를 통해 고객 데이터를 직접 검토할 수 있다고 밝히고, 검토 세션을 변조 방지 로그에 기록합니다. 두 회사의 차이는 안전 목적의 감시를 수행하면서 고객 데이터 보존과 인간 접근을 어느 수준까지 허용할지에 있습니다.
근거
  • Anthropic의 고객 데이터 인간 검토는 통제된 접근 경로와 승인 검토자, 변조 방지 로그를 거친다. Anthropic의 인간 검토 절차를 설명한 후반부 문단
04
이 경쟁은 기업 고객을 둘러싼 OpenAI와 Anthropic의 제품·정책 차별화와 맞물려 있습니다. Anthropic의 정책은 민감한 데이터를 다루는 기업의 우려를 키웠고, OpenAI는 데이터 비보존과 다중 세션 탐지를 결합한 방식을 내세웠습니다. 기사에는 Anthropic의 연환산 매출 규모가 650억 달러로 거론되고 투자자들이 기업공개 시 기업가치를 2조 달러로 추정했다는 내용도 포함됩니다.

용어 해설

Zero Data Retention
고객 데이터를 보관하지 않는 API 운영 정책입니다. OpenAI의 기존 ZDR은 세션별 agent가 악용 가능성을 확인하면서도 회사가 고객 데이터를 저장하지 않도록 설계됐습니다. Private Safety Processing은 이 범위를 여러 대화와 세션으로 넓힙니다.
장기 범위 안전 모니터링(Long-horizon Safety Monitoring)
한 번의 대화가 아니라 여러 대화에 걸쳐 입력과 출력을 연결해 악용 징후를 확인하는 방식입니다. 요청을 여러 세션으로 나눠 감시를 피하려는 행위까지 포착하는 데 목적이 있습니다. Private Safety Processing의 핵심 작동 방식입니다.
대상 모델(Covered Models)
Anthropic의 데이터 보존 정책이 적용되는 모델 범주입니다. 기사에서는 모든 Mythos-class 모델과 유사한 역량을 지닌 미래 모델이 포함된다고 전합니다. 해당 모델의 세션과 대화는 30일 동안 보관될 수 있습니다.
변조 방지 로그(Tamper-proof Log)
Anthropic이 고객 데이터의 인간 검토 기록을 남기는 방식입니다. 통제된 접근 경로를 거친 소수의 승인 검토자만 데이터에 접근하며, 각 검토 세션은 검토자가 숨기거나 수정할 수 없는 기록에 남습니다.

기술

  • Private Safety Processing
  • Zero Data Retention
  • OpenAI API
  • AI agents

활용 사례

  • 여러 세션에 걸쳐 진행되는 악성코드 개발 시도 탐지
  • 민감한 기업 데이터를 보관하지 않는 AI API 안전 감시
  • 인간의 대화 원문 검토 없이 수행하는 악용 모니터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.