본문으로 건너뛰기

AI 보안 모델과 오픈 웨이트의 우회로

AI 보안 능력이 폐기 대신 접근 통제와 오픈 웨이트 경쟁으로 갈라졌다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 주 AI 동향은 사이버보안 능력을 제한된 파트너에게만 제공하는 GPT-5.6 Cyber와 오픈 웨이트 공개를 예고한 GLM-5.3이 서로 다른 통제 방식을 택했다는 점에 초점을 둔다. GPT-5.6 Cyber는 표준 모델이 거부하는 공격적 보안 요청의 98.5%와 비교해 95%의 응답률을 자체 평가에서 기록했으며, GLM-5.3은 CyberGym 84.5%를 공급업체 수치로 내세웠다. Meta·Alibaba·DeepSeek는 Apache-2.0 또는 MIT 라이선스와 대형 모델 공개를 이어갔고, Anthropic의 워터마크와 암호화된 추론 흔적 재생 취약점, 181,874개 회의 노출 사례가 배포 이후의 보안 문제를 부각했다. 전체 흐름은 위험한 능력을 없애기보다 접근권한·가중치·인증·데이터 공개 범위를 조절하는 방향으로 이동했다는 것이다.

섹션별 상세

OpenAI는 내부에서 사이버 공격 능력을 배제할 수 없었던 모델의 작업을 멈췄지만, 원문은 유사한 능력이 GPT-5.6 Cyber라는 보안 특화 모델 형태로 결국 출시됐다고 정리했다. 이 모델은 표준 모델이 거부하는 공격적 보안 요청의 98.5%와 비교해 95%의 응답률을 자체 평가에서 기록했으며, Daybreak Red 등급과 16개 지정 파트너라는 제한된 접근 구조를 사용한다. 모델 가중치는 고객에게 제공하지 않고, 9월 1일부터 개인 계정에 하드웨어 키를 요구하는 방식은 기능 자체의 폐기보다 접근 통제를 선택한 사례로 읽힌다.
Zhipu의 GLM-5.3도 8월 14일 ‘emergent cyber capabilities’를 내세우며 사이버보안 능력을 공개 경쟁에 올렸다. 공급업체가 보고한 CyberGym 점수는 84.5%였고, 원문은 Wiz의 Atlas 시스템이 90.9%를 주장했다는 비교 수치를 함께 적어 성능 수치의 출처와 경쟁 구도를 구분했다. GLM-5.3의 오픈 웨이트가 약 2주 안에 공개될 예정이라는 내용까지 포함돼, GPT-5.6 Cyber의 폐쇄형 통제와 대비되는 배포 경로가 형성됐다.
오픈 웨이트 진영에서는 Meta의 Muse Glimmer가 Apache-2.0 라이선스의 30B agent model로 공개됐고, 20GB 미만 환경에서 실행된다고 정리됐다. Alibaba는 처음으로 다운로드 가능한 2.4T Max-class Qwen을 내놓았으며 Qwen3.8-27B도 Apache-2.0으로 공개했고, DeepSeek는 1.6T V4-Pro를 MIT 라이선스로 정식 출시하면서 피크·비피크 가격을 적용했다. 서로 다른 모델 규모와 라이선스가 한 주에 함께 등장하면서, AI 경쟁이 성능뿐 아니라 가중치 공개와 실행 비용 구조로도 확장됐다는 흐름이 드러난다.
보안과 거버넌스 문제는 모델 출시와 별개로 실제 운영 환경에서 나타났다. Anthropic은 EU AI Act 대응을 위해 Claude 출력에 비가시 워터마크를 넣기 시작했지만 개발자 포럼의 반발을 샀고, 연구진은 OpenAI·Anthropic·Google의 암호화된 추론 흔적이 동일 계열 모델 사이에서 재생돼 복호화될 수 있음을 확인한 뒤 수정했다. AI notetaker가 181,874개의 회의를 누구나 검색할 수 있는 상태로 남긴 사례까지 포함돼, 모델 능력의 통제뿐 아니라 출력 추적과 데이터 접근권한도 핵심 위험으로 묶였다.

용어 해설

CyberGym
사이버보안 작업에서 AI 모델의 능력을 측정하는 평가 환경이다. 원문에서는 GLM-5.3의 성능을 84.5%로 집계한 기준으로 쓰였지만, 해당 수치는 공급업체가 자체 보고한 값이며 Wiz의 Atlas 시스템 수치와 비교됐다.
오픈 웨이트(Open Weights)
모델의 학습된 가중치를 외부에 공개해 사용자가 직접 내려받고 실행하거나 조정할 수 있게 하는 배포 방식이다. 원문에서는 Meta와 Alibaba의 공개 전략, GLM-5.3의 가중치 공개 예정과 연결된다.
하드웨어 키(Hardware Key)
계정 인증에 사용하는 물리적 보안 장치다. 원문에서는 OpenAI GPT-5.6 Cyber에 대한 접근 통제를 강화하기 위해 9월 1일부터 개인 계정에 요구되는 수단으로 제시됐다.
비가시 워터마크(Invisible Watermark)
출력물에 사람 눈에 잘 보이지 않는 식별 정보를 삽입하는 기술이다. 원문에서는 Anthropic이 EU AI Act에 대응해 모든 Claude 출력에 삽입하기 시작했으며, 개발자 포럼의 반발을 불렀다고 서술했다.
암호화된 추론 흔적(Encrypted Reasoning Traces)
AI 모델의 내부 추론 과정을 암호화해 외부 노출을 줄이려는 데이터다. 원문에서는 OpenAI·Anthropic·Google의 암호화된 추론 흔적이 동일 계열 모델 사이에서 재생돼 복호화될 수 있었고, 이후 문제가 수정됐다고 전했다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.