TL;DR
SaferAI가 Z.ai의 공개 API로 평가한 결과 GLM-5.2는 사이버와 생물학 관련 유해 요청을 거부하지 않아 개방형 가중치 모델의 오용 위험을 실질적으로 드러냈다. 폐쇄형 선두 제공자들은 분류기·거부훈련·API 제어 등으로 위험을 억제하는 반면, 가중치가 공개되면 이러한 통제가 무력화되므로 재프롬프트 같은 기법으로 방어가 쉽게 무너질 수 있다. 데이터 필터링은 일부 생물학적 지식 억제에 기여할 수 있으나 코딩 역량과 해킹 역량의 중첩 때문에 한계가 있고, 정책·운영 차원에서의 조치와 공개의 방어적 이점을 따로 균형 있게 평가해야 한다.
섹션별 상세
- SaferAI 평가에서 GLM-5.2는 사이버·생물학 과제를 하나도 거부하지 않았다. — SaferAI가 Z.ai의 공개 API를 통해 수행한 CyberGym 등 벤치마크 결과 보고서; 기사 본문 기술
- Claude Opus 4.7은 반복적으로 거부해 SaferAI가 CyberGym을 완료하지 못했다. — SaferAI가 동일한 벤치마크로 Claude Opus 4.7을 평가한 관찰 기록; 기사 본문 기술
- Far.ai는 Grok 4.5와 Gemini 3.1 Pro 등 선두 모델에서 수백 건의 재프롬프트(universal jailbreak)를 발견했다. — Far.ai 보고서 요약과 기사 인용 부분; 재프롬프트 성공 메커니즘 설명
- Z.ai는 GLM-5.2에 관해 안전 프레임워크·사전배포 평가·위험 평가를 공개하지 않았다. — 기사의 직접적 기술과 TechCrunch가 Z.ai에 질의했으나 응답을 받지 못했다는 취재 메모
용어 해설
- 개방형 가중치 모델(Open-weight model)
- — 모델 가중치(weights)를 공개해 누구나 다운로드해 자체 인프라에서 실행하거나 수정할 수 있게 한 모델을 가리킨다. 배포 후에는 제공사가 API로 걸어둔 제약을 우회하거나 제거하고, 재학습·파인튜닝·시스템프롬프트 변경 등 안전장치를 삭제할 여지가 생긴다. 이 때문에 공격자가 고성능 기능을 악용할 위험과 방어자가 통제권을 잃는 문제가 동시에 제기된다.
- 사전학습 데이터 필터링(Pre-training data filtering)
- — 훈련에 투입되는 대규모 코퍼스에서 유해하거나 오용 가능성이 큰 정보를 사전에 제거한 뒤 모델을 학습시키는 방법이다. 연구에서는 특정 생물학적 지식의 유출을 낮추면서 전체 성능을 유지하는 사례가 보고되지만, 코딩·사이버역량을 분리하기 어렵다는 한계가 있다.
- 재프롬프트·탈출 기법(Jailbreak)
- — 모델의 거부나 안전 필터를 회피하기 위해 역할극·권한 사칭·과거 대화 위조·후속 프롬프트 결합 같은 조작 기법을 이어 쓰는 공격 패턴을 말한다. Far.ai 보고서는 널리 재사용되는 'universal jailbreak'가 존재하며, 이러한 결합이 방어 체계의 약점을 증폭시켜 유해 요청을 관철시킨다고 지적했다.
- API 차단·제어 장치(API-level controls)
- — 모델을 호스팅하는 제공자가 API 엔드포인트에서 요청을 검사하거나 분류기·거부훈련(refusal training)·rate limit 등으로 유해 응답 생성을 억제하는 기술적 수단을 말한다. 이러한 제어는 호스팅 환경에서는 효력을 발휘하지만 가중치가 공개되면 사용자가 임의로 제거하거나 무력화할 수 있다.
- CyberGym 벤치마크(CyberGym)
- — 모델의 사이버 보안 관련 능력을 평가하기 위한 벤치마크로, 취약점 탐지·악성 코드 생성 등 공격·방어 관련 과제를 포함한다. 기사에서는 SaferAI 평가가 이 벤치마크를 사용해 GLM-5.2와 Claude Opus 4.7의 사이버·생물학적 응답 거부 여부를 비교했다.
기술
- GLM-5.2
- Z.ai
- Claude Opus 4.7
- GPT-5.5
- CyberGym
- API-level controls
- pre-training data filtering
활용 사례
- 보안 팀이 공개 모델을 이용해 잠재적 취약점을 미리 식별하고 패치 전략을 세우는 방어적 용도
- 악성 행위자가 공개 가중치를 활용해 자동화된 사이버 공격 도구를 개발하는 공격적 용도
- 연구자가 모델의 안전성·오용 위험을 재현해 대응책을 검증하는 보안 리서치
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.