레드팀 테스트
레드팀 테스트는 시스템의 취약점을 찾기 위해 공격자 관점에서 모의 공격을 수행하는 평가 방식으로, 본문에서는 사람 레드팀의 한계를 보완하기 위해 내부 전용 자동화 레드팀 모델을 학습시킨 사례가 핵심 배경으로 제시된다. 자동화 레드팀은 반복적이고 대규모의 적대적 입력을 생성해 방어 모델의 약점을 노출시키며, 그 결과로 얻은 실패 사례를 학습 데이터로 활용하면 모델의 견고성이 향상된다. OpenAI 사례에서는 GPT‑Red가 사람보다 훨씬 많은 시나리오에서 공격에 성공해 유용한 적대적 데이터를 생성한 점이 강조된다.