본문으로 건너뛰기

PolicyShiftGuard: 정책 번들에 적응 가능한 이미지 가드레일 벤치마크와 두 단계 학습법

같은 이미지에 대해 정책이 바뀔 때 결정이 뒤바뀌어야 하는 경계 사례를 평가하는 PolicyShiftBench와, RP-SFT와 BP-Adapt를 결합해 정책 적응성을 크게 향상시킨 PolicyShiftGuard를 제시한다.

용어 해설

정책 전환 점수(Policy Shift Score (PSS))
같은 이미지와 위험 카테고리 내에서 서로 다른 정책이 부과될 때 모델이 두 케이스 모두를 정확히 판정했는지를 측정하는 쌍별 지표이다. 동일 이미지에 대해 허용/차단으로 라벨이 뒤바뀌는 쌍을 집단으로 묶어, 그 집단 내부에서 모델이 양쪽 모두를 맞힌 비율을 평균해 계산한다. 이 지표는 단순한 시각적 위험 인식 능력과 정책 텍스트에 기반한 결정 능력을 구분하는 데 중요하다.
경계쌍 정책 적응(Boundary-Pair Policy Adaptation (BP-Adapt))
같은 이미지와 동일 위험 카테고리에 대해 한 정책은 허용하고 다른 정책은 차단하는 매치된 쌍을 학습 단위로 사용하는 사후학습 기법이다. 각 쌍에 대해 차단 정책이 허용 정책보다 높은 'unsafe' 점수를 내도록 pair margin 손실을 적용해 정책 민감성을 직접적으로 최적화한다. 이 방식은 정책 변경 시 결정이 뒤바뀌어야 하는 사례에서 안정적인 적응을 확보하는 데 핵심적이다.
무작위화된 정책 SFT(Randomized Policy SFT (RP-SFT))
정책 번들의 표현 순서, 슬롯 배치, 표면 식별자 등을 무작위화하여 정책 텍스트의 고정 위치나 템플릿을 우회하도록 만든 지도학습 단계이다. 이 단계는 모델이 정책 번들을 읽고 제공된 규칙에 따라 구조화된 출력(true | c 또는 false)을 생성하도록 학습시키며, 고정된 표면 단서에 의존하는 지름길을 줄인다. 다만 이 단계만으로는 보류/허용이 뒤바뀌는 경계 사례에 대한 강한 일반화가 확보되지 않았다.
정책 번들(Policy Bundle)
일곱 개 위험 카테고리 각각에서 하나의 정책 변형을 선택해 합성한 런타임 규칙 집합으로, 모델은 이 번들 전체를 읽어 각 이미지의 최종 허용/차단 결정을 산출해야 한다. 번들 내부의 한 카테고리가 차단을 반환하면 전체 라벨은 unsafe가 되며, 모든 카테고리가 통과해야만 safe가 된다. 번들 단위 평가는 실제 배포 환경에서 서로 다른 제품·연령·지역 기준을 동시에 적용하는 상황을 모사한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.