TL;DR
이미지 안전성은 이미지 자체의 속성이 아니라 적용되는 정책과의 관계라는 점을 본문이 반복적으로 실증했다. 실제 배포에서는 제품, 연령대, 지역별로 허용 기준이 달라 동일 이미지가 허용될 수도 차단될 수도 있으므로, 정책 텍스트를 런타임으로 받아 상황에 맞게 결정을 바꿀 수 있는 가드레일이 필요하다. 본 연구는 그러한 요구를 직접 측정하는 벤치마크와 이를 목표로 설계된 학습 절차를 함께 제시해 실무적 평가 기준과 모델 개선 방향을 제공했다.
왜 중요한가
이미지 안전성은 이미지 자체의 속성이 아니라 적용되는 정책과의 관계라는 점을 본문이 반복적으로 실증했다. 실제 배포에서는 제품, 연령대, 지역별로 허용 기준이 달라 동일 이미지가 허용될 수도 차단될 수도 있으므로, 정책 텍스트를 런타임으로 받아 상황에 맞게 결정을 바꿀 수 있는 가드레일이 필요하다. 본 연구는 그러한 요구를 직접 측정하는 벤치마크와 이를 목표로 설계된 학습 절차를 함께 제시해 실무적 평가 기준과 모델 개선 방향을 제공했다.
핵심 기여
PolicyShiftBench: 정책 번들 기반의 정책-적응성 벤치마크 구축
PolicyShiftBench는 일곱 개 위험 카테고리와 다섯 개 현실적 시나리오의 교차로 구성된 28개 정책 변형과 2,000개의 정책-판별 인스턴스를 포함한다. 각 이미지당 평균 7.55개의 정책-조건화 프롬프트가 제공되며, 대부분의 이미지는 허용과 차단이 모두 존재하는 경계쌍을 포함해 동일 이미지에서 정책이 바뀔 때 모델이 결정을 뒤바꾸는 능력을 측정한다. 데이터 생성 과정은 이미지 속성(attributes)과 실행 가능한 정책 규칙을 분리해 라벨의 감사를 가능하게 했다.
정책 민감성 평가 지표 Policy Shift Score (PSS) 도입
PSS는 동일 이미지와 위험 카테고리 내에서 서로 다른 정책이 서로 다른 정답을 낼 때 모델이 해당 쌍의 양쪽을 모두 정확히 맞혔는지를 집단별로 집계해 점수화한다. 이 지표는 단순한 F1이나 정확도로는 드러나지 않는 정책-의존성 실패 모드를 드러내며, 정책 번들에 기반한 런타임 적응 능력을 직접적으로 측정한다. 벤치마크의 평가 파이프라인은 PSS와 전통적 F1을 함께 보고하도록 설계됐다.
PolicyShiftGuard: RP-SFT와 BP-Adapt를 결합한 두 단계 학습 레시피
첫 단계인 Randomized Policy SFT(RP-SFT)는 정책 번들의 표면 표기를 무작위화해 모델이 정책 텍스트를 실제로 파싱하고 규칙에 따라 구조화된 출력을 생성하도록 지도학습했다. 두 번째 단계인 Boundary-Pair Policy Adaptation(BP-Adapt)은 동일한 이미지·위험 카테고리에서 허용/차단으로 정답이 바뀌는 매치드 쌍을 사용해 pair margin 손실을 적용함으로써 차단 정책이 허용 정책보다 높은 'unsafe' 점수를 내도록 직접적으로 최적화했다. 이 조합으로 7B 모델이 PolicyShiftBench에서 Avg. F1 76.9와 Avg. PSS 72.1을 달성해 정책-적응성 측면에서 성능 향상을 보였다.
지연-성능 트레이드오프에서의 실용성 확보
PolicyShiftGuard는 출력 형식을 의도적으로 간결하게 설계해 결정이 대체로 5토큰 내에 확정되도록 만들었으며, 이로 인해 토큰 생성 비용과 지연이 줄었다. 실험에서는 Qwen2.5-VL-7B의 추론 지연이 273.3ms에서 PolicyShiftGuard-7B는 163.9ms로 감소하면서 Avg. F1과 PSS가 동시에 개선되는 결과가 관찰됐다. 이 결과는 배포 경로에 놓이는 가드레일이 정확도뿐 아니라 응답 속도를 함께 고려해야 함을 실증했다.
핵심 아이디어 이해하기
문제의 출발점은 이미지 안전성 판단이 이미지만으로 결정되는 단일 분류 문제가 아니라, 런타임으로 주어지는 정책 텍스트에 바인딩되어야 하는 조건부 결정이라는 점이다. 기존 접근법은 이미지 수준의 위험 신호를 감지하는 능력에 의존했으나, 동일 시각적 단서가 서로 다른 정책 하에서 허용 또는 차단으로 달라지는 경계 사례를 처리하지 못했다. 따라서 모델은 먼저 이미지로부터 안정적인 속성(attributes)을 추출하고, 그 속성 벡터를 현재 활성화된 정책 규칙에 적용해 최종 결정을 도출하는 방식으로 동작해야 한다.
해결 원리는 명확한 분리와 대조 학습에 있다. 첫째로 이미지에서 감지된 원자적 속성은 정책 판단과 분리되어 결정적 규칙에 의해 라벨로 환원된다. 둘째로 학습 과정에서 정책 번들의 표면 표현을 무작위화해 모델이 순서나 템플릿에 의존하지 않도록 하고, 이어서 같은 이미지와 위험 카테고리에 대해 허용과 차단이 모두 존재하는 '경계쌍'을 사용해 쌍간 점수 차이를 강제로 확보한다. 이 쌍간 학습은 차단 정책이 허용 정책보다 높은 'unsafe' 점수를 갖도록 조정함으로써 정책 전환 시 결정이 실제로 뒤바뀌게 만든다.
이 접근은 기존의 단일 라벨 인식과 비교해 정책-조건화된 일반화를 가능하게 한다. 무작위화된 정책 표현은 표면적 지름길을 제거해 모델이 정책 텍스트 자체를 파싱하도록 유도하며, boundary-pair 손실은 정책이 바뀔 때 모델 출력의 우선순위를 재정렬한다. 결과적으로 동일한 이미지 증거에 대해 정책에 따라 결정을 달리 내릴 수 있는 능력이 유의미하게 증가했다.
방법론
전체 접근은 데이터 파이프라인 설계와 두 단계 학습으로 구성된다. 데이터 단계에서는 사람/모델 혼합 어노테이터가 이미지별로 범주별 속성(attribute)을 예측하고, 이 속성 집합에 대해 각 정책 규칙을 결정적으로 적용해 pass/block 라벨을 생성했다. 이렇게 하면 라벨의 원인이 특정 속성 변화인지 정책 규칙 변화인지 추적 가능해지며, 동일한 이미지 속성에 대해 정책만 바뀌어 라벨이 뒤바뀌는 경계 사례를 대량으로 생성할 수 있었다.
학습 단계의 1단계 RP-SFT는 정책 번들과 목표 정답 문자열을 입력으로 받아 next-token 예측 손실로 최적화했다. 이 단계에서 정책 번들의 순서, 카테고 슬롯, 표면 식별자는 ρ 함수로 무작위화되어 입력과 목표 문자열 모두에 동일한 변환이 적용되었다. 무작위화는 고정된 포지션 또는 템플릿에 의존한 단순 지름길을 제거해 모델이 정책 본문을 읽어 규칙을 바인딩하도록 유도했다.
2단계 BP-Adapt는 RP-SFT 체크포인트를 기반으로 경계쌍 데이터에 대해 추가 파인튜닝을 수행했다. 손실 함수는 교차엔트로피 ℒ_CE에 더해 ℒ_label, ℒ_cat, ℒ_pair의 가중 합으로 구성되며, 핵심 항은 ℒ_pair = max(0, m - [s(true|q⁺) - s(true|q⁻)])로 정의돼 차단 쪽의 unsafe 점수 s(true|q⁺)가 허용 쪽보다 마진 m만큼 크도록 학습한다. 이 설계는 각 프롬프트를 개별적으로 맞추는 것뿐만 아니라 동일한 시각 증거에서 정책별 점수 우선순위를 재조정하는 역할을 한다.
추가적으로 품질 관리를 위해 어노테이터 간 필드 수준 합의, 결정적 검증기, 인간 감사가 병행됐다. canonical voted metadata에서 97.5%가 3인어노테이터 전원 일치였고, 데이터셋 수준의 분할 위생과 이미지 불일치 방지를 위해 학습/평가 분할을 이미지단위로 분리했다. 이러한 파이프라인은 라벨 생성의 감사 가능성과 경계쌍의 신뢰도를 담보했다.
관련 Figure

왼쪽 원형 그래프는 각 위험 카테고리 및 시나리오별 데이터 분포를 보여 이미지당 평균 정책 수와 경계 사례의 존재를 강조한다. 오른쪽 매트릭스는 시나리오와 카테고리를 교차해 생성되는 28개 정책 변형을 정리해 벤치마크가 정책 번들 조합을 어떻게 구성하는지 구체적으로 전달한다. 이 그림은 데이터가 속성 기반 라벨링과 정책 조합으로 구성돼 동일 이미지의 정책별 라벨 변화를 의도적으로 포함함을 시각적으로 보강한다.
PolicyShiftBench의 데이터 구조와 시나리오-위험 카테고리 매트릭스를 시각화한 도표이다.
주요 결과
PolicyShiftGuard는 PolicyShiftBench에서 정책-조건화 성능을 크게 개선했다. 논문이 보고한 주요 수치는 PolicyShiftGuard-7B가 평균 Avg. F1 76.9와 Avg. PSS 72.1을 달성했으며, 같은 백본을 사용한 베이스라인 대비 F1과 PSS에서 큰 폭의 향상을 보였다고 표로 제시됐다. 이 결과는 단순한 모델 크기 확장만으로는 달성하기 어려운 정책 적응 능력의 개선을 의미한다.
교차 벤치마크 전이성도 확인됐다. PolicyShiftGuard는 UnSafeBench와 SafeEditBench로의 전이에서 우수한 성적을 보였으며, PolicyShiftGuard-7B가 UnSafeBench·SafeEditBench·Adaptive/Shift 스플릿의 평균에서 최고 성능을 보였다고 보고됐다. 이 전이는 학습이 시각 증거와 정책 텍스트의 결합을 실제로 바인딩하는 능력을 향상시켰음을 시사한다.
지연-성능 측면에서는 출력 형식을 간결하게 설계한 덕분에 추론 지연이 줄어들면서 성능이 향상되는 결과가 관찰됐다. 예컨대 Qwen2.5-VL-7B의 추론 지연이 273.3ms였던 반면 PolicyShiftGuard-7B는 163.9ms로 감소했고, 이와 동시에 Avg. F1과 PSS가 개선됐다. 또한 RP-SFT와 BP-Adapt의 구성요소별 ablation은 pair loss와 concise final-token supervision의 중요성을 실험적으로 확인했다.
관련 Figure

가로축은 모델의 의사결정 속도(추론 지연의 역수)를, 세로축은 PolicyShiftBench 상의 평균 F1을 나타내며, Pareto 프런티어는 성능과 속도 간 트레이드오프를 시각화한다. PolicyShiftGuard 포인트가 성능과 속도 측면에서 우수한 영역에 위치해 간결한 출력 형식이 추론 지연을 감소시키면서도 F1을 유지하거나 향상했음을 보여준다. 또한 닫힌 소스 모델이나 'think' 모드 기반 접근이 느리지만 반드시 높은 정책-적응성(PSS)을 보장하지 않는다는 점이 확인된다.
다양한 모델의 평균 F1과 결정 속도(1000/지연(ms))를 비교한 산점도이다.

히트맵은 모델마다 카테고리별 성능 편차가 크며 특히 nudity나 violence 같은 시각적으로 도드라진 위험은 비교적 높은 점수를 얻는 반면 regulated goods, PII, text-in-image 등은 전반적으로 낮은 성능을 보였음을 수치로 드러낸다. 이 시각화는 정책-적응성의 난이도가 카테고리별로 상이함을 뒷받침하며, 라벨을 속성 기반 규칙으로 생성한 설계가 왜 필요한지 근거를 제공한다. 모델 비교를 통해 PolicyShiftGuard가 여러 카테고리에서 일관된 개선을 이뤘다는 사실도 확인된다.
모델별로 위험 카테고리와 시나리오에 대한 F1과 정확도를 행렬 형태로 나타낸 히트맵이다.
기술 상세
전체 아키텍처는 Qwen2.5-VL 백본을 초기화로 사용하는 소형 멀티모달 가드레일 모델과, 속성 추출을 위한 멀티모달 어노테이터 및 결정적 정책 규칙으로 구성된 데이터 파이프라인으로 구성된다. 입력은 이미지와 일곱 개 카테고리에 대한 정책 번들이며 출력은 간결한 구조화된 문자열(예: "true | XX" 또는 "false")이다. 출력이 간결하므로 첫 토큰으로도 이진 결정을 얻을 수 있어 추론 지연을 낮출 수 있다.
핵심 알고리즘은 두 단계 학습이다. 1단계 RP-SFT는 다양한 정책 표면 변형 ρ를 적용해 모델이 정책 번들을 읽고 바인딩하도록 supervised next-token 예측으로 학습한다. 2단계 BP-Adapt는 매치드 허용/차단 쌍을 사용해 교차엔트로피 외에 카테고리 안정화 손실과 pair margin 손실을 결합한 복합 손실 ℒ_BP를 최적화한다. pair 손실은 차단 쪽의 unsafe 점수 s(true|q⁺)가 허용 쪽 s(true|q⁻)보다 적어도 m만큼 크도록 강제한다.
수학적 관점에서 pair loss는 쌍간 점수 차이를 명시적으로 최적화하는 형태이며, 이는 단일 프롬프트별 정답률을 높이는 것만으로는 확보하기 어려운 정책-민감한 순위 정보를 모델에 주입한다. 예를 들어 같은 이미지에서 q⁺는 차단, q⁻는 허용인 경우 ℒ_CE는 각각을 올바르게 맞추도록 하고 ℒ_pair는 모델이 q⁺에 대해 더 큰 unsafe 점수를 출력하도록 점수 경계(m)를 유지하게 한다. 이 구조가 없다면 모델은 단순히 이미지에 기반한 위험 신호만으로 일관되게 차단하거나 통과하는 편향을 갖게 된다.
구현 및 학습 세부사항에서는 RP-SFT에 3,000개의 no-think 예시와 think/diagnostic 예시, BP-Adapt에 3,816개의 경계쌍을 사용해 총 9,816개의 학습 인스턴스를 구성했다. 데이터의 품질 보증을 위해 어노테이터 3인 합의, 결정적 검증 도구, 그리고 사람 감사를 조합해 메타데이터의 일관성을 확보했다.
한계점
논문은 RP-SFT만으로는 보유하지 않은 정책 정의에 대한 안정적 적응을 보장하지 못한다는 점을 명시했다. 특히 무작위화된 정책 표현이 표면적 지름길을 제거하는 데 기여했으나, 경계쌍 기반의 추가적 손실이 없으면 Shift Split에 대한 PSS 개선이 충분치 않았다고 보고됐다. 또한 논문은 일부 위험 카테고리(예: 규제 물품, IP·브랜드, 텍스트-in-이미지, PII)가 시각적 속성 추출과 세밀한 예외 처리를 요구하기 때문에 여전히 난이도가 높다는 것을 실험적으로 확인했다.
실무 활용
PolicyShiftGuard의 설계는 배포 환경에서 정책 번들을 런타임으로 받아 빠르게 결정해야 하는 가드레일 시나리오에 적합하다. 모델과 데이터 파이프라인은 감사 가능한 라벨 생성과 경계쌍 기반 사후학습을 포함하므로 기업의 규정 해석과 적용을 검증하는 데 유리하다. GitHub 저장소가 공개되어 있어 코드와 데이터 파이프라인을 실제 시스템에 통합해 시범 운영할 수 있다.
- 콘텐츠 업로드 파이프라인에서 각 지역·연령별 정책 번들을 런타임으로 적용해 이미지 허용/차단을 결정하는 자동 필터링 시스템
- 생성형 이미지 서비스에서 사용자별·광고주별 정책을 반영해 배포 전 안전성 검사에 빠르게 적용하는 실시간 가드레일
- 규제 감사와 내부 검토를 위해 어떤 속성(attribute) 때문에 라벨이 바뀌었는지 추적 가능한 로그를 제공하는 정책 감사 도구
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Policy Shift Score (PSS)
- — 같은 이미지와 위험 카테고리 내에서 서로 다른 정책이 부과될 때 모델이 두 케이스 모두를 정확히 판정했는지를 측정하는 쌍별 지표이다. 동일 이미지에 대해 허용/차단으로 라벨이 뒤바뀌는 쌍을 집단으로 묶어, 그 집단 내부에서 모델이 양쪽 모두를 맞힌 비율을 평균해 계산한다. 이 지표는 단순한 시각적 위험 인식 능력과 정책 텍스트에 기반한 결정 능력을 구분하는 데 중요하다.
- Boundary-Pair Policy Adaptation (BP-Adapt)
- — 같은 이미지와 동일 위험 카테고리에 대해 한 정책은 허용하고 다른 정책은 차단하는 매치된 쌍을 학습 단위로 사용하는 사후학습 기법이다. 각 쌍에 대해 차단 정책이 허용 정책보다 높은 'unsafe' 점수를 내도록 pair margin 손실을 적용해 정책 민감성을 직접적으로 최적화한다. 이 방식은 정책 변경 시 결정이 뒤바뀌어야 하는 사례에서 안정적인 적응을 확보하는 데 핵심적이다.
- Randomized Policy SFT (RP-SFT)
- — 정책 번들의 표현 순서, 슬롯 배치, 표면 식별자 등을 무작위화하여 정책 텍스트의 고정 위치나 템플릿을 우회하도록 만든 지도학습 단계이다. 이 단계는 모델이 정책 번들을 읽고 제공된 규칙에 따라 구조화된 출력(true | c 또는 false)을 생성하도록 학습시키며, 고정된 표면 단서에 의존하는 지름길을 줄인다. 다만 이 단계만으로는 보류/허용이 뒤바뀌는 경계 사례에 대한 강한 일반화가 확보되지 않았다.
- Policy Bundle
- — 일곱 개 위험 카테고리 각각에서 하나의 정책 변형을 선택해 합성한 런타임 규칙 집합으로, 모델은 이 번들 전체를 읽어 각 이미지의 최종 허용/차단 결정을 산출해야 한다. 번들 내부의 한 카테고리가 차단을 반환하면 전체 라벨은 unsafe가 되며, 모든 카테고리가 통과해야만 safe가 된다. 번들 단위 평가는 실제 배포 환경에서 서로 다른 제품·연령·지역 기준을 동시에 적용하는 상황을 모사한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.