용어 해설
- 정책 전환 점수(Policy Shift Score (PSS))
- — 같은 이미지와 위험 카테고리 내에서 서로 다른 정책이 부과될 때 모델이 두 케이스 모두를 정확히 판정했는지를 측정하는 쌍별 지표이다. 동일 이미지에 대해 허용/차단으로 라벨이 뒤바뀌는 쌍을 집단으로 묶어, 그 집단 내부에서 모델이 양쪽 모두를 맞힌 비율을 평균해 계산한다. 이 지표는 단순한 시각적 위험 인식 능력과 정책 텍스트에 기반한 결정 능력을 구분하는 데 중요하다.
- 경계쌍 정책 적응(Boundary-Pair Policy Adaptation (BP-Adapt))
- — 같은 이미지와 동일 위험 카테고리에 대해 한 정책은 허용하고 다른 정책은 차단하는 매치된 쌍을 학습 단위로 사용하는 사후학습 기법이다. 각 쌍에 대해 차단 정책이 허용 정책보다 높은 'unsafe' 점수를 내도록 pair margin 손실을 적용해 정책 민감성을 직접적으로 최적화한다. 이 방식은 정책 변경 시 결정이 뒤바뀌어야 하는 사례에서 안정적인 적응을 확보하는 데 핵심적이다.
- 무작위화된 정책 SFT(Randomized Policy SFT (RP-SFT))
- — 정책 번들의 표현 순서, 슬롯 배치, 표면 식별자 등을 무작위화하여 정책 텍스트의 고정 위치나 템플릿을 우회하도록 만든 지도학습 단계이다. 이 단계는 모델이 정책 번들을 읽고 제공된 규칙에 따라 구조화된 출력(true | c 또는 false)을 생성하도록 학습시키며, 고정된 표면 단서에 의존하는 지름길을 줄인다. 다만 이 단계만으로는 보류/허용이 뒤바뀌는 경계 사례에 대한 강한 일반화가 확보되지 않았다.
- 정책 번들(Policy Bundle)
- — 일곱 개 위험 카테고리 각각에서 하나의 정책 변형을 선택해 합성한 런타임 규칙 집합으로, 모델은 이 번들 전체를 읽어 각 이미지의 최종 허용/차단 결정을 산출해야 한다. 번들 내부의 한 카테고리가 차단을 반환하면 전체 라벨은 unsafe가 되며, 모든 카테고리가 통과해야만 safe가 된다. 번들 단위 평가는 실제 배포 환경에서 서로 다른 제품·연령·지역 기준을 동시에 적용하는 상황을 모사한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


