본문으로 건너뛰기

SingGuard: 동적 추론과 정책 적응을 갖춘 멀티모달 LLM 가드레일

Vision-language 모델의 광범위한 배포는 이미지와 텍스트가 결합된 상호작용에서 새로운 안전 리스크를 만든다. 단일 고정 분류 체계는 런타임에 정책이 변경되거나 도메인별 규칙이 추가될 때 적절히 대응하지 못하는 경향이 있다. SingGuard는 활성화된 자연어 규칙을 런타임 입력으로 받아 규칙별로 검사하고 판단을 출력하여 정책 변경 시에도 재학습 없이 규칙을 집행할 수 있다는 점에서 운영 환경의 안전 관리를 직접적으로 개선한다.

용어 해설

정책 적응형(Policy-adaptive)
활성화된 런타임 정책을 입력으로 받아 그 규칙 집합에 따라 판단을 수행하는 방식으로, 모델은 고정된 라벨 집합 대신 주어진 규칙을 하나씩 대조하며 최종 안전성 결정을 내린다. 이 접근은 배포 시 정책 변경이나 도메인별 규칙 추가에 대해 재학습 없이 규칙을 적용할 수 있게 한다.
패스트–슬로우 분리 강화학습(Fast–Slow Decoupled RL)
초기 빠른 판단 토큰의 최적화 기여를 마스킹하여 초기 판단이 이후 추론(Chain-of-Thought)에 과도하게 고정되지 않도록 하는 강화학습 기법이다. 이 방식은 샘플 그룹 내 보상 정규화를 통해 최종 <answer>를 주로 최적화하면서 초기 토큰은 저지연 접두사로만 유지한다.
Chain-of-Thought (CoT)(Chain-of-Thought)
정책의 각 규칙을 하나씩 점검하는 순차적 추론 트레이스로, 각 규칙에 대해 hit/not-hit/not-applicable 여부와 근거를 생성하여 최종 판단을 집계한다. CoT는 감사 가능성과 근거 제공을 위해 사용되며 일부 샘플에서 상세 추론을 지도 신호로 제공한다.
동적 규칙 평가(Dynamic-Rule Evaluation)
동일한 입력 예시를 서로 다른 활성 정책(view) 아래에서 재라벨링하여 모델이 규칙 텍스트 자체에 근거해 판단하도록 강제하는 데이터 구성 방식이다. 이 방식은 모델이 학습 시의 고정된 분류 토대에 의존하는 것을 줄이고 런타임 정책 변경에 따른 올바른 전환을 테스트한다.
On-Policy Generalized Knowledge Distillation(On-Policy GKD)
학생 모델이 자신의 응답을 샘플링하면 동일 입력 위에서 고정된 교사 모델이 학생이 생성한 접두사에 대한 토큰 분포를 제공하여 학생을 교사 분포에 맞추는 증류 방식이다. 이 방식은 학생의 실제 추론 분포에서 발생하는 오류를 교사가 바로 보정하도록 학습시켜 동적 규칙 케이스에서 일반화 성능을 향상시킨다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 22.수집 2026. 06. 30.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.