mistralai/Shieldstral-1.0-3B
모델 개요 및 기술적 요약3B32K 컨텍스트Apache-2.0
Ministral 기반 3B 정책 적응형 멀티모달 안전 분류기
학습 방식 · mistralai/Ministral-3-3B-Base-2512를 기반으로 한 파인튜닝이며 네이티브 Pixtral vision encoder를 통합해 멀티모달 입력을 단일 체크포인트로 처리하도록 설계되었다.
TL;DR
Ministral-3-3B-Base-2512를 기반으로 파인튜닝된 3B 멀티모달 안전성 분류기이며 자연어 정책을 inference 시점에 주면 단일 forward pass로 yes/no 토큰을 출력하고 그 위치의 yes/no 로그확률을 재정규화해 연속 안전 점수를 반환합니다. Pixtral vision encoder가 통합되어 텍스트·이미지·텍스트+이미지 모두를 한 체크포인트로 처리하며 BF16 기준 단일 GPU로 구동 가능합니다. 여러 안전성 벤치마크에서 상위권 성능을 보이므로 경량 실시간 모더레이션이나 모델 응답 검열 등 에지 환경에 적합합니다.
핵심 포인트
- Ministral-3-3B-Base-2512 기반으로 파인튜닝된 3B 파라미터의 멀티모달 안전성 분류기이며, 정책을 자연어로 입력해 실시간으로 재타깃이 가능한 policy-adaptive 설계를 채택하고 있다.
- 단일 forward pass로 yes/no 단어를 생성하고 해당 위치의 yes/no 로그확률을 재정규화해 연속적 안전 점수를 산출하므로 텍스트, 이미지, 텍스트+이미지 모두에서 경량·저지연 운영이 가능하다.
- 학습 시 최대 시퀀스 길이 32k 토큰을 사용했고 BF16 기준 단일 GPU(16GB)에 배치 가능하며 vLLM, llama.cpp, Transformers 등 다양한 런타임과 GGUF 변환·양자화 옵션을 공식 지원한다.
제한사항
- 언어와 도메인 분포의 불균형으로 신뢰도가 편차를 보일 수 있다.
- 학습 데이터에 잔존하는 라벨 노이즈와 합성 데이터의 편향이 결과에 영향을 줄 가능성이 있다.
- 암호화·전사 변형 등 회피성 입력과 매우 긴 문서는 판단 신뢰도를 저하시킬 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Prompt classification WildGuardTest | F1 (%) | 88.1 vs Qwen3Guard 88.2 (best) | — |
| Prompt classification ToxicChat | F1 (%) | 84.1 (best) | — |
| Prompt classification HarmBench | F1 (%) | 99.4 (best) | — |
| Multimodal VLGuard | F1 (%) | 97.7 (best) | — |
| Multilingual PolyGuard Prompt | F1 (%) | 84.6 (best) | — |
128
Likes
166
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.