본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nationaldesignstudio/rampart

이 모델은 사용자 입력에서 개인식별정보(PII)를 토큰 단위로 식별해 자리표시자로 대체하는 token-classification 태스크를 수행한다. 모델은 대화형·비정형 텍스트와 OCR 노이즈가 섞인 문서 양상에서 조각난 PII 스팬을 포착하도록 학습되어 있으며, 자리표시자는 클라이언트에서 재하이드레이션될 수 있게 설계되어 있다. 구조적으로 검증 가능한 식별자(SSN, CREDIT_CARD 등)는 결정론적 계층이 처리하고 모델은 나머지 식별자와 이름·주소 구성요소를 감지한다.≈18.5M512K 컨텍스트cc-by-4.0

14.7MB로 배포되는 ONNX MiniLM 기반의 클라이언트 측 PII 토큰 분류기로서 결정론적 인식기와 결합해 시스템 수준 개인식별 리콜 98.42%를 달성한다.

학습 방식 · 기반 모델로 nreimers/MiniLM-L6-H384-uncased를 사용해 35-label BIO 헤드로 파인튜닝했으며 합성 대화·OCR 문서·ai4privacy OpenPII 코퍼스의 3원 혼합을 학습 데이터로 사용했다. 최종 훈련은 AdamW 옵티마이저, 학습률 5e-5, 배치 32, 에폭 3으로 수행되었고 Apple M-series MPS에서 약 3.5시간이 소요되어 홀드아웃 성능 기준으로 최종 에폭을 선택했다. 훈련 전후의 정규화(소문자화, NFKD 분해, 결합문자 제거)와 결정론적 클래스 마스킹이 재현성 확보를 위해 엄격히 적용되었다.

TL;DR

Rampart는 MiniLM-L6 기반으로 4비트 MatMul과 INT8 임베딩을 적용해 14.7MB로 배포되는 온디바이스 PII 토큰 분류기이며 결정론적 인식기와 결합한 방어 심도 설계로 시스템 수준 개인식별 리콜 98.42%를 달성했다. 훈련은 합성 대화, OCR 문서, ai4privacy OpenPII의 누적 혼합을 사용해 파편화된 채팅과 OCR 노이즈에 강하도록 구성되었고, 런타임은 transformers.js + ONNX Runtime을 통해 WebGPU(p50 3.9ms)와 WASM 환경에서 동작하도록 최적화되었다. 설계상 SSN·신용카드·이메일·URL·IP는 결정론적 계층이 처리하고 모델은 이름·전화·은행·정부식 식별자 등 비구조화 항목을 담당하며, 비라틴 스크립트와 결합된 악의적 공격에는 취약점이 있어 해당 사용자는 보완 조치를 적용해야 한다.

핵심 포인트

  • 결정론적 인식기와 학습 기반 토큰 분류기를 명확하게 분리해 방어 심도를 실현한 시스템 설계가 이 모델의 차별점이다. 결정론적 계층은 구조적 식별자를 정규식·체크섬으로 거의 완벽히 잡아내며 모델은 구조적 검증이 불가능한 식별자와 이름·주소 조각에 집중한다. 이 분업은 훈련·추론 시 입력 분포의 일관성과 평가 재현성을 높여 제품적용 관점에서 신뢰성을 확보한다.
  • 훈련 데이터 믹스가 합성 대화·OCR 노이즈·대규모 공개 코퍼스를 누적 방식으로 사용하도록 설계되어 실제 채팅과 문서 유래 사례 모두에서 강건성을 추구했다. 합성 데이터는 파편화·오타·붙여넣기 같은 현실적 패턴을 재현하고 OCR 코퍼스는 인식 오류를 추가해 문서 기반 추출 회복력을 높였다. 공개 OpenPII는 다국어 폭과 재현 가능한 홀드아웃을 제공해 평가의 신뢰도를 보장했다.
  • 극단적으로 경량화된 ONNX 아티팩트(14.7MB)와 브라우저 실행용 엔드투엔드 평가 허브를 함께 공개해 클라이언트 사이드 배포와 수치 재현을 동시에 만족시킨 점이 독특하다. 모델 가중치, 결정론적 계층, 평가 허브의 커밋된 출력·UID 매니페스트가 함께 공개되어 모든 보고 수치가 재현 가능하도록 설계되었다. 이 투명성은 제품 통합 과정에서 신뢰성 검증을 용이하게 한다.
  • 시스템 수준의 개인식별 리콜이 7개 라틴문자 언어 합산 기준 98.42%로 보고되어 높은 개인정보 포착 능력을 보였다. 이 수치는 공개된 OpenPII 홀드아웃(30,000행, 131,707 private terms)을 대상으로 한 일관된 벤치마크를 통해 산출되었다. 리콜 수치가 시스템 단위(모델+결정론적 계층)를 기준으로 보고된 점이 제품 적용 관점에서 중요하다.

벤치마크

벤치마크지표비교
Private recall (seven languages)private-term-recall98.42% [98.35, 98.49]
Public retention (system policy-aware)public-term-retention91.69%
Span F1 strict (IoU=1.0)span-f10.528
Latency p50 (Node ONNX CPU)latency-p506.6 msWebGPU p50 3.9 ms, WASM p50 12.6 ms

147

LIKES

4.8k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.