왜 중요한가
현지 조례는 연방·주 법과 다층적으로 얽혀 있어 접근성과 연구 가용성이 제한된다. LOCUS-v1은 미국 내 9,239개 도시/카운티의 로컬 코드 원시 코퍼스와 카운티-하모나이즈드 접근layer를 제공하여 지역 법률 연구의 재현성과 대규모 분석 가능성을 크게 높인다.
핵심 기여
대규모 LOCUS 코퍼스 and 광범위 커버리지
9,239개 도시/카운티의 로컬 코드 원시 코퍼스와 약 80GB 규모의 데이터, 7M 페이지를 OCR 처리하여 2,211,516개의 텍스트 청크를 생성한다.
county-harmonized access layer 구축
각 카운티에서 카운티 코드와 해당 카운티 최대 도시의 코드를 비교해 가장 긴 코드를 선택하는 간단한 알고리즘으로 전국적 검색의 기초를 마련하고, 인구의 다수에 대한 커버리지를 확보한다(대략 인구의 94% 커버).
OCR/ML 파이프라인의 엔드-투-엔드 구현
LightOnOCR-2-1B와 Modal 배치 inference, ModernBERT-base 기반 인코더를 활용한 자동화된 전처리·분리·클래스화 파이프라인으로 다양한 형식의 법령 문서를 처리한다.
ModernBERT 기반 다차원 분류기 및 점수화
substantivity, function, topic 분류기를 위한 ModernBERT-base(약 100M 파라미터) 기반 분류기와 점수 생성기를 학습하며, 100K 샘플에서 GPT-5.4-nano로 주석을 생성했다.
4차원 차원 분석 및 TrueSkill 기반 점수화
Opacity, Enforcement Discretion, Paternalism, Salience의 4개 차원을 다룬 다차원 점수화를 위해 쌍대 비교(LMM-as-a-judge) 방식과 TrueSkill으로 순위를 산출한다. 200,000 쌍의 비교에서 각 차원의 상관계수는 0.82–0.94로 확인되었다.
데이터 공개 및 재현성 강화
LOCUS-v1과 파생 모델은 HuggingFace 데이터셋(LocalLaws/LOCUS-v1) 형태로 공개되며, 연구자들이 대규모 로컬 법령 분석과 벤치마크 구축에 활용할 수 있다.
핵심 아이디어 이해하기
출발점: 로컬 법령은 주/카운티별로 파편화되어 있어 연구용 대규모 코퍼스의 부재가 연구를 가로막는다. LOCUS는 국가 규모에서 로컬 법령을 검색/비교/추론할 수 있는 인프라를 목표로 한다. 기초 아이디어는 세 가지 축으로 구성된다. (1) 원시 로컬 코드의 대규모 수집 및 OCR 처리로 텍스트를 기계판독 가능 형태로 변환한다. (2) 카운티-하모나이즈드 접근layer를 통해 지역 단위의 일관된 표현을 제공하고, 이를 인구·지리 데이터와 연결한다. (3) 차원의 분석(Opacity, Paternalism, Enforcement Discretion, Salience)과 TrueSkill 기반 점수화로 법령의 특성을 수치화하고 벤치마크를 구성한다. 이로써 다층적 법적 속성을 대규모로 분석하고, 다양한 연구 및 응용에서 재현 가능한 데이터 소스를 제공한다.
방법론
단락 1: 전체 접근 방식과 핵심 아이디어 — 원시 법령 데이터를 9k PDFs에서 OCR로 변환하고, 2단계 라벨링(substantivity, function, topic) 및 4차원 점수화를 위한 ModernBERT 기반 분류기/점수기를 학습한다. 단락 2: 파이프라인의 핵심 구성 — LightOnOCR-2-1B를 사용해 페이지를 Markdown으로 변환하고, 후처리에서 중복 헤더/페이지를 제거한 뒤 법령을 개별 조항으로 분리한다. 단락 3: 라벨링 및 학습 세부 — 100K 샘플에서 GPT-5.4-nano로 주석을 생성하고, ModernBERT-base(약 100M 파라미터)로 substantivity, function, topic 분류기를 학습한다. 단락 4: 하모나이즈드 액세스 계층 — 각 카운티에 대해 카운티 코드와 도시 코드 중 더 긴 코드를 선택하는 간단한 규칙으로 전국적 서브스트레이트를 구성하고, 약 94% 인구를 커버한다. 단락 5: 차원 점수화 — 네 가지 차원을 pairwise 판단으로 수집하고 TrueSkill로 점수를 환산하여 각 조례의 잠재 점수를 산출한다. 단락 6: 평가 및 재현성 — 2,211,516 청크의 코퍼스 구성과 80GB 규모의 raw corpus, 7M 페이지, 9,239 PDFs를 공개하고, 4차원 점수의 상관계수(0.82–0.94)와 10k ordinance 샘플에서 64,977/108,889 동의 비율 등을 보고한다.
관련 Figure

카운티 단위의 코드 선택 규칙의 시각화를 통해 전국적 검색 레이어의 기초 아이디어를 보강한다. anchor_key: methodology
미국 내 카운티별 가장 긴 코드를 선택하는 LOCUS의 county-harmonized 접근층을 시각화한 지도다.

분류 및 점수화 파이프라인의 규모를 직관적으로 전달하며, key_contributions의 classifier 구축 부분과 연결된다. anchor_key: methodology
Function/Topic 분류의 예측 점수를 도식화한 도넛 차트로 모델의 규모와 라벨 분포를 보여준다.
기술 상세
단락 1: 아키텍처 구성 — OCR 전처리, 법령 분절, substantivity/function/topic 분류, 차원 점수화 모듈로 구성된 파이프라인. 단락 2: 수학적/알고리즘적 기반 — TrueSkill 기반 순위 산출, pairwise 비교를 통한 점수화, z-score 정규화 및 회귀 학습으로 각 차원의 점수를 예측. 단락 3: Prior work 대비 차별점 — 로컬 법령의 대규모 공개 코퍼스 부재를 해결하기 위한 엔드-투-엔드 OCR 파이프라인 및 4차원 분석 프레임워크를 제시한다. 단락 4: 구현/학습 세부 — 7M 페이지의 OCR; ModernBERT-base으로 각 조문의 함수/주제 분류; GPT-5.4-nano를 활용한 주석 생성; 10k 샘플의 평가 세트 구성 및 8k/1k/1k 분할.
실무 활용
LOCUS-v1은 로컬 법령 검색, 비교, 벤치마크 구축의 인프라를 제공한다. 원시 텍스트를 대규모로 다룰 수 있는 구조로, 법령의 해석 연구 및 정책 분석에 활용될 수 있다.
- 로컬 법령의 정책 비교 분석
- 다층 법령 간의 권한 계층화 식별 연구
- 지리적·인구적 맥락과 법령 텍스트의 연결 분석
- 벤치마크 구축을 위한 법령 추론 평가
코드 공개 여부: 미확인
키워드
용어 해설
- OCR
- — OCR은 인쇄물이나 스캔 문서를 기계가 읽을 수 있는 텍스트로 변환하는 기술로 LOCUS 파이프라인에서 다양한 포맷의 법령문서를 Markdown로 변환하는 핵심 구성요소이다.
- LightOnOCR-2-1B
- — LightOnOCR-2-1B는 Vision-Language 모델 기반의 OCR로, LOCUS의 문서 이미지를 Markdown로 변환하는 모듈이다.
- ModernBERT-base
- — ModernBERT-base는 약 100M 파라미터의 encoder로 LOCUS의 법령 조항을 분류/점수화하는 분류기에 사용된다.
- TrueSkill
- — TrueSkill은 순위 추정 알고리즘으로, 조례의 4개 차원 점수를 추정할 때 쌍대 비교를 기반으로 순위를 매긴다.
- LOCUS 접근 계층(LOCUS Access Layer)
- — LOCUS의 county-harmonized access layer로, 각 카운티에 대해 county code와 도시 코드 중 가장 긴 것을 선택해 전국적으로 검색 가능한 기본 지리 구성단위를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.