TL;DR
Verbatim-RAG Extractor는 RAG 시스템에서 LLM 기반 증거 강조 호출을 대체하기 위해 설계된 쿼리 조건부 토큰 분류 모델이다. ModernBERT 아키텍처를 기반으로 8192 토큰의 긴 컨텍스트를 처리하며, 150M 파라미터로 경량화되어 로컬에서 결정론적으로 실행된다. 금융, 법률, 의료, 코드 등 다양한 도메인 데이터로 학습되어 기존 범용 추출기보다 높은 성능을 보인다. 이 모델은 검색 및 재순위화 단계 이후에 배치되어 사용자에게 증거를 제시하거나 생성 모델에 컨텍스트를 제공하는 역할을 수행한다.
배경
Python, Transformers 라이브러리, RAG 파이프라인에 대한 이해
대상 독자
RAG 시스템을 구축하는 AI 엔지니어 및 개발자
의미 / 영향
이 모델은 RAG 시스템에서 LLM 호출 의존도를 낮추어 비용과 지연 시간을 획기적으로 줄인다. 특히 코드나 금융 데이터와 같은 복잡한 도메인에서 범용적인 증거 추출 성능을 제공하여 프로덕션 환경의 효율성을 높인다.
섹션별 상세
- 150M 파라미터 모델이 기존 범용 추출기 대비 우수한 Word-F1 성능을 기록했다. — Performance 섹션의 벤치마크 표
용어 해설
- RAG
- — 외부 데이터를 검색하여 LLM의 답변 정확도를 높이는 기술이다. 이 아티클에서는 검색된 문서에서 질문에 대한 답이 되는 증거 구간을 추출하는 과정에 집중한다.
- ModernBERT
- — 긴 컨텍스트 처리에 최적화된 BERT 변형 아키텍처이다. 8192 토큰의 긴 시퀀스를 지원하여 복잡한 문서 분석에 유리하다.
- Token Classification
- — 텍스트의 각 토큰에 특정 레이블을 할당하는 작업이다. 여기서는 각 토큰이 증거 구간에 포함되는지 여부를 이진 분류하는 데 사용된다.
- Reranking
- — 검색된 문서들의 순위를 다시 조정하여 관련성 높은 문서를 상단에 배치하는 과정이다. 증거 추출 전 단계로 활용된다.
코드 예제
from transformers import AutoModel
model = AutoModel.from_pretrained(
"KRLabsOrg/verbatim-rag-modern-bert-v2",
trust_remote_code=True,
)
result = model.process(
question="What is ModernBERT?",
context="...",
threshold=0.2,
)모델을 로드하고 쿼리와 컨텍스트를 입력하여 증거 구간을 추출하는 예시 코드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.