StarTrail-org/PixelRAG
Python12 / 0
문서를 텍스트로 파싱하지 않고 스크린샷 타일로 렌더링해 표·차트·레이아웃을 보존한 채 검색하는 시각 RAG 파이프라인, Claude Code용 pixelbrowse 스킬도 함께 제공.
TL;DR
PixelRAG는 웹페이지·PDF·이미지를 스크린샷 타일로 렌더링한 뒤 Qwen3-VL-Embedding을 스크린샷 데이터로 LoRA 파인튜닝한 모델로 이미지를 직접 임베딩해, 텍스트 파싱이 버리는 표나 차트 같은 시각 구조를 그대로 유지한 채 검색한다. 8.28M 위키백과 페이지를 담은 호스팅 인덱스를 API 키 없이 바로 질의할 수 있고, 로컬 문서로는 render→chunk→embed→build-index 파이프라인을 직접 돌려 FAISS나 Qdrant 백엔드로 서빙할 수 있다. Claude Code 플러그인인 pixelbrowse 스킬은 원시 HTML을 가져오는 대신 pixelshot으로 페이지를 스크린샷 찍어 Claude가 이미지를 직접 읽게 해, 사람처럼 다이어그램과 표를 보고 답하게 한다. 표·인포그래픽처럼 텍스트 파싱으로 정보가 깨지는 문서를 검색하거나, 에이전트가 웹페이지를 시각적으로 이해해야 하는 워크플로에 쓸 만하다.
핵심 포인트
- 텍스트 청크 대신 스크린샷 타일을 임베딩해 표나 차트처럼 HTML 파싱이 깨뜨리는 시각 구조를 그대로 검색 대상으로 유지한다.
- 8.28M 위키백과 페이지 인덱스를 API 키·설치 없이 바로 질의할 수 있는 호스팅 엔드포인트로 제공한다.
- pixelbrowse Claude Code 스킬은 원시 HTML을 안 읽고 스크린샷을 직접 '보게' 해 다이어그램·표가 있는 페이지 요약 품질을 끌어올린다.
- FAISS(기본)와 Qdrant(양자화, 디스크 기반, 페이로드 필터링) 두 벡터 백엔드를 선택할 수 있어 로컬 소규모 인덱스부터 대규모 운영까지 커버한다.
9.6k
STARS
826
FORKS
+210
TRENDING
12
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.