TL;DR
Silica는 LLM의 Markdown 쓰기를 parser와 state machine으로 검증하고 실패한 변경을 revert하는 local-model 기반 harness이다. 두 conversation에서 session note를 요약하지 않고 원문 문장을 보존한 방식이 summarized 방식보다 높은 점수를 기록했으며, conv-26은 0.592 대 0.428, conv-47은 0.840 대 0.693이었다. 검색에서는 co-occurrence graph를 BM25로 가중해 recall@10을 0.51에서 0.86으로 높였고, 별도 note-to-note leg는 제거하는 편이 recall@10과 비용 모두 나았다. 작은 평가 규모와 local-grade judge라는 한계 때문에 특정 비손실 방식의 절대적 우승보다 원문 보존, leg별 검증, 평가 harness의 정확성이 핵심 결론이다.
실용적 조언
- LLM이 Markdown vault를 수정하게 할 때는 모델 출력을 곧바로 저장하지 말고 parser와 state machine으로 허용된 변경인지 검사한 뒤 commit해야 한다. 저장 후에는 실제 파일을 다시 읽어 검증하고 실패한 변경을 transaction 단위로 revert하는 흐름이 필요하다. 여러 source를 처리한다면 source별 transaction과 resumable 실행을 유지해야 장애 범위를 좁힐 수 있다.
- 검색 성능을 튜닝할 때는 RRF constant나 leg별 weight를 먼저 grid search하지 말고 각 leg의 점수 계산과 recall을 따로 측정해야 한다. 이 글의 실험에서는 co-occurrence graph를 BM25로 가중한 뒤 recall@10이 0.51에서 0.86으로 개선됐고, 그 다음에는 fusion parameter가 결과에 거의 영향을 주지 않았다.
- 자동 평가 수치가 비정상적으로 낮으면 모델의 hallucination을 바로 의심하기보다 source attribution과 평가 범위를 확인해야 한다. FActScore 0.669는 entity note를 단일 session과 비교한 harness 오류에서 나왔으며, 전체 conversation을 기준으로 고친 뒤 세 vault의 점수는 0.999, 0.991, 0.961로 바뀌었다. baseline의 retrieval leg 구성이 달라졌다면 서로 다른 configuration의 수치를 한 표에 섞지 않아야 한다.
섹션별 상세
용어 해설
- 상태 머신(State Machine)
- — 상태 머신은 시스템의 현재 상태와 허용된 전이 규칙을 명시해 입력에 따른 동작을 제한하는 구조이다. Silica에서는 LLM이 제안한 Markdown 변경을 파서와 함께 검사하고, 조건을 통과하지 못한 쓰기를 되돌리는 게이트로 사용된다.
- BM25
- — BM25는 문서와 질의의 단어 빈도, 문서 길이, 희귀도를 이용해 검색 점수를 계산하는 lexical retrieval 방식이다. 이 글에서는 co-occurrence graph의 연결 가중치를 raw count 대신 BM25로 계산해 recall@10을 높이는 데 사용됐다.
- RRF
- — RRF는 여러 검색 결과 목록의 순위를 결합해 하나의 결과 목록을 만드는 fusion 방식이다. 글에서는 lexical leg를 제대로 가중한 뒤 per-leg fusion weight와 RRF constant를 조정해도 결과가 더 이상 움직이지 않았다고 보고한다.
- MinHash
- — MinHash는 문서나 문자열의 유사한 부분을 짧은 서명으로 근사해 중복 여부를 빠르게 판별하는 기법이다. Silica의 핵심 구성 중 하나로, embedder 없이도 vault 안의 중복 노트를 처리하는 데 쓰인다.
- FActScore
- — FActScore는 생성된 문장을 원자적 사실 단위로 나눈 뒤 각 사실이 출처 문서에 의해 뒷받침되는지 판정하는 평가 방식이다. 이 글에서는 전체 대화가 아니라 특정 세션만 기준으로 삼은 harness 오류 때문에 0.669가 나왔고, 평가 대상을 고친 뒤 세 vault에서 0.999, 0.991, 0.961을 얻었다.
언급된 도구
LLM의 Markdown vault 쓰기를 parser와 state machine으로 검증하고, 검색·회상·노트 읽기와 여러 인터페이스를 제공하는 harness이다.
기존에 열어 둔 vault를 Silica plugin으로 구동하는 노트 인터페이스이다.
coding assistant가 사용자의 실제 notes를 읽고 답변 전에 recall하도록 연결하는 server 인터페이스이다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.