본문으로 건너뛰기

privibe, 로컬 llama.cpp 코딩 에이전트

privibe가 로컬 llama.cpp와 KV cache로 비공개 코딩 세션을 이어갑니다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

privibe는 Mistral Vibe에서 클라우드·계정·telemetry 기능을 제거하고 로컬 llama.cpp 서버를 기본으로 삼은 privacy-focused coding agent fork입니다. ConversationList로 대화 prefix와 system prompt를 보존해 KV cache를 유지하고, 호환되는 llama-server 빌드에서는 축출된 cache를 디스크에 저장해 세션 재개 때 전체 대화를 다시 처리하지 않습니다. Hashed-line file tools, undo stack, 대용량 파일 preview, 세션 검색, context file 재사용 같은 기능은 작은 로컬 모델로 장시간 코드 작업을 이어가는 데 초점을 맞춥니다. Anthropic과 Mistral adapter는 코드에 남아 있지만 적극적으로 테스트하지 않았으므로 로컬 llama.cpp 외 backend의 신뢰성은 확인되지 않았습니다.

섹션별 상세

01
privibe는 Mistral Vibe를 기반으로 클라우드와 계정 기능을 걷어내고 로컬 우선 코딩 에이전트로 재구성한 공개 저장소입니다. Python 3.12 이상과 uv를 사용해 설치하며, 사용자는 ~/.privibe/config.toml에서 자신의 llama.cpp 서버와 모델 항목을 지정합니다. Mistral SDK는 선택 extra로 남아 있지만, 기본 흐름은 API 키 없이 OpenAI 호환 API를 통해 로컬 모델을 호출하는 구조입니다.
bash
git clone https://github.com/alainnothere/privibe.git
cd privibe
uv sync

privibe 저장소를 복제한 뒤 uv로 Python 의존성을 설치합니다.

bash
alias privibe='uv run --project /yourPathToPrivibeHere/privibe privibe'
uv run privibe-acp

터미널 어디서나 privibe를 실행할 별칭을 만들고 editor integration용 ACP 진입점을 실행합니다.

터미널에서 privibe를 실행하고 로컬 모델과 작업을 시작하는 초기 화면입니다.
Screenshot화면에는 privibe v0.1.0과 Qwen3.8-27B-UD-Q6_K 모델, 로컬 실행 상태, 로드된 instruction file, 토큰 처리 상태가 함께 나타납니다. 설치 뒤 별도 클라우드 계정 없이 터미널 대화형 coding agent를 시작하는 흐름이 본문에서 말한 Local-first 구조와 연결됩니다.
02
이 프로젝트의 핵심 구현은 llama.cpp의 KV cache가 대화가 이어지는 동안 유지되도록 문맥의 prefix를 불변 구조로 보존하는 방식입니다. --resume과 --continue에서는 새 system prompt를 다시 만들지 않고 원래 prompt를 복원하며, 동반 llama-server 빌드는 축출된 대화의 캐시를 디스크에 저장해 이전 세션을 다시 시작할 때 전체 대화를 재처리하지 않습니다. 모델 교체 시 context size를 다시 감지하고 /effort로 새 메시지의 reasoning effort를 조절할 수 있지만, 이러한 cache stamp 기능은 기본 서버가 아닌 동반 서버 빌드를 요구합니다.
bash
uv sync --extra mistral

필요할 때만 Mistral SDK 선택 extra를 설치합니다.

디스크에 저장된 KV cache를 복원해 이전 대화를 재개하는 터미널 화면입니다.
Screenshot화면에는 모델 서버의 처리 로그와 저장된 cache 관련 파일 목록이 함께 나타나 디스크 기반 상태 복원 과정을 확인할 수 있습니다. 본문은 이 동반 llama-server 빌드가 축출된 대화의 KV cache를 저장하고 재개 시 다시 불러와 전체 prompt 재처리를 피한다고 설명합니다.
03
긴 세션과 작은 로컬 모델을 고려해 터미널 처리 경로도 조정했습니다. 대화 transcript는 Load more 버튼 뒤에서 창 형태로 읽고, 모델 출력은 terminal이 그리는 속도에 맞춰 render-throttling하며, SSE keep-alive ping도 처리합니다. 파일 편집에서는 단일 줄·블록·삭제 도구와 find_symbol, 파일별 undo stack, diff 표시, 해시 줄 주소 재지정, 대용량 파일의 head preview를 제공해 제한된 문맥과 불안정한 편집을 보완합니다.
04
TUI에는 세션 검색이 가능한 /resume, 이전 메시지에서 대화를 분기하는 Rewind, 실행 중 메시지를 대기열에 넣는 agent steering, 실수 종료를 막는 double-press Ctrl+C가 들어갔습니다. /console은 색상과 TUI 없이 같은 agent를 plain-text REPL로 실행하고, /autocopy와 clipboard 경고는 Linux/X11 터미널 사용성을 보완합니다. lets-document skill은 한 세션의 조사 결과를 context file로 저장해 다른 세션이 같은 조사를 반복하지 않도록 연결합니다.
여러 세션을 재개하고 context file을 통해 이전 작업 지식을 재사용하는 과정입니다.
Screenshot화면에는 세션을 다시 열고 작업 결과를 context file에 기록한 뒤 다른 세션에서 이어가는 터미널 흐름이 나타납니다. 이는 lets-document skill이 한 세션의 조사 결과를 파일로 남겨 후속 세션이 같은 연구를 반복하지 않게 한다는 본문 내용과 직접 연결됩니다.
05
privibe는 Windows에서도 Git Bash와 PowerShell을 통한 실행을 지원하고, Windows zip과 .deb 패키지 빌드 스크립트를 제공합니다. 설정은 PRIVIBE_HOME으로 위치를 옮길 수 있으며 [paths] 섹션에서 Windows, WSL, Git Bash, Cygwin 사이의 경로 변환을 조정합니다. Anthropic과 Mistral backend adapter는 코드에 남아 있지만 이 fork에서 적극적으로 테스트하지 않았으므로 로컬 llama.cpp 외의 backend는 검증되지 않은 상태입니다.

용어 해설

로컬 우선(Local-first)
데이터와 모델 호출을 외부 클라우드보다 사용자 기기와 로컬 서버에서 먼저 처리하는 운영 방식입니다. privibe는 로컬 llama.cpp 서버를 기본 대상으로 삼고 계정 인증, 원격 인증, telemetry와 같은 외부 연결 요소를 제거해 데이터가 외부로 나가는 경로를 줄입니다.
KV 캐시(KV cache)
Transformer가 이전 토큰의 key와 value를 저장해 다음 생성 단계에서 같은 문맥을 다시 계산하지 않도록 하는 추론 메모리입니다. privibe는 대화의 불변 prefix와 원래 system prompt를 유지하고, 동반 llama-server 빌드에서는 캐시를 디스크에 저장해 세션 재개 때 전체 대화 재처리를 줄입니다.
OpenAI 호환 API(OpenAI-compatible API)
OpenAI API와 유사한 요청·응답 형식을 제공해 클라이언트가 여러 모델 서버에 같은 방식으로 연결할 수 있게 하는 인터페이스입니다. privibe는 로컬 llama.cpp 서버의 이 API를 통해 모델을 호출하며, 별도의 API-key onboarding 절차를 요구하지 않습니다.
Server-Sent Events(SSE)
서버가 연결을 유지한 채 생성 결과를 이벤트 스트림으로 클라이언트에 보내는 통신 방식입니다. privibe는 최신 llama.cpp 서버가 보내는 SSE keep-alive ping을 허용해 스트리밍 중 연결 유지 신호가 출력 처리에 문제를 일으키지 않도록 합니다.
해시 기반 줄 단위 파일 도구(Hashed-line file tools)
파일의 줄 위치와 해시를 함께 사용해 코드가 변경된 뒤에도 편집 대상이 같은지 확인하는 파일 조작 방식입니다. privibe는 단일 줄·블록·삭제 작업을 분리하고 앞선 편집으로 줄 위치가 이동하면 주소를 다시 연결해 작은 로컬 모델의 코드 수정 오류를 줄입니다.

기술

  • Python
  • uv
  • llama.cpp
  • OpenAI-compatible API
  • Mistral SDK
  • Anthropic backend adapter
  • Mistral backend adapter
  • KV cache
  • SSE
  • ACP

활용 사례

  • 외부 전송을 줄인 로컬 코드 개발
  • llama.cpp 서버를 이용한 터미널 기반 코딩 에이전트
  • 중단한 세션의 대화와 KV cache를 복원하는 장기 작업
  • 한 세션의 조사 결과를 context file로 저장하고 다른 세션에서 재사용하는 작업

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.