섹션별 상세
사설망에 위치한 LLM을 외부 인바운드 포트 개방 없이 안전하게 공용 인터넷에 노출할 수 있습니다. 경량화된 llm-agent가 VPS로 아웃바운드 WebSocket 연결을 먼저 시도하여 방화벽 문제를 해결하고 연결을 유지합니다. 이를 통해 외부 클라이언트는 VPS의 통합 엔드포인트를 통해 로컬 모델에 접근할 수 있습니다.
토큰 공유를 기반으로 하는 P2P 크레딧 경제 시스템을 도입하여 자원 활용을 최적화합니다. 사용자가 제공한 출력 토큰 수에 모델별 기여율과 품질 가중치를 곱하여 크레딧을 정산하며, 적립된 크레딧은 다른 시점이나 다른 모델을 사용하는 데 소비할 수 있습니다. 기여율이 소비율보다 높게 설계되어 장기 기여자가 혜택을 받는 구조입니다.
근거
- 기여 크레딧은 출력 토큰 수, 모델 기여율, 품질 가중치(가동 시간, 지연 시간, 안정성)의 조합으로 결정됩니다. — Credit economy (summary) 섹션의 수식 참고
업스트림 LLM의 인증 정보가 프록시 서버에 저장되지 않도록 설계되어 프라이버시를 보호합니다. API 키는 로컬 에이전트 설정 파일에만 머물며 에이전트와 로컬 LLM 사이의 통신에만 사용됩니다. VPS 서버는 오직 에이전트 등록을 위한 워커 키와 클라이언트 호출을 위한 사용자 API 키만 관리합니다.
근거
- 업스트림 API 키는 프록시에 저장되지 않으며 로컬 에이전트 설정에만 유지됩니다. — Privacy & control 섹션의 --llm-token 설명
다양한 노드와 모델을 하나의 OpenAI 호환 API 엔드포인트 뒤로 통합하여 관리할 수 있습니다. 여러 워커가 제공하는 서로 다른 모델들이 /v1/chat/completions 경로로 집약되어 사용자는 단일 베이스 URL만으로 멀티 노드 풀을 활용하게 됩니다. 서버는 요청을 적절한 워커로 라우팅하고 스트리밍 응답을 클라이언트에게 다시 전달합니다.
기술
- Python
- Docker
- WebSocket
- SQLite
- Ollama
- OpenAI API
활용 사례
- 사설망 LLM의 외부 API화
- 유휴 GPU 자원 공유 및 크레딧 적립
- 멀티 노드 LLM 로드 밸런싱
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
