본문으로 건너뛰기

OpenClaw 해방하기: Claude에서 Hugging Face 오픈 모델로 전환하는 방법

Anthropic의 Claude 모델 접근 제한에 대응하여 OpenClaw 등 AI 에이전트를 Hugging Face의 호스팅 서비스나 로컬 Llama.cpp 환경의 오픈 모델로 전환하는 가이드를 제공한다.

섹션별 상세

01
Anthropic의 정책 변화로 인해 오픈 에이전트 플랫폼에서 Claude 모델 사용이 Pro/Max 구독자로 제한되는 문제가 발생했다. 이로 인해 기존에 Claude를 기반으로 작동하던 OpenClaw, Pi, Open Code 등의 에이전트 사용자들이 서비스 중단 위기에 처했다. Hugging Face는 이러한 폐쇄형 모델의 제약에서 벗어나기 위해 오픈 소스 모델로의 전환 가이드를 배포했다. 오픈 모델을 사용하면 비용을 획기적으로 낮추면서도 에이전트의 기능을 안정적으로 유지할 수 있다.
02
Hugging Face Inference Providers는 다양한 오픈 소스 모델을 여러 프로바이더를 통해 API 형태로 제공하는 개방형 플랫폼이다. 사용자는 Hugging Face 토큰을 생성한 후 OpenClaw 설정에서 인증 방식을 변경하여 즉시 모델을 교체할 수 있다. 특히 Terminal Bench 점수가 높은 GLM-5 모델이 에이전트용으로 권장되며, 수천 개의 모델 중 프로젝트에 맞는 것을 선택할 수 있다. 이 방식은 별도의 고성능 하드웨어 없이도 강력한 에이전트 성능을 확보할 수 있는 가장 빠른 경로이다.
json
{
  agents: {
    defaults: {
      model: {
        primary: "huggingface/zai-org/GLM-5:fastest"
      }
    }
  }
}

OpenClaw 설정 파일에서 기본 모델을 Hugging Face의 GLM-5로 변경하는 예시

03
완전한 프라이버시와 API 비용 제로를 원하는 사용자는 Llama.cpp를 이용해 로컬 환경에서 모델을 구동할 수 있다. Mac, Linux, Windows 등 다양한 운영체제에서 간단한 명령어로 설치가 가능하며 로컬 서버를 구축해 웹 UI까지 활용할 수 있다. Qwen3.5-35B와 같은 대규모 모델도 GGUF 형식을 통해 32GB RAM 환경에서 효율적으로 실행된다. 로컬 서버 주소를 OpenClaw의 커스텀 API 엔드포인트로 지정하면 외부 서버 연결 없이 에이전트를 독립적으로 운영할 수 있다.
bash
# on mac or linux
brew install llama.cpp
# on windows
winget install llama.cpp

운영체제별 패키지 관리자를 이용한 Llama.cpp 설치 명령어

bash
llama-server -hf unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL

Hugging Face에서 Qwen 3.5 GGUF 모델을 다운로드하여 로컬 추론 서버를 시작하는 명령어

bash
openclaw onboard --non-interactive \
  --auth-choice custom-api-key \
  --custom-base-url "http://127.0.0.1:8080/v1" \
  --custom-model-id "unsloth-qwen3.5-35b-a3b-gguf" \
  --custom-api-key "llama.cpp" \
  --secret-input-mode plaintext \
  --custom-compatibility openai

로컬에서 구동 중인 Llama.cpp 서버를 OpenClaw 에이전트의 백엔드로 연결하는 설정 명령어

용어 해설

추론 프로바이더(Inference Provider)
AI 모델을 직접 서버에 배포하고 관리하는 대신, API를 통해 모델 실행 결과만을 받아올 수 있도록 인프라를 제공하는 서비스이다. 사용자는 고가의 GPU 하드웨어 없이도 클라우드 상의 오픈 소스 모델을 즉시 활용할 수 있어 개발 속도를 높이고 초기 비용을 절감할 수 있다.
GGUF
Llama.cpp 프로젝트에서 개발한 바이너리 파일 형식으로, 대규모 언어 모델을 로컬 환경에서 효율적으로 로드하고 추론하기 위해 설계되었다. 단일 파일에 모델 가중치와 메타데이터를 모두 포함하며, CPU와 GPU 간의 데이터 전송을 최적화하여 저사양 하드웨어에서도 빠른 실행을 지원한다.
터미널 벤치(Terminal Bench)
AI 에이전트가 터미널 환경에서 명령어를 실행하고 복잡한 작업을 수행하는 능력을 측정하는 평가 지표이다. 모델이 단순한 텍스트 생성을 넘어 실제 시스템 도구를 얼마나 정확하게 제어하고 오류를 수정하며 목표를 달성하는지를 수치화하여 에이전트로서의 적합성을 판단한다.
양자화(Quantization)
모델의 가중치 데이터를 더 적은 비트(예: 16비트에서 4비트)로 표현하여 메모리 사용량을 줄이고 연산 속도를 높이는 최적화 기법이다. 이 과정을 통해 수십 기가바이트에 달하는 모델을 일반 소비자용 PC의 RAM에서도 실행할 수 있게 하며, 약간의 정확도 손실 대신 실용성을 극대화한다.

기술

  • OpenClaw
  • Llama.cpp
  • GLM-5
  • Qwen 3.5
  • Hugging Face Inference Providers

활용 사례

  • 코딩 에이전트 복구
  • 로컬 프라이버시 중심 AI 에이전트 구축
  • API 비용 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 03. 29.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.