본문으로 건너뛰기

허깅페이스 인퍼런스 프로바이더를 VS Code 코파일럿 챗에서 사용하는 방법

허깅페이스 인퍼런스 프로바이더 확장을 통해 VS Code 코파일럿 챗에서 다양한 오픈소스 LLM을 저렴하고 빠르게 활용하는 방법을 소개합니다.

챕터별 상세

00:46

허깅페이스 인퍼런스 프로바이더의 핵심 가치

Inference Providers는 단일 API를 통해 Cerebras, Groq, Fireworks 등 세계적인 추론 엔진 파트너들이 제공하는 오픈 가중치 모델에 접근할 수 있게 한다. 사용자는 특정 벤더에 종속되지 않고 유연하게 모델을 교체하며 사용할 수 있다. 추가적인 마진 없이 파트너사의 가격 그대로 제공되므로 비용 효율적이며 매우 빠른 추론 속도를 보장한다.
01:30

VS Code 확장 프로그램 설치 및 API 연동

VS Code 마켓플레이스에서 'Hugging Face Provider for GitHub Copilot Chat' 확장을 설치한다. Copilot Chat의 모델 선택기에서 'Add Model'을 클릭한 후 Hugging Face를 선택한다. 허깅페이스 설정 페이지에서 발급받은 Access Token을 입력하면 연동이 완료된다. 이 과정은 VS Code의 'Bring Your Own Key' 기능을 기반으로 작동한다.
03:31

모델 선택 최적화: Fastest 및 Cheapest 모드

모델 선택기에서 특정 파트너사(예: Fireworks)를 검색하여 필터링할 수 있다. 'Fastest' 모드를 선택하면 현재 가장 높은 처리량을 제공하는 프로바이더를 자동으로 지정한다. 'Cheapest' 모드는 가장 비용 효율적인 프로바이더를 선택하여 추론 비용을 절감한다. DeepSeek V3.2나 GLM 4.6과 같은 최신 모델을 즉시 선택하여 대화에 참여시킬 수 있다.
04:56

실전 데모: HF Hub SDK 기능 자동 구현

GLM 4.6 모델을 사용하여 Hugging Face Hub Python SDK에 새로운 CLI 명령어인 'hf repo list'를 추가하는 작업을 시연했다. GitHub Issue URL을 직접 입력하여 컨텍스트를 제공하고 모델이 코드를 생성하도록 요청했다. 모델은 기존 코드베이스를 분석하여 적절한 위치에 명령어를 구현하고 테스트 코드까지 제안했다. 이러한 작업 세션 한 번에 발생하는 비용은 약 20-30센트 수준으로 매우 저렴하다.
bash
huggingface-cli repo list --limit 10

데모에서 구현하고자 하는 새로운 CLI 명령어 예시

용어 해설

추론 제공자(Inference Provider)
다양한 AI 모델을 클라우드 인프라를 통해 실행하고 API 형태로 제공하는 서비스이다. Cerebras, Groq, Fireworks 등이 대표적이며 사용자는 복잡한 서버 설정 없이 모델을 호출해 사용할 수 있다.
오픈 가중치 모델(Open-weight Model)
모델의 가중치가 공개되어 누구나 다운로드하여 실행하거나 튜닝할 수 있는 AI 모델이다. Llama, Mistral, DeepSeek 등이 포함되며 상용 폐쇄형 모델과 달리 자유로운 배포와 최적화가 가능하다.
처리량(Throughput)
단위 시간당 AI 모델이 생성하거나 처리하는 토큰의 양을 의미한다. 높은 처리량은 더 빠른 응답 속도를 의미하며 실시간 코드 생성이나 챗봇 서비스에서 핵심적인 성능 지표이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 16.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.