본문으로 건너뛰기
r/LocalLLaMA조회 2

Gemma 4 26B 기반 로컬 이기종 GPU 분산 챗봇 UI 개발 및 공개

AMD와 NVIDIA GPU를 혼합 사용하여 Gemma 4 26B 모델을 로컬에서 구동하는 고성능 단일 페이지 챗봇 인터페이스를 구축하고 소스코드를 공유했다.

실용적 조언

  • VRAM이 부족한 경우 서로 다른 제조사의 GPU를 혼합하여 모델을 샤딩하는 방식을 고려하라.
  • 복잡한 프레임워크 대신 단일 HTML과 LM Studio API를 연결하여 가벼운 커스텀 챗봇 UI를 구축할 수 있다.

섹션별 상세

01
AMD Radeon 7900 XT와 NVIDIA GeForce 3060 Ti라는 서로 다른 제조사의 GPU를 조합하여 로컬 추론 환경을 구성했다. Gemma 4 26B A4B 모델을 두 GPU에 샤딩하여 배치함으로써 단일 카드 메모리 한계를 극복하고 32K 컨텍스트 윈도우를 확보했다. 실제 구동 시 초당 50-65토큰(t/s)이라는 높은 성능을 기록하며 이기종 하드웨어 혼합 구성의 실용성을 입증했다.
02
LM Studio API를 백엔드로 활용하여 단일 HTML 파일 형태의 프론트엔드 인터페이스를 구현했다. 풀 스트리밍 응답, 마크다운 렌더링, 모델 선택기뿐만 아니라 6개의 파라미터 조절 슬라이더를 통해 세밀한 모델 제어가 가능하다. 메시지 편집, 히스토리 브랜칭, 생성 중단 및 시스템 프롬프트 설정 등 상용 서비스 수준의 UX 기능을 모두 포함했다.
03
프로젝트 개발 과정에서 로컬 모델인 Gemma 4와 상용 모델인 Claude를 전략적으로 병행 사용했다. 전체 코드의 대부분은 Gemma 4가 직접 작성했으며, Gemma가 해결하지 못한 복잡한 DOM 관련 버그 2개만 Claude의 도움을 받아 수정했다. 이는 최신 로컬 LLM이 복잡한 웹 애플리케이션 개발의 주축이 될 수 있으며, 특정 한계점만 상용 모델로 보완하는 효율적인 개발 워크플로우를 보여준다.

용어 해설

샤딩(Sharding)
거대한 모델 가중치를 여러 개의 GPU 메모리에 나누어 배치하는 기술이다. 단일 GPU의 VRAM 용량을 초과하는 모델을 실행하기 위해 필수적이며, 여기서는 AMD와 NVIDIA라는 서로 다른 제조사의 GPU를 동시에 활용하여 26B 규모의 모델을 구동하는 데 사용됐다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 처리하고 기억할 수 있는 텍스트 데이터의 최대 범위이다. 32K(32,768 토큰)의 윈도우는 수십 페이지 분량의 대화 기록이나 문서를 한꺼번에 참조하며 답변할 수 있는 능력을 의미하며, 로컬 환경에서 이를 유지하려면 상당한 양의 VRAM이 요구된다.
초당 토큰 수(Tokens per Second (t/s))
LLM의 추론 속도를 나타내는 지표로, 1초당 생성되는 텍스트 단위(토큰)의 개수이다. 50-65 t/s는 일반적인 독서 속도보다 훨씬 빠른 수준으로, 로컬 환경에서 이기종 GPU 조합을 통해 달성한 매우 효율적인 성능 수치로 평가된다.
히스토리 브랜칭(History Branching)
대화 도중 과거의 특정 시점으로 돌아가 메시지를 수정했을 때, 기존 대화 흐름을 지우지 않고 새로운 대화 줄기를 만들어 관리하는 기능이다. 사용자가 다양한 프롬프트 실험을 하거나 답변의 방향성을 다르게 유도할 때 유용하게 활용된다.

언급된 도구

LM Studio추천

로컬 LLM 추론 및 API 서버 제공

Gemma 4 26B A4B추천

메인 추론 및 코딩 보조 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 05.수집 2026. 04. 05.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.