본문으로 건너뛰기

llama.cpp, Ling-3.0 공식 지원

llama.cpp 공식 지원으로 Ling-3.0-tiny를 12GB VRAM에서 128K 컨텍스트와 110 t/s급 생성 속도로 실행했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

llama.cpp가 build b10472부터 Ling-3.0과 BailingMoE3를 공식 지원하면서 Ling-3.0-tiny 8B와 Ling-3.0-flash 127B를 GGUF 양자화 파일로 로컬 실행할 수 있게 됐다. 작성자는 Linux의 B580에서 Ling-3.0-tiny Q8_0을 Vulkan과 ngl 99로 구동해 16,384 프롬프트 처리량 120.76 t/s와 생성 속도 약 114 t/s를 기록했다. 프롬프트를 32,768토큰으로 늘리면 처리량은 62.53 t/s로 낮아졌지만 생성 속도는 110.49 t/s였고, 12GB VRAM에서도 128K 컨텍스트 실행이 가능했다.

실용적 조언

  • Ling-3.0-tiny를 로컬에서 실행하려면 bartowski가 제공한 GGUF imatrix 양자화 파일과 llama.cpp의 build b10472 이상을 사용할 수 있다. 12GB VRAM 환경에서는 Q8_0 K·V 캐시와 Flash Attention을 함께 설정하고 -c 131072로 긴 컨텍스트를 시험할 수 있다. 다만 경고가 발생할 수 있으므로 실제 작업에서는 컨텍스트 길이와 메모리 사용량을 단계적으로 확인하는 편이 안전하다.
  • B580과 Linux 조합에서 재현하려면 Vulkan 백엔드를 활성화하고 모델 전체 레이어를 GPU에 배치하는 ngl 99 설정을 적용할 수 있다. 16,384토큰 프롬프트에서는 120.76 t/s, 32,768토큰 프롬프트에서는 62.53 t/s가 기준값으로 활용된다. 하드웨어와 빌드가 다르면 처리량이 달라질 수 있으므로 동일한 llama-bench 명령으로 비교해야 한다.

섹션별 상세

llama.cpp가 build b10472부터 Ling-3.0을 공식 지원하고, PR #26608이 master에 병합되면서 BailingMoE3 기반 모델을 공식 경로로 실행할 수 있게 됐다. 작성자는 Ling-3.0-tiny 8B와 Ling-3.0-flash 127B용 GGUF imatrix 양자화 파일이 이미 제공된다고 전했다. 다만 지원과 관련된 사소한 세부 조정은 아직 남아 있다고 밝혔다.
작성자는 Linux의 B580에서 Ling-3.0-tiny Q8_0을 Vulkan 백엔드와 ngl 99, Flash Attention, K·V 캐시 Q8_0으로 측정했다. 16,384 프롬프트 토큰 조건에서 120.76 t/s, 128토큰 생성에서 114.24 t/s, 32토큰 생성에서 114.78 t/s를 기록했다. 모델 파일 크기는 7.83 GiB이고 파라미터 수는 7.89B로 표기됐다.
컨텍스트를 32,768토큰으로 늘리면 프롬프트 처리량은 62.53 t/s로 낮아졌지만 32토큰 생성 속도는 110.49 t/s를 유지했다. 작성자는 12GB VRAM에서도 -c 131072 설정으로 128K 컨텍스트 실행이 가능했다고 밝혔다. 일부 경고가 발생해 추가 검증이 필요하지만, 로컬 환경에서 긴 컨텍스트와 높은 생성 속도를 함께 확보할 수 있다는 점이 핵심이다.

이미지 분석

llama.cpp의 b10472 신규 릴리스 화면에 HIP 빌드 관련 CUDA 변경 사항과 AMD APU 메모리 보고 수정 내용이 표시되어 있다.
Screenshot

이미지는 llama.cpp의 New Release b10472 화면으로, CUDA의 HIP 빌드 처리 변경과 AMD APU가 hipMemGetInfo를 통해 정확한 메모리를 보고하도록 한 수정 사항을 담고 있다. 본문에서 Ling-3.0 지원이 공식화된 기준 빌드로 b10472를 제시한 내용과 직접 연결되지만, Ling-3.0 자체의 벤치마크 수치는 이미지에 포함되지 않았다.

llama.cpp의 b10472 신규 릴리스 화면에 HIP 빌드 관련 CUDA 변경 사항과 AMD APU 메모리 보고 수정 내용이 표시되어 있다.

용어 해설

GGUF
GGUF는 LLM의 가중치와 실행에 필요한 메타데이터를 한 파일에 저장하는 형식이다. llama.cpp에서 양자화 모델을 로컬로 불러올 때 사용되며, 모델 크기와 메모리 요구량을 줄이는 데 적합하다.
imatrix 양자화(imatrix quantization)
imatrix 양자화는 중요도 행렬 정보를 활용해 모델 가중치를 낮은 비트 형식으로 변환하는 방식이다. 단순 양자화보다 품질 손실을 줄이면서 GGUF 모델의 저장 공간과 메모리 사용량을 낮추는 목적이 있다.
Mixture of Experts
Mixture of Experts는 여러 Expert 중 입력에 필요한 일부만 선택해 계산하는 모델 구조다. 전체 파라미터 수가 크더라도 토큰마다 활성화되는 파라미터를 줄여 추론 비용을 낮출 수 있으며, Ling-3.0의 BailingMoE3 지원과 관련된다.
Vulkan 백엔드(Vulkan)
Vulkan은 GPU 연산을 실행하기 위한 그래픽·컴퓨팅 API다. 이 글의 llama.cpp 벤치마크에서는 Vulkan 백엔드와 ngl 99 설정으로 Ling-3.0-tiny의 GPU 추론 속도를 측정했으며, 결과를 초당 토큰 수로 기록했다.

코드 예제

bash
./llama-bench -m Ling-3.0-tiny-Q8_0.gguf -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 -p 16384 -n 128 -n 32 -r 1

Ling-3.0-tiny Q8_0 GGUF를 Vulkan GPU에서 실행하고 16,384개 프롬프트 토큰과 128·32개 생성 토큰 조건의 처리량을 측정한다.

bash
./llama-bench -m Ling-3.0-tiny-Q8_0.gguf -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 -p 32768 -n 32 -r 1

동일한 GPU 설정에서 프롬프트 길이를 32,768토큰으로 늘려 긴 컨텍스트 처리량과 32토큰 생성 속도를 측정한다.

bash
-c 131072 -ngl 99 -fa 1 --cache-type-k q8_0 --cache-type-v q8_0

12GB VRAM 환경에서 131,072토큰 컨텍스트를 사용하고 Flash Attention과 K·V 캐시 Q8_0 양자화를 활성화하는 실행 옵션이다.

언급된 도구

llama.cpp추천링크

Ling-3.0 GGUF 모델을 로컬에서 실행하고 llama-bench로 추론 처리량을 측정하는 프레임워크

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.