TL;DR
llama.cpp가 build b10472부터 Ling-3.0과 BailingMoE3를 공식 지원하면서 Ling-3.0-tiny 8B와 Ling-3.0-flash 127B를 GGUF 양자화 파일로 로컬 실행할 수 있게 됐다. 작성자는 Linux의 B580에서 Ling-3.0-tiny Q8_0을 Vulkan과 ngl 99로 구동해 16,384 프롬프트 처리량 120.76 t/s와 생성 속도 약 114 t/s를 기록했다. 프롬프트를 32,768토큰으로 늘리면 처리량은 62.53 t/s로 낮아졌지만 생성 속도는 110.49 t/s였고, 12GB VRAM에서도 128K 컨텍스트 실행이 가능했다.
실용적 조언
- Ling-3.0-tiny를 로컬에서 실행하려면 bartowski가 제공한 GGUF imatrix 양자화 파일과 llama.cpp의 build b10472 이상을 사용할 수 있다. 12GB VRAM 환경에서는 Q8_0 K·V 캐시와 Flash Attention을 함께 설정하고 -c 131072로 긴 컨텍스트를 시험할 수 있다. 다만 경고가 발생할 수 있으므로 실제 작업에서는 컨텍스트 길이와 메모리 사용량을 단계적으로 확인하는 편이 안전하다.
- B580과 Linux 조합에서 재현하려면 Vulkan 백엔드를 활성화하고 모델 전체 레이어를 GPU에 배치하는 ngl 99 설정을 적용할 수 있다. 16,384토큰 프롬프트에서는 120.76 t/s, 32,768토큰 프롬프트에서는 62.53 t/s가 기준값으로 활용된다. 하드웨어와 빌드가 다르면 처리량이 달라질 수 있으므로 동일한 llama-bench 명령으로 비교해야 한다.
섹션별 상세
이미지 분석

이미지는 llama.cpp의 New Release b10472 화면으로, CUDA의 HIP 빌드 처리 변경과 AMD APU가 hipMemGetInfo를 통해 정확한 메모리를 보고하도록 한 수정 사항을 담고 있다. 본문에서 Ling-3.0 지원이 공식화된 기준 빌드로 b10472를 제시한 내용과 직접 연결되지만, Ling-3.0 자체의 벤치마크 수치는 이미지에 포함되지 않았다.
llama.cpp의 b10472 신규 릴리스 화면에 HIP 빌드 관련 CUDA 변경 사항과 AMD APU 메모리 보고 수정 내용이 표시되어 있다.
용어 해설
- GGUF
- — GGUF는 LLM의 가중치와 실행에 필요한 메타데이터를 한 파일에 저장하는 형식이다. llama.cpp에서 양자화 모델을 로컬로 불러올 때 사용되며, 모델 크기와 메모리 요구량을 줄이는 데 적합하다.
- imatrix 양자화(imatrix quantization)
- — imatrix 양자화는 중요도 행렬 정보를 활용해 모델 가중치를 낮은 비트 형식으로 변환하는 방식이다. 단순 양자화보다 품질 손실을 줄이면서 GGUF 모델의 저장 공간과 메모리 사용량을 낮추는 목적이 있다.
- Mixture of Experts
- — Mixture of Experts는 여러 Expert 중 입력에 필요한 일부만 선택해 계산하는 모델 구조다. 전체 파라미터 수가 크더라도 토큰마다 활성화되는 파라미터를 줄여 추론 비용을 낮출 수 있으며, Ling-3.0의 BailingMoE3 지원과 관련된다.
- Vulkan 백엔드(Vulkan)
- — Vulkan은 GPU 연산을 실행하기 위한 그래픽·컴퓨팅 API다. 이 글의 llama.cpp 벤치마크에서는 Vulkan 백엔드와 ngl 99 설정으로 Ling-3.0-tiny의 GPU 추론 속도를 측정했으며, 결과를 초당 토큰 수로 기록했다.
코드 예제
./llama-bench -m Ling-3.0-tiny-Q8_0.gguf -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 -p 16384 -n 128 -n 32 -r 1Ling-3.0-tiny Q8_0 GGUF를 Vulkan GPU에서 실행하고 16,384개 프롬프트 토큰과 128·32개 생성 토큰 조건의 처리량을 측정한다.
./llama-bench -m Ling-3.0-tiny-Q8_0.gguf -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 -p 32768 -n 32 -r 1동일한 GPU 설정에서 프롬프트 길이를 32,768토큰으로 늘려 긴 컨텍스트 처리량과 32토큰 생성 속도를 측정한다.
-c 131072 -ngl 99 -fa 1 --cache-type-k q8_0 --cache-type-v q8_012GB VRAM 환경에서 131,072토큰 컨텍스트를 사용하고 Flash Attention과 K·V 캐시 Q8_0 양자화를 활성화하는 실행 옵션이다.
언급된 도구
Ling-3.0 GGUF 모델을 로컬에서 실행하고 llama-bench로 추론 처리량을 측정하는 프레임워크
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.