TL;DR
작성자는 8GB 통합 메모리를 사용하는 NVIDIA Orin Nano Super에서 IQ4_NL로 양자화한 7.9B Ling-3.0-tiny를 llama.cpp master로 실행했습니다. 모델과 KV 캐시를 포함한 구성은 131,072토큰 문맥에서 7.2~7.4 GiB를 사용했고, 짧은 문맥 decode 33 tok/s와 96~128K 깊이 decode 15~17 tok/s를 기록했습니다. 128개의 passkey를 이용한 검색률은 96K에서 92%, 128K에서 88%였지만 마지막 32K 구간은 67%로 떨어졌습니다. 따라서 이 조합은 저전력 엣지 장치에서 긴 문맥 agent를 구동할 가능성을 입증했지만, 128K 전체 구간의 검색 신뢰도는 추가 검증이 필요한 상태입니다.
합의점 vs 논쟁점
논쟁점
- 128K 전체 문맥을 지원한다는 사실과 실제 깊은 위치의 검색 신뢰도는 구분해야 합니다. 128K에서 전체 검색률은 88%였지만 마지막 32K 구간은 67%로 낮아졌고, 숫자를 바꾸거나 잘못된 passkey를 생성하는 사례도 있었습니다. 따라서 native context window의 크기만으로 긴 문맥 품질을 판단하기 어렵다는 점이 핵심 쟁점입니다.
실용적 조언
- Ling-3.0-tiny를 Jetson Orin Nano Super에서 실행하려면 stock llama.cpp release 대신 BailingMoE V3 지원이 포함된 llama.cpp master를 사용해야 합니다. IQ4_NL은 8GB 환경에서 131,072토큰 KV 캐시를 남길 수 있는 4비트 이상 양자화로 선택됐으며 Q5와 Q6은 약 64K까지만 맞았습니다. CUDA 13.2에서 sm_87로 빌드하고 `-ngl 99`를 사용해 모든 레이어를 offload하는 구성이 게시물의 재현 조건입니다.
- 긴 문맥이 필요하다면 128K보다 96K를 우선적인 운영 한도로 검토할 수 있습니다. 게시물의 passkey 평가에서 96K는 92% 검색률과 첫 32K 구간의 100% 성공률을 기록했지만 128K는 끝부분에서 성능 절벽이 나타났습니다. 실제 배포 전에는 사용할 문서 길이와 질의 위치를 반영한 별도 검색 평가가 필요합니다.
섹션별 상세
용어 해설
- 전문가 혼합 모델(Mixture of Experts)
- — 여러 전문가 네트워크 중 일부만 토큰마다 선택해 계산하는 구조입니다. Ling-3.0-tiny는 128개 전문가 가운데 라우팅 전문가 8개와 공유 전문가 1개만 활성화해 전체 파라미터보다 적은 연산으로 추론합니다.
- 양자화(Quantization)
- — 모델 가중치의 표현 정밀도를 낮춰 파일 크기와 메모리 사용량을 줄이는 기법입니다. 이 게시물에서는 IQ4_NL 양자화를 사용해 4.40 GB 모델 파일과 131,072토큰 문맥을 8GB 통합 메모리에 함께 배치했습니다.
- KV 캐시(KV Cache)
- — 생성 과정에서 이미 계산한 어텐션의 Key와 Value를 저장해 이전 토큰을 반복 계산하지 않게 하는 메모리 영역입니다. 긴 문맥에서는 크기가 커지지만 Ling-3.0-tiny의 MLA와 KDA 구조가 캐시 증가량을 제한해 128K 문맥 실행을 가능하게 했습니다.
- 긴 문맥 검색 평가(Needle-in-a-Haystack)
- — 긴 입력 안에 숨긴 특정 정보를 모델이 찾아내는지 측정하는 평가 방식입니다. 게시물에서는 128개의 고유 passkey를 문맥 곳곳에 넣고 각각을 질의해 96K와 128K 깊이에서 검색 성공률을 비교했습니다.
- 통합 메모리(Unified Memory)
- — CPU와 GPU가 하나의 메모리 공간을 공유하는 하드웨어 구조입니다. Jetson Orin Nano Super의 8GB LPDDR5를 모델 가중치, KV 캐시, CUDA offload에 함께 사용해 별도 GPU 메모리 없이 추론을 수행했습니다.
코드 예제
llama-server -m Ling-3.0-tiny-IQ4_NL.gguf -c 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
-ngl 99 -fa on -b 512 -ub 256 --jinja -t 6 \
--temp 1.0 --top-p 0.95 --top-k 20131,072토큰 문맥과 q8_0 KV 캐시를 설정하고 24개 레이어를 CUDA로 offload해 Ling-3.0-tiny를 실행하는 llama.cpp 서버 명령입니다.
언급된 도구
BailingMoE V3 아키텍처를 지원하는 로컬 추론 엔진으로 Ling-3.0-tiny의 CUDA offload와 llama-server 실행에 사용했습니다.
Jetson Orin Nano Super에서 llama.cpp를 CUDA 13.2와 sm_87 대상으로 빌드하는 실행 환경입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.