본문으로 건너뛰기
r/LocalLLaMA조회 2

8GB Jetson에서 Ling-3.0-tiny 128K 실행

Jetson Orin Nano Super에서 Ling-3.0-tiny가 128K 문맥과 33 tok/s 추론을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 8GB 통합 메모리를 사용하는 NVIDIA Orin Nano Super에서 IQ4_NL로 양자화한 7.9B Ling-3.0-tiny를 llama.cpp master로 실행했습니다. 모델과 KV 캐시를 포함한 구성은 131,072토큰 문맥에서 7.2~7.4 GiB를 사용했고, 짧은 문맥 decode 33 tok/s와 96~128K 깊이 decode 15~17 tok/s를 기록했습니다. 128개의 passkey를 이용한 검색률은 96K에서 92%, 128K에서 88%였지만 마지막 32K 구간은 67%로 떨어졌습니다. 따라서 이 조합은 저전력 엣지 장치에서 긴 문맥 agent를 구동할 가능성을 입증했지만, 128K 전체 구간의 검색 신뢰도는 추가 검증이 필요한 상태입니다.

합의점 vs 논쟁점

논쟁점

  • 128K 전체 문맥을 지원한다는 사실과 실제 깊은 위치의 검색 신뢰도는 구분해야 합니다. 128K에서 전체 검색률은 88%였지만 마지막 32K 구간은 67%로 낮아졌고, 숫자를 바꾸거나 잘못된 passkey를 생성하는 사례도 있었습니다. 따라서 native context window의 크기만으로 긴 문맥 품질을 판단하기 어렵다는 점이 핵심 쟁점입니다.

실용적 조언

  • Ling-3.0-tiny를 Jetson Orin Nano Super에서 실행하려면 stock llama.cpp release 대신 BailingMoE V3 지원이 포함된 llama.cpp master를 사용해야 합니다. IQ4_NL은 8GB 환경에서 131,072토큰 KV 캐시를 남길 수 있는 4비트 이상 양자화로 선택됐으며 Q5와 Q6은 약 64K까지만 맞았습니다. CUDA 13.2에서 sm_87로 빌드하고 `-ngl 99`를 사용해 모든 레이어를 offload하는 구성이 게시물의 재현 조건입니다.
  • 긴 문맥이 필요하다면 128K보다 96K를 우선적인 운영 한도로 검토할 수 있습니다. 게시물의 passkey 평가에서 96K는 92% 검색률과 첫 32K 구간의 100% 성공률을 기록했지만 128K는 끝부분에서 성능 절벽이 나타났습니다. 실제 배포 전에는 사용할 문서 길이와 질의 위치를 반영한 별도 검색 평가가 필요합니다.

섹션별 상세

작성자는 $249에 판매되던 NVIDIA Orin Nano Super 8GB에서 Ling-3.0-tiny를 실행해 제한된 전력과 메모리 환경의 로컬 추론 가능성을 확인했습니다. IQ4_NL 파일은 4.40 GB이며 모델 가중치와 KV 캐시, CUDA offload를 합쳐 128K 문맥에서 7.2~7.4 GiB를 사용했습니다. 이 구성은 별도 GPU 없이 8GB 통합 메모리만으로 긴 문맥을 처리할 수 있는지가 핵심입니다.
Ling-3.0-tiny는 BailingMoE V3 구조라 stock quantizer release가 아니라 llama.cpp master와 PR #26608 이후의 빌드가 필요했습니다. 작성자는 CUDA 13.2와 sm_87 설정으로 24개 레이어를 모두 offload했고, 짧은 문맥에서 decode 33 tok/s, 96~128K 깊이에서 15~17 tok/s, 2~8K prompt eval에서 450~760 tok/s를 측정했습니다. 125K 전체 prefill도 220~264 tok/s, 512토큰 TTFT는 약 1초로 기록돼 실행 가능성뿐 아니라 실제 처리 속도도 함께 검증했습니다.
긴 문맥 성능은 문맥 길이에 따라 저하됐지만 완전히 무너지지는 않았습니다. 128개의 passkey를 이용한 평가에서 96K 문맥은 118/128, 즉 92%를 검색했고 128K 문맥은 113/128, 즉 88%를 검색했으며 마지막 32K 구간의 성공률은 67%로 떨어졌습니다. 엄격한 전체 문자열 일치율은 30~40%였지만 작성자는 일부 passkey의 끝부분만 출력하는 생성 현상과 실제 검색 실패를 구분했고, 96K에서는 성능 저하 구간이 사라진다고 판단했습니다.

용어 해설

전문가 혼합 모델(Mixture of Experts)
여러 전문가 네트워크 중 일부만 토큰마다 선택해 계산하는 구조입니다. Ling-3.0-tiny는 128개 전문가 가운데 라우팅 전문가 8개와 공유 전문가 1개만 활성화해 전체 파라미터보다 적은 연산으로 추론합니다.
양자화(Quantization)
모델 가중치의 표현 정밀도를 낮춰 파일 크기와 메모리 사용량을 줄이는 기법입니다. 이 게시물에서는 IQ4_NL 양자화를 사용해 4.40 GB 모델 파일과 131,072토큰 문맥을 8GB 통합 메모리에 함께 배치했습니다.
KV 캐시(KV Cache)
생성 과정에서 이미 계산한 어텐션의 Key와 Value를 저장해 이전 토큰을 반복 계산하지 않게 하는 메모리 영역입니다. 긴 문맥에서는 크기가 커지지만 Ling-3.0-tiny의 MLA와 KDA 구조가 캐시 증가량을 제한해 128K 문맥 실행을 가능하게 했습니다.
긴 문맥 검색 평가(Needle-in-a-Haystack)
긴 입력 안에 숨긴 특정 정보를 모델이 찾아내는지 측정하는 평가 방식입니다. 게시물에서는 128개의 고유 passkey를 문맥 곳곳에 넣고 각각을 질의해 96K와 128K 깊이에서 검색 성공률을 비교했습니다.
통합 메모리(Unified Memory)
CPU와 GPU가 하나의 메모리 공간을 공유하는 하드웨어 구조입니다. Jetson Orin Nano Super의 8GB LPDDR5를 모델 가중치, KV 캐시, CUDA offload에 함께 사용해 별도 GPU 메모리 없이 추론을 수행했습니다.

코드 예제

bash
llama-server -m Ling-3.0-tiny-IQ4_NL.gguf -c 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
-ngl 99 -fa on -b 512 -ub 256 --jinja -t 6 \
--temp 1.0 --top-p 0.95 --top-k 20

131,072토큰 문맥과 q8_0 KV 캐시를 설정하고 24개 레이어를 CUDA로 offload해 Ling-3.0-tiny를 실행하는 llama.cpp 서버 명령입니다.

언급된 도구

llama.cpp추천링크

BailingMoE V3 아키텍처를 지원하는 로컬 추론 엔진으로 Ling-3.0-tiny의 CUDA offload와 llama-server 실행에 사용했습니다.

JetPack R39.2 / CUDA 13.2중립

Jetson Orin Nano Super에서 llama.cpp를 CUDA 13.2와 sm_87 대상으로 빌드하는 실행 환경입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.