본문으로 건너뛰기

경량 기기용 14MB 함수 호출 LLM Needle 2

Needle 2는 45M 파라미터를 CQ2-bit로 학습해 14MB 바이너리로 배포하며 로컬 도구 호출을 수행한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Needle 2는 함수 호출과 구조화된 출력에 특화된 45M 파라미터 LLM을 CQ2-bit로 통째로 학습해 14MB 단일 C++ 바이너리로 배포하는 시스템이다. 아키텍처는 Hadamard MLP, 해시된 n-그램 엔그램 메모리, 256토큰 슬라이딩 윈도 어텐션과 바이트 수준 문법을 결합해 연산과 읽기 비용을 모두 낮춘다. 엔진은 가중치를 메모리로 풀지 않고 정수 연산 경로를 유지하며 런타임에 CPU 특성을 탐지해 최적 커널을 선택함으로써 저전력 장치에서 실시간 응답과 오프라인 실행을 달성한다. 공개 벤치마크에서는 도메인 내 함수 호출 성능이 경쟁 모델과 대등하거나 우수한 부분이 있으며 분포 밖(예: Java/JavaScript)에서는 성능이 상대적으로 떨어진다.

섹션별 상세

Needle 2의 목표는 수백 MB 미만의 RAM과 GPU/NPU가 없는 저가형 기기에서 함수 호출과 구조화된 추출 작업을 안정적으로 수행하는 것이다. 이를 위해 설계된 문제 축소는 일반적 대화나 세계 지식이 아니라 어떤 함수와 어떤 인자를 채울지 결정하는 것에 집중한다. 결과적으로 45M 파라미터짜리 모델을 CQ2-bit로 훈련해 14MB 바이너리에 담아 오프라인으로 즉시 실행할 수 있도록 했다.
아키텍처는 Simple Attention Network로 명명된 다중 레인(27층, 폭 512) 구조와 Hadamard MLP, 해시된 n-그램 엔그램 메모리, 그리고 256토큰 슬라이딩 윈도 기반의 제한된 어텐션을 핵심으로 삼는다. Hadamard MLP는 고정된 Walsh-Hadamard 변환과 학습 가능한 대각행렬로 채널 혼합을 수행해 파라미터 읽기 비용을 줄이고, 엔그램 메모리는 플래시 읽기만으로 용량을 확보해 실시간 지연과 전력 소비를 낮춘다. 또한 도구 선언과 시스템 프롬프트는 영구 핀으로 고정해 툴 정보가 캐시에서 쫓겨나지 않게 설계했다.
엔진과 모델은 동시 설계(co-design)를 통해 배포 산출물을 하나의 독립 실행 C++ 바이너리로 묶었다. 가중치는 메모리에서 압축된 2비트 코드로 유지되고, 실행 경로에서는 벡터 레지스터에서 확장해 정수 기반(int8) 도트 연산으로 이어지므로 가중치가 RAM으로 풀리는 일이 없다. 바이트 수준 문법을 이용해 생성 가능한 토큰을 미리 좁혀 어휘 투영을 크게 건너뛰며, 바이너리는 런타임에 CPU 특징을 탐지해 SDOT·NEON·AVX2·wasm SIMD 등 최적 커널을 선택한다.
평가에서는 모바일 엑션, DroidCall, Seal-Tools, BFCL v4 같은 함수 호출 중심 벤치마크를 사용했고 측정은 배포된 CQ2-bit 엔진을 통해 엔드투엔드로 수행되었다. Needle 2는 Mobile Actions에서 63.7% 정확도를 기록했고 Seal-Tools와 BFCL의 일부 카테고리에서 같은 클래스보다 우수한 성능을 보였다, 특히 도메인 내·단순 호출에서는 강점을 보였다. 그러나 Java·JavaScript·병렬 다중 호출과 같이 훈련 분포 밖 영역에서는 더 큰 모델과의 격차가 존재하며 저자들이 그 불균형을 명시하고 있다.

이미지 분석

Simple Attention Network 아키텍처 다이어그램
Diagram

다이어그램은 토큰 임베딩에서 시작해 mHC lane read, engram fusion, GQA attention, Hadamard MLP, mHC lane write를 거쳐 디코딩이 바이트 수준 문법으로 제한되는 전체 흐름을 보여준다. Walsh-Hadamard 변환과 해시된 n-그램 테이블, Sinkhorn 기반의 라우팅 정규화 등이 구성 요소로 표기되어 있으며 각 블록 아래에 수식이 붙어 있어 연산적 동작이 어떻게 이루어지는지 시각적으로 확인된다. 이 그림은 아키텍처 설계가 메모리·연산·문법 제약을 어떻게 맞추는지, 그리고 엔그램과 라우팅이 파라미터 예산을 보완하는 방식이 무엇인지를 한눈에 파악하게 한다.

Simple Attention Network 아키텍처 다이어그램

용어 해설

함수 호출 인터페이스(Function calling)
함수 호출 인터페이스는 자연어를 기기·서비스가 제공하는 타입화된 함수 호출로 변환하는 작업이다. 입력 문장에서 호출할 함수와 각 인자 값을 추출하는 과정을 포함하며, 스키마와 바이트 수준 문법으로 출력 형식을 엄격히 제약해 형식 오류를 없애는 것이 핵심이다. 이 방식은 광범위한 세계 지식이 아니라 정밀한 매핑과 인수 근거화가 중요한 엣지 장치 제어에 적합하다.
CQ2-비트 양자화(CQ2-bit)
CQ2-bit는 학습 전체(사전학습·후학습 포함)에서 양자화 방식을 적용해 2비트 표현으로 가중치와 활성값을 유지하는 기법이다. 모델이 훈련 단계에서부터 그 저비트 정밀도에 적응하도록 QAT(quantization-aware training)을 사용해 포스트호크 양자화에서 발생하는 성능 붕괴를 방지한다. 그 결과로 45M 파라미터 모델을 14MB 바이너리로 배포하면서도 참조 경로와 토큰 단위 정확도를 맞춘다.
Hadamard MLP
Hadamard MLP는 업·다운 프로젝션 대신 고정된 Walsh-Hadamard 변환과 학습 가능한 대각행렬을 결합해 채널 혼합을 수행하는 구조이다. Walsh 변환은 가중치 읽기 비용을 거의 발생시키지 않으면서 n log n 시간 안에 계산되며, 대각 성분들이 채널별 스케일링을 책임져 매개변수 소비를 최소화한다. 특히 파라미터가 제한된 소형 모델에서 채널 혼합 성능을 저비용으로 확보하는 역할을 한다.
해시된 n-그램 엔그램 메모리(Engram fusion · hashed n-gram memory)
해시된 n-그램 엔그램 메모리는 세계 지식을 스택 바깥의 테이블에 저장하고 디코드 시점에 몇 행만 모아서 읽는 메커니즘이다. 디코딩 비용에서 매트멀 연산을 늘리지 않고도 대용량의 정적 지식을 참조하도록 설계되어 플래시에서 바이트를 읽는 비용이 중요한 장치에서 유리하다. Needle은 이 메모리를 여러 레이어에서 소량 접근하도록 하여 파라미터 예산을 실제 연산이 필요한 부분에 집중시켰다.
바이트 수준 문법(Byte-level grammar)
바이트 수준 문법은 선언된 스키마로부터 컴파일된 엄격한 출력 문법으로, 생성 가능한 토큰을 사전에 결정해 후보 집합만 점수화하게 한다. 이로 인해 구조적 출력 단계에서 어휘 투영을 최대 98%까지 건너뛰는 등 디코드 비용을 직접적으로 줄이며, 잘못된 형식의 출력을 구조적으로 차단한다. 장치급 실행에서 읽기와 연산 비용을 동시에 낮추는 핵심 최적화 수단이다.

근거 모음

근거
  • Needle 2는 45M 파라미터 모델을 CQ2-bit로 훈련해 14MB 배포 바이너리로 제공한다. 본문 초반의 사양 표와 'File size 14 MB', '45MParams' 표기 및 'Lossless 2bit Quantization' 섹션.
  • 모델과 엔진을 동시 설계하여 가중치가 RAM으로 풀리지 않고 2비트 코드를 레지스터에서 확장해 int8 경로로 연산을 이어간다. 엔진 설명 부분의 'Weights never decompress into RAM' 문단과 'arithmetic path is int8 end to end' 기술 문장.
  • 바이트 수준 문법으로 구조적 토큰에서 어휘 투영을 최대 98%까지 건너뛸 수 있다. 엔진 섹션의 문법 최적화 설명과 'skipping up to 98% of the vocabulary projection on structural tokens' 문구.
  • Mobile Actions 벤치마크에서 Needle 2는 63.7%의 정확도를 기록했으며 벤치마크 측정치는 CQ2-bit 엔진의 엔드투엔드 결과다. 평가 표, 'Mobile Actions (961 rows)' 테이블의 Needle 2 행과 평가 방법 설명(엔진에서 직접 측정).

기술

  • CQ2-bit
  • Cactus Quants
  • Walsh-Hadamard transform
  • Hadamard MLP
  • byte-level grammar

활용 사례

  • 스마트 홈·웨어러블·저가형 스마트폰에서의 즉시 실행 기기 제어와 툴 호출
  • 문서에서 스키마에 따라 필드 추출·폼 채우기 같은 구조화된 출력 생성
  • 오프라인·프라이버시 민감 환경에서의 로컬 명령 실행과 선택적 클라우드 에스컬레이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.