cactus-compute/needle
Python0 / 0
Gemini 3.1을 증류한 26M Simple Attention Network로 로컬 미세조정과 Cactus에서 초저지연 추론을 지원한다.
TL;DR
Needle은 Gemini 3.1을 증류해 26M 파라미터 수준으로 압축한 Simple Attention Network로서 경량 장치에서의 함수 호출 인터페이스 성능을 겨냥해 설계되었다. 인코더에서 FFN을 제거하고 ZCRMSNorm, 게이트 잔차, RoPE 기반 어텐션을 조합해 연산 효율성을 확보했으며 사전학습은 16 TPU v6e로 200B 토큰을 소화하고 단일샷 함수 호출 데이터로 후학습을 짧은 시간에 마무리했다. 로컬에서 플레이그라운드를 통해 데이터 생성과 미세조정, 평가를 통합해 실험을 반복할 수 있고 Cactus 런타임에서 보고된 처리량 특성은 실시간 도구 호출 응용에 적합함을 시사한다. 공개된 가중치와 데이터 파이프라인으로 재현성과 커스터마이징이 용이하나 작은 모델 특유의 불안정성과 대화형 범위에서의 한계는 고려해야 한다.
핵심 포인트
- 전체 모델을 대폭 축소한 Simple Attention Network 설계로 26M 수준의 파라미터에서 함수 호출 성능을 확보해 동일 목적의 더 큰 모델 대비 배포 비용과 추론 지연을 크게 낮춘다. 이 설계는 인코더에서 FFN을 제거하고 ZCRMSNorm과 게이트 잔차를 결합해 연산 효율을 유지하면서 성능을 확보하도록 구조적으로 최적화되었다. 경량 모델이면서도 사전학습과 후학습 조합으로 실무적 유틸리티를 끌어낸 점이 특징이다.
- Cactus 런타임과의 통합으로 초저지연 추론이 가능하다는 점이 실사용 측면에서 큰 차별화 요소이다. README에서 보고된 prefill 및 decode 처리량은 경량 모델을 실제 서비스 환경에 배포할 때의 처리량 한계를 확장하는 역할을 한다. 또한 가중치와 데이터 생성 파이프라인을 공개해 재현성과 커스터마이징을 용이하게 했다.
- 로컬에서 미세조정하고 웹 UI로 즉시 테스트할 수 있으며 모델 가중치는 자동으로 다운로드된다. 플레이그라운드는 데이터 생성과 학습, 평가, 번들링 흐름을 통합해 단일 클릭으로 실험을 반복할 수 있다. UI 기반 접근은 도구 호출 데이터로 빠르게 튜닝할 때 작업 효율을 높인다.
- 단일 샷 함수 호출 생성 기능을 제공해 도구 이름과 인수 JSON을 직접 출력한다. README 예시처럼 tools 필드와 answers 필드를 맞춘 JSONL으로 학습하면 함수 호출 정확성을 높일 수 있다. 훈련 데이터 형식 요구사항은 각 도구당 최소 120개의 샘플을 권장한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| single-shot function call | comparative win | better than listed baselines on single-shot function call | vs FunctionGemma-270m, Qwen-0.6B, Graninte-350m, LFM2.5-350m |
3.7k
Stars
287
Forks
+208
Trending
0
조회수
3.7k watchers28 open issuesMIT License
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.