pipecat-ai/phonellm-alpha-1
음성 에이전트용 텍스트 생성30B (3.5B active)262K 컨텍스트bsd-2-clause
NVIDIA Nemotron 3 Nano 30B 기반으로 도구 호출 정확도와 저지연성을 극대화한 음성 에이전트 전용 오픈 웨이트 모델.
학습 방식 · NVIDIA Nemotron 3 Nano 30B-A3B 기반, NVIDIA NeMo 프레임워크를 사용한 풀 파라미터 SFT(Supervised Fine-tuning) 적용.
TL;DR
PhoneLLM Alpha 1은 NVIDIA Nemotron 3 Nano 30B-A3B를 기반으로 음성 에이전트의 도구 호출 정확도와 낮은 지연 시간을 위해 풀 파라미터 SFT를 거친 오픈 웨이트 모델이다. 기존 범용 모델들이 생각(thinking) 토큰 생성으로 인해 발생하는 긴 응답 지연 문제를 해결하기 위해, 도구 호출에 특화된 학습을 수행하여 즉각적인 반응이 필요한 음성 대화 환경에 최적화했다. PhoneBench v1 벤치마크에서 대형 모델과 대등한 정확도를 보이면서도 비용을 94% 절감하고 P95 지연 시간을 1,300ms 단축하여, 기업이 자체 인프라에서 효율적인 음성 에이전트를 구축할 수 있도록 지원한다.
핵심 포인트
- NVIDIA Nemotron 3 Nano 30B 기반으로 튜닝하여 낮은 지연 시간과 높은 도구 호출 정확도를 확보함.
- 생각(thinking) 토큰 없이도 복잡한 다중 턴 대화에서 정확하게 도구를 호출하여 고객 응대 효율을 높임.
- PhoneBench v1 기준 GPT-5.6 Terra와 대등한 성능을 내면서도 비용은 94% 절감하고 P95 지연 시간을 1,300ms 단축함.
- 오픈 웨이트 모델로 인프라를 직접 제어할 수 있어 음성 에이전트 서비스의 비용과 성능 최적화에 유리함.
제한사항
- 영어 전용 모델로 다국어 지원이 제한됨.
- 최적의 성능을 위해 temperature=0 설정과 thinking 기능 비활성화가 필수적임.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| PhoneBench v1 | Accuracy | 72.3% | GPT-5.6 Terra(72.4%)와 유사, Claude Sonnet 5(68.9%) 대비 우위 |
이미지 분석




110
LIKES
64
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.