본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

pipecat-ai/phonellm-alpha-1

음성 에이전트용 텍스트 생성30B (3.5B active)262K 컨텍스트bsd-2-clause

NVIDIA Nemotron 3 Nano 30B 기반으로 도구 호출 정확도와 저지연성을 극대화한 음성 에이전트 전용 오픈 웨이트 모델.

학습 방식 · NVIDIA Nemotron 3 Nano 30B-A3B 기반, NVIDIA NeMo 프레임워크를 사용한 풀 파라미터 SFT(Supervised Fine-tuning) 적용.

TL;DR

PhoneLLM Alpha 1은 NVIDIA Nemotron 3 Nano 30B-A3B를 기반으로 음성 에이전트의 도구 호출 정확도와 낮은 지연 시간을 위해 풀 파라미터 SFT를 거친 오픈 웨이트 모델이다. 기존 범용 모델들이 생각(thinking) 토큰 생성으로 인해 발생하는 긴 응답 지연 문제를 해결하기 위해, 도구 호출에 특화된 학습을 수행하여 즉각적인 반응이 필요한 음성 대화 환경에 최적화했다. PhoneBench v1 벤치마크에서 대형 모델과 대등한 정확도를 보이면서도 비용을 94% 절감하고 P95 지연 시간을 1,300ms 단축하여, 기업이 자체 인프라에서 효율적인 음성 에이전트를 구축할 수 있도록 지원한다.

핵심 포인트

  • NVIDIA Nemotron 3 Nano 30B 기반으로 튜닝하여 낮은 지연 시간과 높은 도구 호출 정확도를 확보함.
  • 생각(thinking) 토큰 없이도 복잡한 다중 턴 대화에서 정확하게 도구를 호출하여 고객 응대 효율을 높임.
  • PhoneBench v1 기준 GPT-5.6 Terra와 대등한 성능을 내면서도 비용은 94% 절감하고 P95 지연 시간을 1,300ms 단축함.
  • 오픈 웨이트 모델로 인프라를 직접 제어할 수 있어 음성 에이전트 서비스의 비용과 성능 최적화에 유리함.

제한사항

  • 영어 전용 모델로 다국어 지원이 제한됨.
  • 최적의 성능을 위해 temperature=0 설정과 thinking 기능 비활성화가 필수적임.

벤치마크

벤치마크지표비교
PhoneBench v1Accuracy72.3%GPT-5.6 Terra(72.4%)와 유사, Claude Sonnet 5(68.9%) 대비 우위

이미지 분석

PhoneBench v1 리더보드에서 PhoneLLM Alpha 1의 성능, 지연 시간, 비용 효율성을 비교한 표.
PhoneLLM Alpha 1이 경쟁 모델 대비 낮은 비용과 지연 시간으로 높은 정확도를 달성했음을 보여준다. 특히 P95 지연 시간과 분당 비용 측면에서 우수한 효율성을 입증한다.
Nemotron 3 Nano 30B와 PhoneLLM 30B Alpha 1의 도구 호출 정확도 비교.
기반 모델인 Nemotron 3 Nano가 도구 호출에 실패하는 상황에서, PhoneLLM은 정확하게 create_reservation 및 close_guest_call 도구를 호출하여 대화를 완수한다.
PhoneBench의 평가 방식과 LLM 판사가 도구 호출 및 응답 스타일을 평가하는 기준.
LLM 판사가 단순히 텍스트를 비교하는 것이 아니라, 비즈니스 이름 포함 여부나 도구 호출을 통한 시간 단축 등 실질적인 에이전트의 행동을 기준으로 점수를 매기는 방식을 설명한다.
음성 에이전트의 단계별 지연 시간 예산(1,293ms)을 나타낸 표.
마이크 입력부터 스피커 출력까지의 전체 파이프라인에서 LLM의 TTFB(Time-To-First-Byte)가 650ms로 할당되어 있음을 보여주며, 전체 시스템 최적화의 중요성을 강조한다.

110

LIKES

64

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.