본문으로 건너뛰기

실시간 상호작용과 장기 작업을 결합한 Gander

Gander는 Cerebellum이 실시간 대화를 맡고 Brain이 비동기 장기 작업을 수행하도록 분리한 Full-Duplex Omni Interaction Agent입니다.

용어 해설

Full-Duplex Interaction
사용자가 말하는 동안 모델이 계속 입력을 듣고 동시에 응답을 생성하는 상호작용 방식입니다. Gander는 오디오·비디오·텍스트를 시간순 chunk로 묶고, 각 chunk에서 listen·speak·interrupt 중 하나를 예측해 발화 시점과 중단 여부를 모델 내부에서 결정합니다. 외부 음성 구간 감지기에만 의존하지 않는 점이 핵심입니다.
에이전트 오케스트레이션 런타임(Agent Orchestration Runtime)
실시간 상호작용 모델과 장기 작업을 수행하는 백엔드 에이전트 사이에서 입력 전달, 작업 상태, 실행 이벤트, 권한, 결과 전달을 관리하는 조정 계층입니다. Gander에서는 task_start·task_send·task_resolve 요청을 검증하고, 비동기 작업을 Project·Task·Run·WorkerEvent·Delivery 단위로 추적합니다.
슬라이딩 컨텍스트 윈도우(Sliding Context Window)
고정된 크기의 최근 대화 문맥만 유지하고 오래된 항목을 순차적으로 제거하는 방식입니다. Gander는 1초 단위 chunk를 최대 128개까지 보관해 약 2분의 상호작용을 유지하며, 새 chunk가 들어오면 가장 오래된 chunk를 삭제해 추론 비용과 메모리 증가를 제한합니다.
스트리밍 Flow-Matching Decoder(Streaming Flow-Matching Decoder)
이산 음성 토큰을 연속 음성 파형으로 바꾸는 음성 디코더입니다. Gander는 텍스트 기반 LLM이 의미를 계획하고 별도의 음성 토큰 디코더가 음성 단위를 생성한 뒤, Flow-Matching Decoder가 mel-spectrogram과 파형을 chunk 단위로 복원합니다. 전체 문장을 기다리지 않고 오디오를 순차 출력하는 구조입니다.
Backchannel
상대방의 발화를 이어가도록 짧게 반응하는 맞장구입니다. Gander 학습 데이터에서는 중국어 8자 또는 영어 6단어 미만의 짧은 반응을 별도 사건으로 분류하고, 266개 중국어·170개 영어 표현을 11개 의도 범주로 구성했습니다. 질문이나 요청 성격이 강한 발화는 맞장구에서 제외합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.