TL;DR
기존 멀티모달 모델의 한계였던 '듣고 말하기'의 순차적 구조를 깨고, 실시간으로 보고 들으며 동시에 말할 수 있는 전이중(Full-Duplex) 상호작용을 구현했습니다. 9B라는 효율적인 파라미터 규모로도 온디바이스 환경에서 인간과 유사한 능동적 반응을 보여주며 차세대 AI 인터페이스의 방향성을 제시합니다.
왜 중요한가
기존 멀티모달 모델의 한계였던 '듣고 말하기'의 순차적 구조를 깨고, 실시간으로 보고 들으며 동시에 말할 수 있는 전이중(Full-Duplex) 상호작용을 구현했습니다. 9B라는 효율적인 파라미터 규모로도 온디바이스 환경에서 인간과 유사한 능동적 반응을 보여주며 차세대 AI 인터페이스의 방향성을 제시합니다.
핵심 기여
Omni-Flow 스트리밍 프레임워크
멀티모달 입출력을 공유된 시간축에 정렬하여 기존의 턴제 상호작용을 연속적인 전이중 프로세스로 전환했다. 이를 통해 모델은 생성 중에도 새로운 입력을 수용하여 응답을 실시간으로 수정할 수 있다.
TAIL: 시간 정렬 인터리빙 음성 생성
텍스트 생성 속도와 음성 재생 시간 사이의 불일치를 해결하기 위해 Time-Aligned Interleaving(TAIL) 전략을 도입했다. 누적된 재생 진행 상황에 따라 텍스트 생성량을 적응적으로 조절하여 환경 맥락과 음성 출력의 동기화를 유지한다.
효율적인 온디바이스 추론 지원
llama.cpp 기반의 llama.cpp-omni 프레임워크를 통해 12GB 미만의 RAM을 사용하는 엣지 디바이스에서도 실시간 옴니모달 상호작용이 가능하도록 최적화했다.
핵심 아이디어 이해하기
기존의 멀티모달 모델은 사용자의 입력이 끝날 때까지 기다렸다가 응답을 생성하는 '반이중(Half-Duplex)' 방식에 갇혀 있었다. 이는 Transformer 아키텍처가 입력을 모두 처리한 후 순차적으로 토큰을 생성하는 구조적 특성 때문이며, 생성 도중 발생하는 새로운 시각적/청각적 변화를 응답에 즉각 반영하기 어렵게 만든다.
MiniCPM-o 4.5는 이를 해결하기 위해 모든 모달리티를 공통된 시간축(Temporal Axis) 위에 배치한다. 마치 동영상의 프레임처럼 입력을 미세한 시간 단위(Time Chunk)로 쪼개고, 각 단위마다 [시각 입력; 청각 입력; 이전 출력]을 결합하여 다음 출력을 결정한다. 이 과정에서 모델은 명시적인 요청이 없어도 상황을 판단해 먼저 말을 거는 능동적(Proactive) 행동을 취할 수 있게 된다.
결과적으로 9B 파라미터 규모에서 Gemini 2.5 Flash에 근접하는 시각-언어 이해 능력을 확보했으며, 특히 실시간 스트리밍 환경에서 기존 모델들보다 훨씬 낮은 지연 시간과 높은 상황 적응력을 보여준다. 이는 AI가 단순한 도구를 넘어 실시간으로 세상을 공유하는 동반자로 진화하는 핵심 단계이다.
방법론
MiniCPM-o 4.5는 멀티모달 인코더, LLM 백본(Qwen3-8B), 그리고 음성 디코더가 토큰 수준에서 직접 연결된 엔드투엔드 구조를 채택했다. 시각 인코더는 SigLIP ViT를 사용하며, 고해상도 이미지를 슬라이스로 나누어 압축하는 LLaVA-UHD 전략을 통해 16배의 토큰 압축률을 달성하여 연산 효율을 높였다.
핵심 메커니즘인 Omni-Flow는 상호작용을 t초 단위의 윈도우로 분할한다. 각 윈도우 k에서 시각 토큰 v_k와 오디오 토큰 a_k를 입력받아 출력 토큰 o_k를 생성하는 방식이다. 이때 모델이 말을 하지 않아야 하는 상황이면 특수 토큰인 [listen]을 출력하도록 학습시켜, 별도의 VAD(Voice Activity Detection) 모듈 없이도 스스로 발화 시점을 결정하게 했다.
강화학습 단계에서는 GRPO를 적용하여 추론 정확도와 응답 효율성을 동시에 최적화했다. 특히 'Smooth Length Reward'를 도입했는데, 이는 정답 여부(r_i)와 응답 길이(l_i)를 입력으로 받아 적절한 길이의 정확한 응답에는 가점을 주고, 불필요하게 길거나 틀린 짧은 응답에는 감점을 부여하여 모델의 효율성을 극대화하는 방식이다.
관련 Figure

시각/청각 인코더가 LLM 백본을 거쳐 음성 디코더까지 토큰 수준에서 어떻게 연결되는지 보여준다. 모든 입력과 출력이 밀리초 단위의 공통 타임라인에 정렬되어 전이중 스트리밍이 가능함을 설명한다.
MiniCPM-o 4.5의 엔드투엔드 옴니모달 아키텍처 다이어그램이다.
주요 결과
시각-언어 이해 벤치마크인 OpenCompass에서 평균 77.6점을 기록하며 InternVL3.5-8B 등 유사 규모 모델을 능가했으며, Gemini 2.5 Flash와 대등한 수준의 성능을 보였다. 특히 문서 이해 및 OCR 성능을 측정하는 OmniDocBench에서는 영문 0.109, 중문 0.162의 점수로 기존 SOTA 모델들을 압도했다.
실시간 스트리밍 평가인 LiveSports-3K-CC 벤치마크에서는 54.4%의 승률을 기록하여 기존 스트리밍 VLM 대비 약 8.8~12.9% 포인트 높은 성능 향상을 입증했다. 이는 Omni-Flow 프레임워크가 연속적인 시각 흐름 속에서 맥락에 맞는 응답을 생성하는 데 효과적임을 의미한다.
효율성 측면에서는 NVIDIA RTX 4090 GPU에서 INT4 양자화 적용 시 초당 212.3 토큰의 처리량과 0.58초의 첫 토큰 지연 시간을 달성했다. 이는 30B 규모의 경쟁 모델인 Qwen3-Omni보다 약 1.4배 빠른 속도이며 메모리 사용량은 절반 수준(11GB)에 불과하다.
관련 Figure

MiniCPM-o 4.5가 시각 이해, 음성 대화, 실시간 스트리밍 등 전 영역에서 Gemini 2.5 Flash에 근접하거나 Qwen3-Omni를 능가하는 성능을 보여줌을 시각화한다. 특히 실시간 상호작용 능력을 나타내는 Omni-Modal Live Streaming 영역에서 압도적인 우위를 점한다.
MiniCPM-o 4.5와 주요 경쟁 모델들의 다양한 멀티모달 능력을 비교한 레이더 차트이다.
기술 상세
전체 아키텍처는 약 9.34B개의 파라미터로 구성되며 bfloat16 정밀도를 기본으로 사용한다. LLM 백본은 Qwen3-8B를 기반으로 하며, 시각 인코더(SigLIP 0.4B)와 오디오 인코더(Whisper 0.3B)가 각각의 프로젝터를 통해 백본에 연결된다. 음성 생성은 경량화된 Llama 기반 음성 토큰 디코더(0.3B)와 스트리밍 Flow-matching 디코더가 담당한다.
학습 과정은 3단계로 진행된다. 1단계에서는 Whisper 인코더와 LLM 백본을 정렬하는 음성 사전 학습을 수행하고, 2단계에서는 시각-언어, 음성, 옴니모달 데이터를 혼합하여 전 파라미터를 공동 학습(Joint Pretraining)한다. 마지막 3단계에서는 고품질의 인간 주석 데이터를 활용해 지시어 이행 능력을 강화하는 미세 조정을 거친다.
특히 TAIL(Time-Aligned Interleaving) 전략은 추론 시 텍스트 토큰과 음성 토큰을 적응적으로 배치한다. k번째 시간 청크에서 모델은 이전 청크의 음성 재생 지연을 계산하고, 현재 청크에서 생성할 텍스트 양을 조절하여 음성 출력이 실제 환경의 타임라인을 앞지르거나 뒤처지지 않도록 제어한다.
관련 Figure

제안된 Smooth Length Reward(Ours)가 기존 Kimi K1.5 방식보다 학습 안정성이 높고 최종 정확도가 우수함을 보여준다. 이는 불필요한 추론 과정을 줄이면서도 성능 저하를 막는 효율적인 보상 설계의 중요성을 입증한다.
강화학습 과정에서 서로 다른 길이 보상 전략에 따른 학습 정확도 변화 그래프이다.
한계점
실시간 스트리밍 상호작용의 안정성과 견고함은 여전히 개선의 여지가 있으며, 특히 영어와 중국어 사이의 음성 혼합이나 발음 오류가 간헐적으로 발생할 수 있다. 또한 복잡한 환경에서의 장기적인 계획 수립 및 자가 주도적 행동은 아직 기초적인 수준에 머물러 있다.
실무 활용
MiniCPM-o 4.5는 저사양 엣지 디바이스에서도 구동 가능한 고성능 옴니모달 모델로, 실시간 대화형 서비스에 즉시 적용 가능하다.
- 시각 장애인을 위한 실시간 주변 상황 설명 및 안내 보조
- 지연 시간 없는 실시간 다국어 동시통역 서비스
- 사용자의 행동을 관찰하며 적시에 조언을 제공하는 AI 개인 코치
- 저사양 임베디드 장치 기반의 지능형 보안 및 모니터링 시스템
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Full-Duplex
- — 데이터의 송신과 수신이 동시에 이루어지는 통신 방식이다. AI 상호작용에서는 모델이 사용자의 입력을 듣는 동시에 실시간으로 응답을 생성하고 수정할 수 있는 능력을 의미하며, 기존의 턴제(Turn-based) 방식보다 인간에 가까운 대화를 가능하게 한다.
- Omni-Flow
- — 멀티모달 입력과 출력을 공통된 시간축(Temporal Axis)에 정렬하는 통합 스트리밍 프레임워크이다. 연속적인 상호작용을 미세한 시간 윈도우로 분할하여 처리함으로써, 모델이 실시간으로 새로운 신호를 수용하고 즉각적인 반응을 보일 수 있도록 지원한다.
- Token-level Continuous Connection
- — 멀티모달 인코더, LLM 백본, 음성 디코더를 토큰 단위의 히든 스테이트로 직접 연결하는 구조이다. 이를 통해 모든 모달리티 간의 그래디언트 전파와 공동 최적화가 가능해지며, 정보 손실 없이 실시간 스트리밍 상호작용을 구현할 수 있다.
- GRPO
- — 개별 보상 모델 대신 그룹 내 응답들의 상대적 점수를 활용하여 정책을 업데이트하는 강화학습 기법이다. MiniCPM-o 4.5에서는 추론 능력 향상과 응답 길이 최적화를 위해 이 기법을 적용하여 효율적인 학습을 달성했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.