본문으로 건너뛰기
r/LocalLLaMA조회 1

Qwen3.5 Omni Plus 출시: 네이티브 멀티모달 AI의 새로운 강자 등장

알리바바가 텍스트, 오디오, 비디오를 네이티브하게 처리하며 실시간 'Vibe Coding'이 가능한 Qwen3.5 Omni Plus를 공개했다.

실용적 조언

  • 긴 영상이나 오디오 데이터의 캡셔닝 및 타임스탬프 작업에 Qwen3.5 Omni Plus 활용 권장.

섹션별 상세

01
네이티브 멀티모달 아키텍처를 채택했다. 여러 모델을 이어 붙인 방식이 아니라 처음부터 텍스트, 이미지, 오디오, 비디오를 통합 처리하도록 설계됐다. 1억 시간 이상의 데이터를 학습하여 데이터 간의 유기적인 이해도를 높였다. 이는 기존의 모듈형 멀티모달 모델보다 추론 효율과 정확도 면에서 우위를 점하기 위한 전략이다.
02
강력한 오디오 및 비디오 처리 능력을 보유했다. 최대 10시간의 오디오 또는 400초 분량의 720p 비디오를 네이티브하게 처리할 수 있는 성능을 갖췄다. 113개 언어의 음성을 인식하고 36개 언어로 발화가 가능하며, 오디오 벤치마크에서 Gemini 3.1 Pro(원문 표기)를 능가하는 성적을 거뒀다. 긴 컨텍스트의 멀티모달 데이터를 처리해야 하는 워크플로우에 최적화되어 있다.
03
'Audio-Visual Vibe Coding' 기능을 선보였다. 카메라로 자신을 비추고 원하는 결과물을 말로 설명하면 즉석에서 작동하는 웹사이트나 게임을 생성한다. 시각적 피드백과 음성 지시를 실시간으로 결합하여 코딩하는 새로운 상호작용 패러다임을 제시한다. 실제 광고된 대로 작동할 경우 개발 생산성에 혁신적인 변화를 가져올 것으로 기대된다.
04
실시간 음성 제어 및 지능형 상호작용을 지원한다. 감정, 속도, 볼륨을 세밀하게 조절하는 음성 제어 기능과 소음을 필터링하고 실제 의도를 파악하는 스마트 턴테이킹 기술이 적용됐다. 짧은 샘플만으로 목소리를 복제하는 기능도 곧 출시될 예정이다. 내장된 웹 검색 및 함수 호출 기능을 통해 실무 활용도를 높였다.

용어 해설

옴니모달(Omni-modal)
텍스트, 이미지, 오디오, 비디오 등 다양한 형태의 데이터를 별도의 변환 과정 없이 하나의 모델 내부에서 직접 처리하는 방식이다. 데이터 간의 상관관계를 더 깊게 학습하여 멀티모달 이해도를 높인다.
바이브 코딩(Vibe Coding)
사용자가 카메라로 자신을 비추고 음성으로 지시하는 것만으로 실시간으로 웹사이트나 게임을 생성하는 기술이다. 시각적 맥락과 언어적 의도를 동시에 파악하여 즉각적인 결과물을 도출한다.
함수 호출(Function Calling)
LLM이 외부 API나 도구를 실행하기 위해 필요한 인자값을 구조화된 형식으로 생성하는 기능이다. 모델이 단순히 텍스트를 생성하는 것을 넘어 외부 시스템과 상호작용하게 한다.

언급된 도구

Qwen3.5 Omni Plus추천

네이티브 멀티모달 추론 및 생성

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 31.수집 2026. 03. 31.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.