TL;DR
이번 기간에는 실시간 음성 인식, 목표 기반 영상 검색, 카메라 제어형 월드 모델처럼 입력을 처리하는 방식 자체를 바꾸는 모델 업데이트가 이어졌습니다. Muse Voice Transcribe는 화자 분리와 발화 종료 감지를 통합했고, Gemini의 Agentic Video Understanding은 프레임·오디오·자막을 필요한 구간만 읽어 토큰 사용량을 최대 88% 줄였습니다. 에이전트 실행 환경에서는 로컬·클라우드 하이브리드 구조와 검색 우선 Research workflow가 부상했으며, SWE-bench Multimodal v2.0은 시각 자료를 읽는 코딩 에이전트 평가를 480개 과제로 확장했습니다. Atlas의 3D 장면 복원, CLIP의 공유 임베딩 공간, 모델 라우팅 비용 평가까지 멀티모달 처리와 에이전트 운영의 구체적 기준이 함께 넓어졌습니다.
𝕏 실시간 트렌드 토픽
📈 Muse Voice Transcribe, 화자 분리와 발화 종료 감지를 통합한 실시간 음성 인식포스트 4
Meta Superintelligence Labs가 실시간 streaming speech-to-text 모델 Muse Voice Transcribe를 공개했습니다. 20명 이상 화자 분리, 다국어 code-switching, endpointing을 한 모델에서 처리하며 공개 벤치마크와 속도·정확도 절충 지표를 겨냥합니다.
세부 내용 보기
- Muse Voice Transcribe는 실시간 음성 입력을 텍스트로 바꾸는 과정에 화자 식별과 발화 종료 감지를 함께 넣어, 별도 단계로 화자 구간과 종료 시점을 조합하던 처리를 단일 모델 안에서 수행합니다. Meta Superintelligence Labs는 이를 streaming speech-to-text 분야의 SOTA로 설명했고, 20명 이상 화자와 다국어 code-switching을 지원한다고 밝혔습니다.
- 모델은 언어·키워드·문맥 biasing으로 인식 결과를 보정하고 adaptive delay로 최종 전사까지 걸리는 시간과 정확도의 절충점을 조정합니다. Meta의 게시물에 따르면 Artificial Analysis streaming speech-to-text 순위와 공개 diarization 벤치마크에서 1위를 기록했으며, Meta Model API·Meta AI for Mac·Muse Code에서 이용할 수 있습니다.
원문 트윗 2개 보기

Mark Zuckerberg
Muse Voice Transcribe is MSL's first real-time audio perception model -- rolling out today. SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model.

AI at Meta
Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelligence Labs. Muse Voice Transcribe delivers real-time streaming ASR, diarization with 20+ speakers, and endpointing. It’s multilingual with seamless code-switching and improves accuracy with language, keyword, and context biasing. The model ranks first on @ArtificialAnlys streaming speech-to-text and on public diarization benchmarks.
📈 Gemini의 Agentic Video Understanding, 필요한 프레임만 찾아 토큰 사용량 최대 88% 절감포스트 2
Google은 Gemini의 영상 처리를 고정된 초당 1프레임 입력에서 목표 기반 탐색 방식으로 확장했습니다. 에이전트가 시각 프레임·오디오·자막을 검색하고 흥미로운 구간을 높은 프레임률로 재검사해 긴 영상 질의와 순간 장면 검색을 처리합니다.
세부 내용 보기
- 기존 정적 영상 처리는 영상을 초당 1프레임으로 읽어 짧은 컷이나 반복 행동을 놓칠 수 있었습니다. Agentic Video Understanding은 먼저 목표에 맞는 구간을 검색한 뒤 시각 프레임, 오디오, 자막을 함께 확인하고 이상 징후가 있는 창만 높은 프레임률로 다시 샘플링합니다.
- 이 입력→탐색→재검사 흐름은 multi-hour 영상 질의, sub-second retrieval, anomaly detection, 반복 행동·객체 counting에 맞춰 읽는 양을 조절합니다. Google은 정적 영상 처리 대비 토큰 소비량을 최대 88% 줄이고 정확도를 높였다고 밝혔으며, Gemini 3.7 Flash·3.6 Flash·3.5 Flash-Lite와 Gemini API, Google AI Studio, Gemini Enterprise Agent Platform에서 제공됩니다.
원문 트윗 2개 보기
Google for Developers
Tired of high token costs for video workflows? Agentic video understanding gives Gemini the tools to dynamically search, scan, and inspect target video segments to achieve its goal. Building on agentic vision, Gemini now actively scans visual frames, audio, and transcripts instead of ingesting video at a static 1 FPS. This reduces token consumption by up to 88%, improves accuracy, and unlocks new ways to process long-form video. Tackle complex video workflows like: ▸ Sub-second retrieval: Catch split-second cuts missed at 1 FPS ▸ Long-form search: Query multi-hour videos without overflowing context ▸ Anomaly detection: Resample interesting windows at higher FPS ▸ Counting: Accurately track repeated actions and objects over time See how agentic video understanding transforms token efficiency in Gemini 3.7 Flash when compared with static video processing:
Google for Developers
Agentic video understanding is supported by Gemini 3.7 Flash, 3.6 Flash and 3.5 Flash-Lite and is available today for video uploads and @YouTube videos via the Gemini API on @GoogleAIStudio and Gemini Enterprise Agent Platform. More details in the blog:
📈 Atlas, 픽셀 단위 카메라 제어와 3D 장면 복원을 결합한 월드 모델포스트 2
World Labs가 이미지·비디오 프레임 생성과 3D 복원을 결합한 멀티모달 월드 모델 Atlas를 공개했습니다. 카메라를 움직여도 장면의 공간 일관성을 유지하는 구조가 영상 편집, 3D 복원, robotics 용도로 연결됩니다.
세부 내용 보기
- Atlas는 텍스트나 장면 조건을 바탕으로 이미지와 비디오 프레임을 생성하는 동시에 세계를 3D로 복원하는 모델입니다. World Labs는 이를 통해 사용자가 세계를 모델링하고 카메라를 이동시키며 공간과 시간을 시뮬레이션할 수 있다고 설명했고, pixel-perfect camera control을 핵심 특성으로 내세웠습니다.
- 관련 게시물은 Atlas를 카메라 제어 기능을 갖춘 video model로 묘사하며 장면이 거의 3D 일관성을 유지한다고 전했습니다. 생성과 reconstruction이라는 두 시각 지능 작업을 하나의 내부 base model에 결합한 설계가 영상 편집·3D reconstruction·robotics로 이어질 수 있다는 점이 제시됐습니다.
원문 트윗 2개 보기

Justin Johnson
Today we sharing Atlas, our new multimodal world model. One reason this model is so special to me is that it combines two core visual intelligence tasks I have worked on for over a decade: generation and reconstruction
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.

martin_casado
An incredible accomplishment. Think of it as a video model with full camera control. And the scene remains (nearly) 3D consistent. Built on a fully internal base model. There are many use cases, from video editing, to 3D reconstruction to robotics. Great technical blog too.
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
➖ 로컬 파일과 클라우드 에이전트를 잇는 Hybrid Compute포스트 3
Perplexity Mac app이 민감한 파일을 다루는 에이전트 단계를 위해 로컬 모델과 클라우드 실행을 조합하는 Hybrid Compute를 모든 사용자에게 확장했습니다. Grok의 24시간 클라우드 실행과 함께 에이전트의 실행 위치가 제품 경험의 핵심 조건으로 부상했습니다.
세부 내용 보기
- 에이전트가 사용자의 휴대전화에서 시작될 때 로컬 파일시스템 접근과 실행 컴퓨터의 상시 가동 여부가 문제가 됩니다. Perplexity의 Hybrid Compute는 bloodwork, tax returns, litigation files처럼 민감한 자료를 처리하는 단계에 Mac에서 실행되는 로컬 모델을 배치하고, 나머지 작업은 클라우드와 조합하는 방식입니다.
- Elon Musk는 Grok이 클라우드의 자체 컴퓨터에서 24시간 실행되므로 사용자가 노트북을 꺼도 영향을 받지 않는다고 밝혔습니다. 두 사례는 에이전트의 입력 데이터 위치와 실행 환경을 분리해, 개인정보 보호와 지속 실행을 함께 고려하는 구조로 수렴합니다.
원문 트윗 2개 보기

Aravind Srinivas
We're introducing hybrid compute for all users of the Perplexity Mac app. This will allow Computer to orchestrate local models that can run locally on Mac, particularly for agent steps involving sensitive and private files (eg your bloodwork, tax returns, litigation, etc).

Elon Musk
Grok @Bot runs on its own computer in the cloud 24/7, so it doesn’t matter if you turn off your laptop
one real issue I have with various agents now is "where is this code going to run" - does it need access to my local filesystem - can I fire it off from my phone and if so does it run on the cloud or needs my Mac mini fired up / synced? The current UX metaphors around this seem
➖ 검색을 추론과 분리한 Deep Research Agent workflow포스트 1
LangChain Deep Agents와 Liner를 결합한 Research Agent 사례가 검색 우선 구조를 제시했습니다. 검색 계층은 원자료를 모으고 에이전트는 계획·비교·합성·인용을 맡아 출처 기반 보고서를 생성합니다.
세부 내용 보기
- Research Agent는 Research → Plan → Search → Collect sources → Synthesize → Cite → Save report 순서로 작업을 나눕니다. Liner는 제목·URL·설명·날짜가 포함된 구조화 검색 결과를 반환하고, LangChain Deep Agents 기반 에이전트는 검색 API에 최종 답변 생성을 맡기지 않고 검색 결과의 중요도 판단과 근거 연결을 수행합니다.
- 최종 답변의 각 주장에는 검색 결과의 출처가 연결되고, 완성된 보고서는 내려받을 수 있는 Markdown artifact로 저장됩니다. Deep Agents UI에서는 연구 계획, 검색 호출, 검색된 출처, 최종 합성 과정을 확인할 수 있어 검색과 추론의 경계를 실행 기록으로 남깁니다.
📈 SWE-bench Multimodal v2.0, 시각 자료를 읽는 코딩 에이전트 480개 과제포스트 2
SWE-bench Multimodal v2.0이 스크린샷·다이어그램·녹화 자료를 해석해야 하는 코딩 에이전트 평가를 480개 과제로 공개했습니다. JavaScript·HTML·CSS 저장소의 버그 진단과 수정이 평가 범위에 들어갑니다.
세부 내용 보기
- 기존 저장소 수정 과제와 달리 SWE-bench Multimodal은 코딩 에이전트가 시각 자료를 입력으로 받아 문제 상황을 파악해야 합니다. 에이전트는 스크린샷, 다이어그램, recordings를 읽고 저장소의 버그 원인을 진단한 뒤 코드 변경으로 수정 결과를 내야 합니다.
- 이번 공개판에는 480개 과제가 포함됐고 JavaScript·HTML·CSS가 대상 언어로 언급됐습니다. 해당 인스턴스는 1년 넘게 비공개였으나 이제 공개됐으며, Anthropic이 Mythos와 Fable에서 사용한 평가를 외부 개발자도 활용할 수 있게 됐습니다.
원문 트윗 2개 보기
John Yang
Releasing SWE-bench Multimodal v2.0 today 480 tasks where a coding agent must interpret visual assets like screenshots, diagrams, recordings to diagnose and fix a bug in a repository.
We made SWE-bench Multimodal more than a year ago, but the instances were never public- now they are! 480 new tasks, JavaScript/HTML/CSS. Anthropic has used it in Mythos and Fable, and now you can too.
➖ CLIP의 공유 임베딩 공간, 문장과 이미지 비교를 하나의 내적으로 축약포스트 1
CLIP의 텍스트·이미지 정렬 과정을 작은 배치 예제로 풀어 쓴 기술 설명이 확산됐습니다. 두 입력을 각각 인코딩하고 같은 2D 공간으로 투영한 뒤 모든 문장·이미지 조합의 내적과 양방향 loss를 계산하는 흐름입니다.
세부 내용 보기
- CLIP의 목표는 문장과 그림을 같은 embedding space에 배치하는 것입니다. 텍스트는 단어 벡터에서 시작하고 이미지는 patch를 숫자 배열로 바꾼 뒤 각각 encoder와 mean pooling을 거쳐 하나의 벡터로 축약하며, 서로 다른 차원의 벡터는 projection layer로 같은 2D 공간에 맞춥니다.
- 공유 공간에 들어온 뒤 text vector와 image vector의 모든 조합에 dot product를 적용해 문장·그림 대응 점수를 만들고, softmax를 양방향으로 정규화합니다. 정답 쌍은 identity matrix의 1, 나머지는 0으로 두어 두 입력이 맞게 연결되도록 loss gradient를 계산하며, 원본 학습에는 400 million개의 텍스트·이미지 쌍이 사용됐다고 설명됐습니다.
➖ 에이전트 비용을 줄이는 Model Routing과 Interactive Benchmark포스트 1
모든 요청에 최고가·최저가·중간급 모델을 고정 배정하는 대신 요청별 모델과 reasoning effort를 선택하는 Model Routing 접근이 공유됐습니다. 평가도 단일 호출 성능이 아니라 에이전트 작업에서 누적되는 비용을 반영하는 Interactive Benchmark로 이동합니다.
세부 내용 보기
- 최고 성능 모델만 호출하면 비용이 커지고 최저가 모델만 쓰면 품질이 떨어지며 중간급 모델을 고정해도 요청별 요구를 맞추기 어렵습니다. Router는 요청의 난도와 목표에 따라 모델과 reasoning effort를 선택해 높은 품질이 필요한 작업과 비용 민감한 작업을 분리합니다.
- 공유된 방법론은 에이전트의 반복 호출로 누적되는 비용을 측정하기 위해 interactive benchmark를 사용합니다. 해당 게시물은 여러 주요 벤치마크에서 Opus xhigh 품질을 넘으면서 비용을 20–80% 낮춘 Pareto-dominance 결과를 언급했지만, 구체적인 플랫폼명은 밝히지 않았습니다.
용어 해설
- 화자 분리(Speaker Diarization)
- — 하나의 오디오 스트림에서 여러 화자의 발화를 식별하고 화자별 구간으로 나누는 처리 방식입니다. Muse Voice Transcribe는 이를 실시간 음성 인식과 하나의 모델에서 함께 수행합니다.
- 발화 종료 감지(Endpointing)
- — 사용자의 말이 끝난 시점을 감지해 음성 입력을 텍스트로 확정하는 기술입니다. Muse Voice Transcribe는 화자 분리와 함께 이를 기본 기능으로 처리합니다.
- 에이전트형 비디오 이해(Agentic Video Understanding)
- — 영상 전체를 고정된 간격으로 읽는 대신 목표에 맞춰 프레임·오디오·자막을 검색하고 필요한 구간을 재검사하는 방식입니다. Gemini의 영상 처리에서 토큰 사용량과 검색 정밀도 개선에 쓰입니다.
- 하이브리드 컴퓨팅(Hybrid Compute)
- — 클라우드와 로컬 모델을 작업별로 나눠 실행하는 구조입니다. Perplexity Mac app은 민감한 파일을 다루는 에이전트 단계에 Mac 로컬 모델을 배치하고 나머지 처리를 클라우드와 조합합니다.
- 모델 라우팅(Model Routing)
- — 모든 요청을 같은 모델에 보내지 않고 요청별 품질·비용 요구에 맞는 모델과 reasoning effort를 선택하는 방식입니다. 정적 벤치마크보다 에이전트의 누적 비용을 반영하는 interactive benchmark와 함께 평가됩니다.
- 공유 임베딩 공간(Shared Embedding Space)
- — 텍스트와 이미지 벡터를 같은 차원 공간으로 투영해 서로 비교할 수 있게 만드는 구조입니다. CLIP은 두 입력의 벡터 내적이 문장과 그림의 대응 정도를 나타내도록 학습합니다.
- 멀티모달 월드 모델(Multimodal World Model)
- — 시각 입력을 바탕으로 이미지·비디오 프레임을 생성하고 장면을 3D로 복원하는 모델 유형입니다. Atlas는 카메라 제어와 공간·시간 시뮬레이션을 함께 겨냥합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.