요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
이번 기간에는 실시간 음성 인식, 목표 기반 영상 검색, 카메라 제어형 월드 모델처럼 입력을 처리하는 방식 자체를 바꾸는 모델 업데이트가 이어졌습니다. Muse Voice Transcribe는 화자 분리와 발화 종료 감지를 통합했고, Gemini의 Agentic Video Understanding은 프레임·오디오·자막을 필요한 구간만 읽어 토큰 사용량을 최대 88% 줄였습니다. 에이전트 실행 환경에서는 로컬·클라우드 하이브리드 구조와 검색 우선 Research workflow가 부상했으며, SWE-bench Multimodal v2.0은 시각 자료를 읽는 코딩 에이전트 평가를 480개 과제로 확장했습니다. Atlas의 3D 장면 복원, CLIP의 공유 임베딩 공간, 모델 라우팅 비용 평가까지 멀티모달 처리와 에이전트 운영의 구체적 기준이 함께 넓어졌습니다.
1:20:54AutoGaze는 비디오의 중복 패치를 사전에 제거하여 MLLM의 연산 효율을 극대화하고 고해상도 장편 비디오 이해 성능을 향상시킨다.

비디오 생성 모델이 인간의 선호도를 맞추기 위해 실제보다 선명도를 높이는 '인스타그램 필터' 효과와 언어로 설명하기 어려운 감각 정보의 손실 문제를 다룬다.
이번 포스트 흐름은 Claude Fable 5.1의 코딩 에이전트 배포 확대, Atlas의 카메라 제어형 3D 월드 모델, 공개 가중치 기반 실시간 영상 생성에 집중됐습니다. Fable 5.1은 GitHub Copilot, Linear, DigitalOcean Inference Engine, Snowflake Cortex AI로 공급 범위를 넓혔고 반복 컨텍스트 캐시 읽기 비용 75% 절감과 기본 데이터 보존 조건이 함께 언급됐습니다. Atlas는 휴대폰 사진 몇 장에서 공간을 재구성한 뒤 카메라 이동에 맞는 영상·RGB·깊이 데이터를 생성해 Real2Sim과 로봇 시뮬레이션에 연결됩니다. 연구 에이전트의 실험 후보 선별과 출처를 보존하는 장기 메모리도 각각 AIRS-Bench와 LongMemEval·LoCoMo 수치로 비용·품질 개선을 확인했습니다.