TL;DR
이번 기간에는 AI 모델 간 안전성 시험을 서로 공유하는 방식과 실시간 음성·영상 생성 성능이 함께 부각됐습니다. Muse 관련 게시물은 보험료 협상, IKEA 반품, 의료품 주문, 전화 예약처럼 외부 서비스와 연결된 작업을 에이전트가 연속 실행하는 사례를 늘어놓았습니다. GPT-Live-1은 Artificial Analysis Speech to Speech Index에서 81.5점으로 1위를 기록했고, MiniMax H3는 8× B200에서 768p 영상 14.4초를 9.0초에 생성했다고 제시됐습니다. Waymo의 2027년 도쿄 자율주행 호출 서비스, Alibaba Cloud의 DeepSeek-V4.1-Flash 제공과 Wan3.0의 단계적 영상 제작 흐름도 새 제품·서비스 전개로 이어졌습니다.
𝕏 실시간 트렌드 토픽
🔥 AI 기업 간 안전성 시험 harness와 동료 검토포스트 1
Anthropic과 OpenAI를 포함한 AI 기업이 서로의 모델을 같은 시험 harness로 점검해야 한다는 발언이 확산됐습니다.
세부 내용 보기
- AI 모델이 생물무기나 핵무기 제작에 협조하는지 기업마다 따로 확인하는 대신, 여러 기업이 공통 시험 harness를 상대 모델에도 적용하는 구상입니다. 게시물은 Anthropic이 OpenAI보다 AI safety에 더 많은 주의를 기울인다는 평가와 함께, 경쟁사가 서로의 모델을 시험해야 한다는 맥락을 전했습니다. 모델의 위험 행동을 사전 점검하는 절차를 기업 내부 평가에만 맡기지 않는다는 점이 핵심입니다.
AI 기업이 동일한 시험 harness로 서로의 모델을 점검하면 생물무기·핵무기 제작 같은 위험 행동을 교차 평가할 수 있다는 입장입니다.
📈 GPT-Live-1의 실시간 음성 대 음성 지수 1위포스트 1
OpenAI의 GPT-Live-1이 Astra를 위임 백엔드 모델로 사용해 Artificial Analysis Speech to Speech Index에서 81.5점으로 1위를 기록했습니다.
세부 내용 보기
- GPT-Live-1은 음성과 음성 사이를 양방향으로 처리하는 full duplex Speech to Speech 모델로 게시됐으며, 응답 생성을 Astra에 위임하는 구조가 함께 제시됐습니다. Artificial Analysis의 Speech to Speech Index에서 81.5점을 받아 Grok Voice Think Fast 2.0보다 앞섰다는 수치가 근거입니다. 음성 대화 성능을 단순 출시 소식이 아니라 동일 지수의 점수와 순위로 비교하는 흐름을 만들었습니다.
🔥 Muse의 보험·반품·의료품 주문 자동 실행포스트 6
Muse가 보험료 협상, IKEA 반품, 전화 예약, 의약품 주문처럼 외부 서비스와 이어지는 업무를 대신 처리했다는 사례가 집중됐습니다.
세부 내용 보기
- 기존 AI 사용이 답변 생성에 머물렀다면, Muse 사례에서는 사용자가 보험증권이나 요청을 넘긴 뒤 에이전트가 조건을 찾고 연락하고 구매·예약·취소까지 이어 가는 흐름이 제시됐습니다. 자동차 보험에서는 동일 보장 조건으로 연간 3,500달러 절약과 기존 보험 해지가, IKEA 반품에서는 고객센터 연락과 일정 조율이 게시됐으며 의료품 사례에서는 더 싼 경로 탐색부터 처방전 전달과 재주문까지 이어졌습니다. 서로 다른 서비스의 후속 절차를 한 작업 흐름으로 묶는 실행 범위가 이번 게시물군의 공통점입니다.
Muse가 보험, 반품, 전화, 의료품 주문의 여러 단계를 직접 이어 가면서 에이전트가 실제 생활 업무를 처리하는 형태에 가까워졌다는 입장입니다.
원문 트윗 2개 보기

Alexandr Wang
muse in 15 minutes will save 15% or more on car insurance!
Yesterday I uploaded my auto insurance policy to Meta @Muse and asked for a better rate with identical coverage. In ~5 minutes, it found a policy saving me $3,500 /year, bought it, and canceled my old one. I knew I was overpaying. I’d abandoned several attempts to switch because

Alexandr Wang
muse can handle your ikea returns!!
My @Muse just handled an entire IKEA return for me; customer service, scheduling.... The pickup guy shows up at my door and I genuinely forgot I'd even asked for it. This is what an agent is supposed to feel like.
➖ 2027년 도쿄 Waymo 자율주행 호출 서비스포스트 1
Waymo가 Nihon Kotsu Taxi와 GO와 함께 2027년 도쿄에서 완전 자율주행 ride-hailing을 시작할 계획을 발표했습니다.
세부 내용 보기
- Waymo는 도쿄에서 승객 호출형 완전 자율주행 서비스를 준비하며 Nihon Kotsu Taxi, GO와 협력한다고 게시했습니다. 서비스 시점은 2027년으로 특정됐고, 일본 승객을 맞이하겠다는 계획이 함께 제시됐습니다. 이전 기간의 도쿄 자율주행 택시 준비 흐름이 협력사와 출시 연도까지 좁혀진 사례입니다.
📈 MiniMax H3의 8× B200 실시간 영상 생성포스트 1
MiniMax H3와 SGLang·VDN-H3 조합이 8× B200에서 2배 이상의 실시간 디노이징과 768p 영상 생성을 기록했습니다.
세부 내용 보기
- MiniMax H3의 영상 생성 처리에서는 SGLang과 VDN-H3가 모델 실행을 뒷받침하고, 워밍업 이후 768p 영상 14.4초를 9.0초에 만드는 흐름이 제시됐습니다. 게시물은 2배 이상의 실시간 디노이징과 측정된 품질 저하 없음도 함께 기록했습니다. 하드웨어 구성과 처리 시간, 해상도를 한꺼번에 공개해 오픈 생태계의 최적화 성과를 수치로 비교하게 했습니다.
➖ Wan3.0의 반복형 AI 영상 제작 워크플로포스트 2
Wan3.0 관련 게시물은 완벽한 prompt 하나보다 360p부터 1080p까지 반복 생성·정제하는 제작 과정이 현실적인 영상 workflow라고 설명했습니다.
세부 내용 보기
- 게시물은 처음부터 1080p 결과를 한 번에 얻는 방식 대신 360p 생성, 480p 반복, 720p 반복, 1080p 정제, 최종 출력으로 이어지는 단계를 제시했습니다. 이 흐름에서는 각 해상도에서 결과를 확인하고 다음 단계로 올리며, prompt 하나의 완성도보다 반복적인 prototyping이 결과 제작의 중심이 됩니다. Wan3.0이 Venice ai와 Alibaba Cloud의 창작 workflow에 들어가기 시작했다는 사례가 함께 제시됐습니다.
완벽한 prompt 하나가 영상 품질을 결정한다는 관점에 반대하며, 낮은 해상도에서 시작해 반복 정제하는 과정이 실제 제작에 더 가깝다는 입장입니다.
원문 트윗 2개 보기
Alibaba Cloud
The "perfect prompt" is mostly a myth. Real AI video workflows look much more like prototyping: 360p → iterate 480p → iterate 720p → refine 1080p → final Jordan Urus from Venice ai and Johnny Mai from Alibaba Cloud on how Wan3.0 starts earning a place in a real creative workflow. AI filmmaking is becoming a process, not a prompt. Want to bring Wan3.0 to your team? Learn More → https:// docs.dingtalk.com/notable/share/ form/v011GXn451w4m72QqDQ_hERWDMS_CQCr5hT?source=link … More API access: • Model Studio: https:// click.alibabacloud.com/m/20000002017/ • Qwen Cloud: https:// click.qwencloud.com/m/20000002025/ #Wan3 #AIFilmmaking #CreativeWorkflow #VideoProduction
Wan
The "perfect prompt" is mostly a myth. Real AI video workflows look much more like prototyping: 360p → iterate 480p → iterate 720p → refine 1080p → final Jordan Urus from Venice ai and Johnny Mai from Alibaba Cloud on how Wan 3.0 starts earning a place in a real creative workflow. AI filmmaking is becoming a process, not a prompt. Want to bring Wan 3.0 to your team? Learn More → https:// docs.dingtalk.com/notable/share/ form/v011GXn451w4m72QqDQ_hERWDMS_CQCr5hT?source=link …
➖ Alibaba Cloud의 DeepSeek-V4.1-Flash 에이전트형 제공포스트 2
DeepSeek-V4.1-Flash가 Alibaba Cloud Token Plan에 들어가며 1M-token context와 에이전트형 작업용 고속 추론을 내세웠습니다.
세부 내용 보기
- Alibaba Cloud는 DeepSeek-V4.1-Flash를 에이전트형 작업에 맞춘 모델로 제공하고, 1M-token context와 fast inference, high throughput을 핵심 조건으로 제시했습니다. Token Plan에서는 월 6달러부터 시작하는 가격과 Credits 최적화·시작 절차가 함께 안내됐습니다. 긴 문맥을 유지하면서 여러 단계의 작업을 실행하는 모델 접근성을 가격 플랜과 API 제공으로 연결한 사례입니다.
원문 트윗 2개 보기
Alibaba Cloud
DeepSeek-V4.1-Flash is now on Alibaba Cloud Token Plan. Built for agentic workloads with a 1M-token context, fast inference and high throughput. Start from $6/month and learn how to optimize Credits and get started in 3 steps. Read the blog: https:// click.alibabacloud.com/m/20000003342/ More API access: • Qwen Cloud: https:// click.qwencloud.com/m/20000003358/ • Model Studio: https:// click.alibabacloud.com/m/20000003350/ #AlibabaCloud #DeepSeek #AI
Alibaba Cloud
DeepSeek-V4.1-Flash is now on Alibaba Cloud Token Plan. Built for agentic workloads with a 1M-token context, fast inference and high throughput. Start from $6/month and learn how to optimize Credits and get started in 3 steps. Read the blog: https:// click.alibabacloud.com/m/20000003342/ #AlibabaCloud #DeepSeek #AI
📈 Claude·Hermes와 로컬 모델의 음성 비서 연결포스트 1
macOS Siri 안에서 Claude를 실행한 사례와 Hermes를 통한 로컬 모델 연결 요구가 이어지며 음성 비서의 모델 공급자 확장 흐름이 나타났습니다.
세부 내용 보기
- 한 게시물은 Apple의 숨겨진 model-provider 지원과 기존 Claude Code 계정을 이용해 macOS Siri 안에서 Claude가 응답하는 오픈소스 proof of concept를 제시했으며, SIP와 AMFI 비활성화가 필요하다고 적었습니다. 이어진 반응은 Hermes를 숨겨진 model-provider로 연결해 클라우드 대신 로컬 모델을 사용하고, Hermes agent CLI를 Apple Siri와 통합하자는 방향을 제시했습니다. Siri의 음성 인터페이스를 유지하면서 뒤쪽 모델 공급자를 Claude나 로컬 모델로 바꾸는 구조가 핵심입니다.
Siri의 기존 음성 인터페이스에 Claude나 로컬 모델을 연결하면 클라우드 공급자에 덜 의존하는 개인용 AI assistant를 만들 수 있다는 입장입니다.
➖ AI 증명 자동화 이후 수학 평가의 구술 전환포스트 1
AI가 증명을 자율적으로 만들 수 있게 되면서 수학자의 역량을 논문 생산량보다 실시간 소통과 구술 방어로 평가해야 한다는 글이 공유됐습니다.
세부 내용 보기
- 게시물은 AI 시스템이 증명을 자율 생성하면 수학 논문 작성량이 인간 전문성을 안정적으로 나타내는 지표가 되기 어렵다고 전제합니다. 이에 따라 수학 공동체가 정리 생산보다 깊은 인간 이해를 기르는 데 초점을 옮기고, live communication·seminar·rigorous oral defense를 통해 이를 평가해야 한다고 요약했습니다. 자동화된 증명 생성과 인간의 이해 평가를 분리하는 직업·교육 기준의 변화가 핵심입니다.
AI가 증명을 자동 생성하는 환경에서는 논문 수보다 실시간 소통과 엄격한 구술 방어가 인간의 수학적 이해를 평가하는 기준이 되어야 한다는 입장입니다.
용어 해설
- 양방향 음성 대 음성(Full Duplex Speech to Speech)
- — 사용자의 음성과 모델의 음성이 번갈아 텍스트로 변환되는 방식이 아니라, 양쪽 음성 흐름을 동시에 처리하는 음성 대 음성 모델 구조입니다. 실시간 대화의 지연을 줄이는 데 활용됩니다.
- 에이전트형 작업(Agentic Workload)
- — 모델이 단일 답변을 생성하는 데 그치지 않고, 긴 문맥을 바탕으로 여러 단계의 도구 호출과 작업 실행을 이어 가는 처리 유형입니다. 1M-token context와 높은 처리량이 핵심 조건으로 제시됐습니다.
- 디노이징(Denoising)
- — Video generation 과정에서 잡음이 섞인 표현을 반복적으로 정제해 최종 프레임을 만드는 처리 단계입니다. MiniMax H3 관련 게시물은 8× B200에서 2배 이상의 실시간 처리와 768p 출력을 함께 제시했습니다.
- 동료 검토(Peer Review)
- — 서로 경쟁하는 AI 기업이 같은 시험 도구와 위험성 평가 항목을 사용해 모델의 행동을 교차 점검하는 절차입니다. 게시물에서는 생물무기와 핵무기 제작 여부를 시험하는 harness가 사례로 제시됐습니다.
- 음성 대 음성 지수(Speech to Speech Index)
- — 음성 대 음성 모델의 성능을 점수와 순위로 비교하는 Artificial Analysis의 평가 지수입니다. GPT-Live-1은 Astra를 위임 백엔드 모델로 사용해 81.5점으로 1위에 올랐다고 게시됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


