본문으로 건너뛰기

Wan3.0 확산, Muon 최적화와 Agent 자동 평가

Wan3.0의 다중 입력 영상 생성 확장과 Muon·Hermes·Qwen Cloud의 실무 기능 변화

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Wan3.0이 여러 영상 제작 서비스에 연이어 탑재되며 네이티브 30초 생성과 텍스트·이미지·오디오·비디오·문서·웹페이지를 아우르는 다중 입력 흐름을 확장했다. Muon 관련 논문은 1.3B부터 15B 파라미터 규모의 Diffusion Transformer에서 최적화·생성 품질 이점을 확인하는 한편, 매 단계 NS5와 full-momentum materialization이 계산·통신 비용을 키울 수 있음을 짚었다. Hermes의 /review는 최근 10개 메시지와 추가 지시를 보조 모델 기반 subagent에 보내 작업 결과를 평가하게 하며, Qwen Cloud Arena는 제출물 자동 채점과 상위 30개 작업의 전문가 평가를 연결했다. 영상 생성 서비스 확산, 대규모 모델 최적화 비용 절감, Agent 평가 자동화가 서로 다른 방식으로 병렬화되는 흐름이다.

𝕏 실시간 트렌드 토픽

🔥 Wan3.0의 다중 플랫폼 영상 생성 확장포스트 23

Wan3.0이 하루 동안 여러 영상 제작 서비스에 연이어 탑재되며 네이티브 30초 생성, 다중 참조 입력, 장면·캐릭터 일관성 기능을 각 서비스의 제작 흐름에 연결했다.

세부 내용 보기
  • Wan3.0 관련 포스트 23개가 여러 플랫폼의 출시 소식을 전했으며, 공통 기능은 한 번에 최대 30초 영상을 생성하고 여러 입력 형식을 받아 장면을 구성하는 흐름입니다. 텍스트·이미지·웹 콘텐츠를 넣는 서비스부터 오디오·비디오·문서까지 받는 서비스까지 입력 범위가 플랫폼별로 확장됐습니다.
  • Runware에서는 text-to-video·frame·reference 모드를 하나의 모델로 제공하고 최대 10개 reference images, 5개 reference videos, 5개 reference audio inputs와 thinking mode를 지원합니다. Scenario에서는 첫 프레임·마지막 프레임·reference images·videos·audio·docs·URLs를 입력으로 받을 수 있고, 네이티브 동기화 오디오를 함께 출력합니다.
  • Wan3.0은 장면 사이의 motion·lighting·physical details와 캐릭터 얼굴의 일관성을 유지하는 데 초점을 둡니다. Magnific 사례는 22년의 시간, 3개 연령대, 13개 장면에서 같은 얼굴을 유지하는 영상으로 제시됐고, Segmind와 fal은 최대 1080p와 현실적인 motion을 함께 내세웠습니다.
  • 서비스별 비용·제공 방식도 달랐습니다. FlovaAI는 Wan3.0 480P를 최저 $0.013/sec로 제공하는 한정 프로모션을 열었고, RunningHub는 Web UI와 API로 제공했으며, Alibaba Cloud는 Model Studio와 Qwen Cloud API 접근 경로를 함께 안내했습니다.
원문 트윗 2개 보기

📈 Hermes /review의 보조 모델 기반 작업 평가포스트 1

Hermes에 /review용 auxiliary model 설정 기능이 추가되며, 세션의 최근 대화와 추가 지시를 별도 subagent에 보내 작업 결과를 평가하는 흐름이 마련됐다.

세부 내용 보기
  • 기존에는 작업 결과를 사람이 직접 읽고 평가하는 과정이 필요했지만, 새 /review 기능은 이 과정을 세션 명령으로 묶습니다. 사용자가 최근 작업을 기준으로 review를 요청하면 지정한 auxiliary model이 별도 subagent로 실행됩니다.
  • 처리 순서는 최근 10개 메시지와 /review 뒤에 입력한 프롬프트를 auxiliary model에 전달하고, 해당 모델이 작업물을 평가한 뒤 review를 원래 세션으로 돌려보내는 방식입니다. tonbistudio는 Desktop app과 TUI에서 서로 다른 두 프로젝트에 이 명령을 실행했습니다.
  • 동일한 기능을 수동 작업 대신 slash command로 호출할 수 있다는 점이 핵심입니다. Desktop app과 TUI를 함께 지원해 작업 환경을 바꾸지 않고 결과 평가 단계를 세션 안에 남길 수 있습니다.
원문 트윗 1개 보기

📈 Diffusion Transformer를 위한 Periodic Row-wise Muon포스트 1

Meta와 USC의 논문은 Muon의 Diffusion Transformer 규모 확장 성능을 측정하고, NS5와 full-momentum materialization의 비용을 줄이는 Periodic Row-wise Muon을 제안했다.

세부 내용 보기
  • Muon은 1.3B부터 15B 파라미터까지의 DiT 규모에서 AdamW보다 나은 최적화 및 생성 품질 이점을 유지했습니다. 다만 매 최적화 단계마다 5-step Newton–Schulz iteration인 NS5를 실행하고 full-momentum을 물질화하면 계산·통신 오버헤드가 커져 step-efficiency 이점을 상쇄할 수 있습니다.
  • Periodic Row-wise Muon은 전체 NS5 spectral update를 매 K개 단계마다 한 번 실행하고, 나머지 단계에는 현재 momentum을 이용한 저비용·저통신 row-wise constrained update를 적용합니다. 입력이 되는 momentum과 이전 갱신 주기를 활용해 전체 스펙트럼 갱신 빈도를 낮추는 구조입니다.
  • 이 방식의 의미는 모델 규모가 커질수록 커지는 최적화 단계별 계산·통신 부담을 줄이면서 Muon의 규모 확장 이점을 유지하려는 데 있습니다. 논문은 해당 방법을 1.3B~15B 파라미터 DiT 범위의 실험 맥락에서 다룹니다.
원문 트윗 1개 보기

📈 Qwen Cloud Arena의 Agent 자동 채점포스트 2

Qwen Cloud Arena가 제출한 Agent 작업물을 자동 채점하고, 최고 유효 점수와 상위 30개 작업의 전문가 평가를 연결하는 경쟁형 평가 절차를 시작했다.

세부 내용 보기
  • Agent 결과의 품질을 사람이 처음부터 모두 확인해야 하는 부담을 줄이기 위해 Qwen Cloud Arena가 자동 scoring을 도입했습니다. 참가자가 작업물을 제출하면 시스템이 기준에 따라 평가하고 결과를 통상 다음 날까지 반환합니다.
  • 참가자는 점수를 바탕으로 Agent를 수정할 수 있으며, 최종 순위에는 자신의 highest valid score가 반영됩니다. scoring criteria와 단계별 debugging guide는 Task Introduction에 함께 제공됩니다.
  • 상위 30개 작업은 expert review와 rewards 단계로 넘어갑니다. 자동 채점으로 반복적인 개선 신호를 먼저 확보하고, 제한된 전문가 평가를 상위 결과에 집중하는 구조입니다.
원문 트윗 2개 보기

용어 해설

네이티브 30초 생성(Native 30-Second Generation)
영상 클립을 여러 조각으로 이어 붙이지 않고 한 번의 생성 과정에서 최대 30초 길이로 출력하는 방식입니다. Wan3.0은 텍스트·이미지·오디오·비디오·문서·웹페이지 등을 입력으로 받아 영상과 동기화된 오디오를 함께 생성합니다.
옴니 레퍼런스(Omni-Reference)
텍스트와 이미지뿐 아니라 오디오·비디오·문서·스프레드시트·슬라이드·웹페이지까지 영상 생성의 참조 자료로 넣는 입력 방식입니다. 여러 형식의 자료를 하나의 제작 흐름에 결합해 장면과 캐릭터의 일관성을 높입니다.
주기적 행 단위 Muon(Periodic Row-wise Muon)
매 최적화 단계마다 전체 Newton–Schulz 갱신을 실행하는 대신, K개 단계마다 전체 NS5 스펙트럼 갱신을 수행하고 나머지 단계에는 현재 momentum 기반의 행 단위 갱신을 적용하는 최적화 방식입니다.
보조 모델(Auxiliary Model)
주 모델과 별도로 특정 작업을 맡는 모델입니다. Hermes의 /review 기능에서는 최근 10개 메시지와 추가 프롬프트를 보조 모델 기반 subagent에 보내고, 작업 결과에 대한 review를 다시 전달합니다.
자동 점수 산정(Automated Scoring)
제출한 Agent 작업물을 시스템이 기준에 따라 채점하고 결과를 통상 다음 날까지 반환하는 평가 절차입니다. 최고 유효 점수를 기준으로 순위를 정하며 상위 30개 작업은 전문가 평가와 보상 단계로 넘어갑니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 24.수집 2026. 08. 24.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.