본문으로 건너뛰기

Muse Spark 1.3이 Frontier Model 경쟁에 합류

Muse Spark 1.3이 Agent·Coding 성능과 90% 이상 할인 가격으로 Frontier Model 경쟁을 압축했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 AINews Roundup은 Meta의 Muse Spark 1.3이 Agent와 Coding 작업에서 GPT-5.6-Sol·Opus 5급 성능을 겨냥하면서도 학습 허용 여부에 따라 90% 이상 낮은 가격을 제시한 소식을 중심에 둡니다. Stanford는 Agent Skills, Context Engineering, MCP, Evaluation, Orchestration을 포함한 AI-native Software Engineering 교육으로 교과과정을 재편했고, HarnessDev와 Skill Retrieval 연구는 Agent의 실행 구조와 실제 사용 효과를 별도로 평가해야 한다는 점을 드러냅니다. Astra로 거론된 Looped Transformer는 층 재사용으로 저장량을 줄이는 대신 계산량을 늘리는 절충안이며, Gemini 3.8 Flash Cyber·Wan 3.0·Spark-X2.5·Qwen3.8 관련 소식은 Benchmark 성능과 실제 개발 환경의 속도·지원 범위·계정 위험 사이에 여전히 차이가 있음을 보여줍니다.

섹션별 상세

01
Meta의 Muse Spark 1.3은 Agent와 Coding 작업, 긴 작업 흐름, 복잡한 지시 준수를 겨냥한 모델로 출시됐으며 GPT-5.6-Sol과 Opus 5에 가까운 비교 수치를 내세웁니다. 공개된 표에서는 Agentic IF Index 57.8, DeepSearchQA 89.4, MRCR 512K–1M 98.1, DeepSWE v1.1 75.4를 기록했고 일부 항목에서는 경쟁 모델과 비슷하거나 앞섰습니다. API 가격은 학습에 데이터 사용을 허용하는 `muse-spark-1.3-contributor`에서 입력 1M 토큰당 $0.10, 일반 `muse-spark-1.3`에서 $1.25로 제시되어 사용 조건에 따라 90% 이상 차이가 납니다.
Muse Spark 1.3과 Muse Spark 1.2, GPT-5.6-Sol, Opus 5의 Agent·Long Context·Coding Benchmark 비교표입니다.
Chart표는 Muse Spark 1.3이 MRCR 256K–512K에서 98.5, MRCR 512K–1M에서 98.1을 기록해 Long Context 항목에서 높은 점수를 보이는 장면을 담고 있습니다. Agent 항목에서는 DeepSearchQA 89.4, JobBench 64.9, OSWorld 2.0 66.9가 제시됐고, Coding에서는 DeepSWE v1.1 75.4와 SWEAtlas CodeBase QnA 59.4가 표시됩니다. 기사에서 강조한 긴 문맥 처리와 Agent·Coding 경쟁력을 수치로 직접 연결하는 자료입니다.
Artificial Analysis Intelligence Index에서 여러 LLM의 종합 점수를 비교한 막대그래프입니다.
Chart그래프는 Muse Spark 1.3(max)이 62점으로 표시되며 Claude Opus 5(max)와 GPT-5.6-Sol(max), Qwen 계열 등 여러 모델이 나란히 비교됩니다. 축과 항목은 Artificial Analysis Intelligence Index의 종합 순위를 나타내며, 일부 모델은 아직 평가 자료가 없다는 표시가 붙어 있습니다. 기사에서 Muse Spark 1.3을 Frontier Model 경쟁 구도에 배치하는 근거로 활용되는 시각 자료입니다.
Muse Spark 1.3의 학습 허용 여부에 따른 API 입력 및 Cached Input 가격표입니다.
Screenshot표는 두 가지 API 요금제를 비교하며 두 모델 모두 1M Context를 지원하는 것으로 표시합니다. `muse-spark-1.3-contributor`는 제품 개선을 위한 데이터 사용에 동의하는 조건에서 Input $0.10, Cached Input $0.002이고, 일반 `muse-spark-1.3`은 제품 개선에 사용되지 않는 조건에서 각각 $1.25와 $0.15입니다. 학습 데이터 제공 여부를 가격 차등의 기준으로 삼았다는 기사의 핵심 내용을 구체적인 수치로 뒷받침합니다.
02
Stanford의 Software Engineering 교육은 단순한 Prompting에서 Agent 시스템 구축으로 초점을 옮깁니다. The Modern Software Developer 과정은 기존 Fall 2025 내용의 85%를 Agent Skills, Context Engineering, MCP Portals, Agent-ready Codebase Design, Agentic Code Review, Security, Parallel Background Agents, Software Factories로 교체하고 실제 OSS 저장소에 PR을 제출하게 합니다. CS329Z: Engineering AI Agents도 Agent를 처음부터 만들면서 Harness, Evaluation, Memory, Tooling, Orchestration을 다루므로 모델 호출보다 실행 시스템 설계가 핵심 역량으로 이동하는 흐름을 드러냅니다.
03
Looped Transformer는 같은 Transformer 층을 반복 사용해 파라미터 저장량을 늘리지 않고 계산 깊이를 키우는 구조입니다. Nanbeige 4.2-3B는 22개 층을 두 번 재사용해 44층처럼 처리하지만 메모리 사용량은 비슷한 대신 계산량이 대략 두 배가 되며, Mixture-of-Recursions는 Router가 토큰별 반복 횟수를 조절해 쉬운 토큰의 조기 종료를 가능하게 합니다. 이 구조가 자동으로 Chain-of-Thought를 숨기는 것은 아니며, 중간 토큰을 덜 출력하고 내부 Activation에서 계산을 더 수행하기 때문에 겉으로 드러나는 추론 흔적이 줄어들 수 있습니다.
04
HarnessDev는 Agent의 작업 성공만 보지 않고 모델이 실행 가능한 초기 Harness를 만든 뒤 후속 피드백으로 개선하는 과정을 평가합니다. 여섯 개 Creator LLM, 네 개 Domain, 2,207개 Held-out Instance에서 생성된 Harness는 Code·Search·Research에서는 성숙한 사람이 만든 시스템에 뒤졌지만 Writing·ML Experimentation에서는 비슷하거나 앞섰고, 성능과 실행 토큰 비용을 함께 점수화했습니다. Skill Retrieval 연구도 17개 LLM의 Coding·Math 작업을 같은 조건으로 비교해 Retrieval이 전체 점수는 높여도 실제 Retrieval이 발생한 동일 작업에서는 효과가 음수일 수 있음을 지적합니다.
05
Google의 Gemini 3.8 Flash Cyber는 Flash 수준의 속도와 가격을 유지하면서 Cybersecurity 작업을 겨냥한 특화 모델로 제시됐습니다. 글에 인용된 수치는 CyberGym 86.2%, CWE-Bench Patching 47.2%, 20개 Programming Language를 대상으로 한 내부 취약점 탐지 평가 70% 이상입니다. 그러나 Google 계정과 연결된 Cloud 계정까지 영향을 줄 수 있는 Ban 위험, Harness와 Third-party Integration의 불편, 느린 Tool Call 중심 Coding 흐름에 대한 개발자 경험은 Benchmark 점수만으로 실제 사용성을 판단하기 어렵게 만듭니다.
06
Video와 Multimodal Model 경쟁도 가격·입력 범위·실시간성 중심으로 확장됩니다. Alibaba의 Wan 3.0은 Text, Image, Video, Audio, Document, Web Page를 Reference로 받고 Native Audio와 최대 30초 1080p 생성을 지원하며 Artificial Analysis Leaderboard에서 Audio 포함 Video Editing 1위, Text-to-Video 2위, Image-to-Video 5위를 기록했습니다. Spark-X2.5-1.7B와 4B는 약 20T Tokens 학습, Native 1M Context, Full Attention과 Sliding-window Attention 혼합 구조를 내세우지만 llama.cpp 지원이 아직 완전히 통합되지 않아 독립 검증과 Runtime 호환성이 남은 과제입니다.
07
Open Model과 로컬 추론 생태계에서는 대규모 학습과 Decoding 최적화가 동시에 진전됩니다. Marin 535B-A23B는 Jen-Hsun and Lori Huang Foundation의 Compute 지원과 CoreWeave 인프라로 학습을 진행 중이며, Palmimo DevKit은 몇 줄의 Python으로 제어할 수 있는 교체형 AI Brain 기반 Tabletop Robot을 지향합니다. Qwen3.8-Flash-Next-GGUF의 Multi-Token Prediction은 llama.cpp 최적화 이후 Code 처리량을 123 tok/s에서 183 tok/s로, Prose 처리량을 83 tok/s에서 144 tok/s로 높였지만 SSD Offload와 하드웨어별 성능 편차는 여전히 확인이 필요합니다.

용어 해설

최첨단 모델(Frontier Model)
AI 업계에서 성능 최상위권을 겨냥해 대규모 학습과 추론 자원을 투입한 모델을 뜻합니다. 이 글에서는 Muse Spark 1.3을 GPT-5.6-Sol과 Opus 5 같은 모델과 비교하는 기준으로 쓰이며, Agent 작업·Coding·Long Context 성능과 가격이 함께 평가됩니다.
에이전트 하네스(Agent Harness)
AI Agent가 도구를 호출하고 상태를 관리하며 작업을 끝까지 수행하도록 감싸는 실행 구조입니다. HarnessDev처럼 모델이 하네스 자체를 만들고 개선하는 접근에서는 작업 성공률뿐 아니라 실행에 소비한 토큰도 함께 평가해 설계의 효율성을 측정합니다.
반복형 Transformer(Looped Transformer)
Transformer 층을 한 번만 통과시키지 않고 같은 층 묶음을 여러 차례 재사용하는 구조입니다. Nanbeige 4.2-3B 사례처럼 파라미터 저장량은 크게 늘리지 않으면서 계산량을 증가시켜 더 깊은 처리를 수행하지만, 모든 토큰에 같은 반복 횟수를 적용하면 효율성이 제한됩니다.
재귀 혼합 구조(Mixture-of-Recursions)
학습된 Router가 토큰마다 필요한 반복 계산 횟수를 결정하는 구조입니다. 쉬운 토큰은 이른 단계에서 빠져나가고 어려운 토큰은 더 많은 Transformer 층을 통과하므로, 반복형 구조의 계산 비용을 입력 난이도에 맞춰 조절하는 방식으로 제시됩니다.
다중 토큰 예측(Multi-Token Prediction)
모델이 한 번에 다음 토큰 하나만 예측하는 대신 여러 미래 토큰을 초안으로 생성해 Decoding 속도를 높이는 기법입니다. 글에서는 Qwen3.8-Flash-Next-GGUF와 llama.cpp 사례를 통해 Code에서 123 tok/s에서 183 tok/s, Prose에서 83 tok/s에서 144 tok/s로 처리량이 개선된 수치를 다룹니다.

기술

  • Muse Spark 1.3
  • GPT-5.6-Sol
  • Opus 5
  • Gemini 3.8 Flash Cyber
  • Photon 2.1
  • GLM-5.3 Fast
  • HarnessDev
  • exo
  • Miles
  • SGLang
  • Wan 3.0
  • Spark-X2.5-4B
  • Spark-X2.5-1.7B
  • Qwen3.8-Flash-Next-GGUF
  • llama.cpp
  • MTP
  • CoreWeave
  • Palmimo DevKit

활용 사례

  • Agentic Coding과 장시간 작업 자동화
  • 실제 OSS 저장소를 활용한 AI-native Software Engineering 교육
  • Cybersecurity 취약점 탐지와 코드 패치
  • Text·Image·Video·Audio Reference를 활용한 Video Generation과 Editing
  • 로컬 PC에서 Privacy를 유지하는 Coding Assistant
  • Agent Harness의 자동 생성과 후속 피드백 기반 개선
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.