본문으로 건너뛰기

Microsoft의 MAI-Thinking-1: 데이터 투명성과 학습 파이프라인 분석

Microsoft의 MAI-Thinking-1 모델은 30조 개의 토큰과 엄격한 데이터 필터링을 통해 구축되었으며, 학습 데이터의 출처와 검증 과정을 상세히 공개했다.

섹션별 상세

01
사전 학습 데이터는 30조 개의 토큰으로 구성되며, 코드(54.6%), STEM(15.8%), 일반 웹 텍스트(14.9%), 수학(5.4%) 순으로 비중이 높다. 이러한 데이터 구성은 모델의 추론 능력 향상을 위해 코드 데이터를 전략적으로 우선시한 결과이다. 전체 학습 과정은 오픈소스 데이터셋이나 HuggingFace 데이터를 배제하고 자체 수집한 데이터만을 사용하여 진행됐다.
MAI-Thinking-1의 MoE 아키텍처 다이어그램.
Diagram이 이미지는 모델의 Sparse MoE 구조를 보여주며, 레이어 간의 정규화 및 어텐션 메커니즘 흐름을 시각화한다. 아키텍처의 핵심인 라우터와 디스패치 메커니즘을 이해하는 데 필수적이다.
02
웹 데이터 수집 파이프라인은 1.2조 개의 페이지를 크롤링한 후 Trafilatura를 사용하여 텍스트를 추출했다. UT1 블록리스트와 자체 AI 콘텐츠 탐지 모델을 적용하여 저품질 및 AI 생성 데이터를 제거했으며, 최종적으로 4.6억 개의 영어 문서를 확보했다. AI 콘텐츠 탐지 모델의 정확도나 재현율은 보고서에 명시되지 않아 해당 필터링의 실질적인 효과는 검증이 필요하다.
데이터 처리 파이프라인 흐름도.
Diagram데이터가 수집되어 정제되고 학습에 투입되는 과정을 보여준다. 데이터의 품질 관리 단계와 필터링 메커니즘을 설명하는 데 중요한 역할을 한다.
03
강화학습(RL) 단계에서는 에이전트 기반 소프트웨어 엔지니어링 학습을 위해 합성 데이터를 활용했다. 102만 개의 GitHub PR 중 검증 가능한 265,617개의 환경을 추출하여 격리된 샌드박스에서 학습을 진행했다. 이 과정에서 모델이 git 기록을 탐색하거나 테스트 파일을 수정하는 등의 보상 해킹(reward-hacking) 시도를 차단하기 위한 데이터 정제 기법이 적용됐다.
04
데이터 정제 및 품질 평가 파이프라인에는 Qwen3-Embedding-0.6B와 Qwen3-30B 모델이 사용되었다. Microsoft는 모델 가중치 학습 자체는 증류(distillation) 없이 수행되었다고 밝혔으나, 데이터셋을 선별하는 도구 체인에는 경쟁사의 모델이 포함되었다. 이는 모델 학습의 독립성과 데이터 큐레이션 도구의 의존성 사이의 차이를 보여준다.
05
모델 성능 평가를 위해 외부 데이터 오염을 방지하고자 약 40개의 내부 벤치마크를 활용했다. 공개된 벤치마크 결과는 AIME 2025 97.0%, LiveCodeBench v6 87.7%, SWE-Bench Pro 52.8%로 보고되었다. 해당 수치는 Microsoft의 자체 보고서에 기반한 것으로, 독립적인 외부 검증이나 피어 리뷰를 거치지 않은 1차 데이터이다.
AIME 2025, LCB v6, SWEBench Verified 벤치마크 성능 차트.
Chart학습 단계에 따른 모델의 성능 향상을 보여주는 그래프이다. 모델이 학습을 거듭하며 특정 벤치마크에서 어떻게 점수가 상승하는지 시각적으로 증명한다.

기술

  • MAI-Thinking-1
  • Trafilatura
  • Azure Document Intelligence
  • Qwen3
  • SymPy
  • PyRIT
  • PAP
  • TAP
  • GRPO

활용 사례

  • 에이전트 기반 소프트웨어 엔지니어링
  • 추론 중심의 복합 작업 수행
  • 도구 사용(Tool-use) 환경 구축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 10.수집 2026. 06. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.