TL;DR
대규모 MoE 모델을 실제 하드웨어에서 후처리(post-training)할 때 메모리 병목과 통신 비중, 비효율적 커널 실행이 전체 학습 효율을 제한한다는 문제가 존재한다. 본 연구는 Ascend NPU SuperPOD 환경에서 모델-레벨 병렬성, 연산·통신 조율, 저수준 커널 최적화를 계층적으로 통합해 이 문제를 완화했다. 그 결과로 연산 활용도와 학습 안정성을 동시에 개선하여 대규모 MoE를 활용한 도메인 특화 모델 구축이 현실적인 수준으로 진입했다.
왜 중요한가
대규모 MoE 모델을 실제 하드웨어에서 후처리(post-training)할 때 메모리 병목과 통신 비중, 비효율적 커널 실행이 전체 학습 효율을 제한한다는 문제가 존재한다. 본 연구는 Ascend NPU SuperPOD 환경에서 모델-레벨 병렬성, 연산·통신 조율, 저수준 커널 최적화를 계층적으로 통합해 이 문제를 완화했다. 그 결과로 연산 활용도와 학습 안정성을 동시에 개선하여 대규모 MoE를 활용한 도메인 특화 모델 구축이 현실적인 수준으로 진입했다.
핵심 기여
계층적 최적화 프레임워크를 통한 시스템 효율성 개선
모델-레벨 병렬성, 연산과 통신의 조율, 그리고 저수준 커널 실행 최적화를 포괄하는 계층적 프레임워크를 구성했다. 이 프레임워크는 각 계층에서 발생하는 병목을 동시적으로 다루어 전체 시스템 효율을 끌어올렸다. Ascend NPU SuperPOD에서의 실험으로 실용적 이점을 확보했다.
Ascend NPU 환경에서의 MFU 개선과 성능 비교
최적화 결과로 Model FLOPs Utilization이 34.22%에 도달했고 이는 오픈소스 기준 레시피 대비 2.93배 개선한 수치이다. 이 수치는 하드웨어-소프트웨어 병목 해소의 정량적 증거로 활용되었다. 개선 과정에서 학습 안정성 역시 유지되었다.
OR 문제에 특화한 CPT 및 SFT 워크플로 구축
도메인 자원과 솔버 검증 합성 문서를 결합한 CPT와 SFT 파이프라인을 마련해 Operations Research 과제에 맞춘 학습흐름을 구현했다. 이 워크플로는 모델이 수학적 모델링과 최적화 문제의 구조를 학습하도록 설계되었다. 구축된 파이프라인은 이후 SFT 데이터 생성과 모델 미세조정에 직접 활용되었다.
솔버 검증 합성 데이터 기반의 고품질 SFT 데이터셋 확보
솔버로 검증된 합성 최적화 문서를 포함해 10K개의 고품질 SFT 샘플을 생성했다. 이 데이터는 네 가지 과제 범주와 세 가지 문제 표현을 포함하여 문제 다양성을 확보했다. 데이터 기반으로 미세조정된 모델은 수치적 성능 향상을 보였다.
OR 특화 Flash 모델의 제로샷 성능 우수성
DeepSeek-V4-Flash 기반의 특화 모델이 평가에서 평균 제로샷 Pass@1 71.81%를 기록했다. 이는 GPT-5.4-Mini와 기본 DeepSeek-V4-Flash 모델보다 각각 3.98 및 11.27 포인트 우수한 수치이다. 수치 비교는 도메인 특화 데이터와 시스템 최적화가 결합된 결과임을 시사한다.
핵심 아이디어 이해하기
대규모 MoE 모델의 후처리 과정에서 가장 큰 제약은 메모리 사용량과 통신 패턴의 비효율성이다. MoE는 많은 파라미터를 가지지만 입력마다 활성화되는 전문가가 제한되어 실제 연산과 파라미터 배치 간 불일치가 발생하고, 이로 인해 노드 간 통신과 메모리 스와핑이 성능 병목으로 작동한다. 이러한 구조적 병목은 NPU 계열의 집적된 하드웨어에서 더욱 두드러지므로 하드웨어 친화적 최적화가 필요하다. 계층적 최적화 원리는 문제를 모델-레벨 병렬성, 연산-통신 조율, 저수준 커널 최적화의 세 계층으로 분리하여 각 계층에서 병목을 해소하는 방식이다. 모델-레벨 병렬성에서는 파라미터와 전문가의 배치를 하드웨어 토폴로지에 맞춰 재배열해 불필요한 데이터 이동을 줄이고, 연산-통신 조율 단계에서는 통신을 계산과 겹치게 하거나 재구성해 대기 시간을 줄이며, 저수준 커널 단계에서는 NPU의 연산 패턴에 맞춘 커널 합치기와 메모리 접근 최적화를 적용한다. 이 접근은 단일 계층 최적화보다 상호작용하는 병목을 동시에 해결하여 전체 MFU를 끌어올리는 효과가 있다. 시스템 효율성 개선이 확보되면 후속으로 도메인 특화 학습 파이프라인을 안정적으로 운영할 수 있다. CPT 단계는 도메인 자료와 합성 데이터를 결합해 모델이 도메인 특성을 사전적으로 흡수하도록 하고, 이어지는 SFT 단계는 솔버 검증을 포함한 정제된 샘플로 모델의 문제 해결 능력을 미세조정한다. 이렇게 시스템 최적화와 도메인 특화 데이터 파이프라인을 결합하면 대규모 MoE의 계산 비용을 제어하면서도 수학적 모델링과 최적화 문제에 강한 모델을 실용적으로 얻을 수 있다.
방법론
전체 접근은 세 계층의 최적화 축을 수립해 Ascend NPU SuperPOD 위에서 동작하도록 구성했다. 첫 번째 축은 모델-레벨 병렬성으로, 전문가 분포와 파라미터 배치를 하드웨어 네트워크 토폴로지에 맞춰 재조직함으로써 불필요한 데이터 전송을 줄이고 메모리 로컬리티를 개선했다. 두 번째 축은 연산과 통신의 조율로, 통신 단계와 계산 단계를 재배치해 비활성 대기 시간을 최소화하고 통신 오버헤드를 경감했다. 세 번째 축은 저수준 커널 실행 최적화로, NPU에서의 커널 실행 경로를 재검토하여 메모리 접근 패턴과 연산 병합을 통해 실효 FLOPs를 끌어올렸다. 이 단계에서 커널 레이아웃 변경과 메모리 버퍼 전략 조정이 포함되어 MFU 개선에 직접적으로 기여했다. 프레임워크는 이 세 축을 통합하는 조정 계층을 두어 각 축의 최적화가 상호괴리 없이 동작하도록 설계되었다. 후처리 워크플로에서는 CPT와 SFT 파이프라인을 연계해 도메인 데이터와 솔버-검증 합성 문서를 결합했다. CPT 단계는 도메인 자원 집계를 통해 모델이 도메인 특유의 구조를 사전 학습하도록 하는 반면 SFT 단계는 인간 레이블 혹은 솔버 검증된 샘플로 모델의 출력 정확성을 높였다. 파이프라인 구성은 데이터 생성, 검증, 샘플링 전략을 포함하며 이 모든 과정이 최적화된 학습 인프라에서 안정적으로 수행되도록 구현되었다.
주요 결과
시스템 최적화의 핵심 정량 지표로 Model FLOPs Utilization(MFU)이 보고되었고 최종 MFU는 34.22%로 측정되었다. 이 값은 동일한 실험 조건의 오픈소스 기준 레시피 대비 2.93배 향상된 수치로 제시되어 계층적 최적화가 하드웨어 연산 활용도를 크게 개선했음을 보여준다. 성능 개선과 더불어 학습의 안정성도 확보되어 대규모 후처리 파이프라인 운용이 가능했다. 도메인 특화 실험에서는 DeepSeek-V4-Flash 기반의 모델을 CPT와 SFT 파이프라인으로 학습시킨 결과가 제시되었다. 생성된 SFT 데이터셋은 10K개의 고품질 샘플로 구성되었고 네 가지 과제 범주와 세 가지 표현 형식을 포함해 문제 다양성을 확보했다. 이 데이터로 미세조정한 특화 모델은 평균 제로샷 Pass@1 71.81%를 기록했으며 비교 대상으로 제시된 GPT-5.4-Mini 및 기본 DeepSeek-V4-Flash보다 각각 3.98 및 11.27 포인트 높은 성능을 보였다. 결과 해석 관점에서 시스템 최적화와 도메인 특화 데이터의 결합이 복잡한 수학적 모델링과 최적화 문제에 대한 제로샷 성능을 동시에 끌어올렸음을 시사한다. 특히 하드웨어 친화적 계층적 최적화로 연산 활용도를 개선한 것이 대규모 모델을 실험적으로 유의미하게 운영 가능하게 만든 핵심 요소로 나타났다. 추가적인 비교 실험과 ablation이 논문 전문에서 제공되었을 가능성이 있으나 초록 기반 결과만으로도 실무적 가치가 분명하다.
기술 상세
전체 시스템은 트릴리언 파라미터급 MoE 모델을 대상으로 후처리와 도메인 특화 SFT를 수행하는 전층 파이프라인으로 구성되었다. 하드웨어 측면에서는 Ascend NPU SuperPOD의 토폴로지와 실행 특성을 고려해 모델-레벨 파라미터 배치와 통신 패턴을 재구성했고, 소프트웨어 측면에서는 연산과 통신의 조율 및 커널 수준의 메모리·연산 최적화를 적용했다. 이러한 구조는 대규모 파라미터 대비 실제 연산 활용의 불일치로 발생하는 시스템 레벨 병목을 완화하는 데 중점을 두었다. 핵심 메커니즘은 세 계층의 상호보완적 최적화로 요약된다. 모델-레벨 병렬성에서는 전문가(expert)와 파라미터의 분산 전략을 하드웨어 토폴로지와 정합시키는 방식으로 불필요한 교환을 최소화했고, 연산-통신 조율 계층에서는 통신 단계의 스케줄을 재배치하거나 계산과 겹치게 해 통신 대기시간을 줄였다. 저수준 커널 계층에서는 NPU에서의 메모리 접근 패턴과 연산 병합을 재설계해 실제 사용 가능한 FLOPs를 증가시켰다. 기술적 차별점은 하드웨어 특화 최적화와 도메인 특화 학습 파이프라인의 결합이다. 많은 prior work가 알고리즘적 효율성이나 모델 설계에 집중한 반면 본 연구는 Ascend NPU라는 특정 인프라 환경에서 실무적으로 동작 가능한 수준까지 시스템을 튜닝한 점이 특징이다. 또한 CPT로 도메인 자원을 집적하고 솔버 검증 합성 데이터를 포함한 SFT 파이프라인을 연계해 수학적 모델링 역량을 개선한 것도 기술적 차별화 요소이다. 구현 및 학습 세부사항은 초록에 제한적으로만 제시되어 있으나 핵심 지표와 데이터 파이프라인 구성은 명시되어 있다. MFU 측정과 2.93배 개선 수치는 최적화 효과의 정량적 근거로 사용되었고, SFT 데이터셋은 10K 샘플 규모로 네 가지 과제 범주와 세 가지 표현을 포함한다. 논문 전문에서 하이퍼파라미터, 통신 스케줄링 알고리즘, 커널 변경 세부사항이 추가로 제공되었을 가능성이 높다.
실무 활용
본 연구의 통합 프레임워크는 대규모 MoE 모델을 Ascend NPU 인프라에서 효율적으로 후처리하고 도메인 특화 SFT 모델을 실무에 도입할 수 있는 경로를 제공한다. 계층적 최적화로 하드웨어 활용도를 개선한 결과는 대규모 모델 운영의 비용과 시간 측면에서 실질적 이익을 낼 수 있음을 의미한다. CPT와 SFT 파이프라인은 복잡한 최적화 문제를 다루는 도메인에서 모델의 문제해결 능력을 높이는 데 직접적으로 활용될 수 있다.
- 기업의 공급망 최적화 문제를 모델이 수학적으로 표현하고 해법을 제안하는 보조 시스템으로 활용할 수 있다.
- 연구기관에서 대규모 MoE를 활용한 OR 문제 벤치마크 생성 및 자동 해답 검증 파이프라인에 적용할 수 있다.
- 산업용 최적화 소프트웨어와 결합해 자연어로 기술된 최적화 요구사항을 구조화된 모델 포뮬레이션으로 자동 전환하는 도구로 쓸 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Mixture of Experts (MoE)
- — MoE는 모델 내부에 여러 전문가(expert) 서브네트워크를 두고 입력마다 일부 전문가만 활성화해 계산량을 줄이는 구조이다. 활성화 정책으로 일부 전문가만 선택되므로 전체 파라미터는 크지만 실제 연산량은 절약될 수 있다. 대규모 트릴리언 파라미터급 모델의 후처리(post-training)에서 메모리와 통신 패턴이 복잡해지는 원인으로 자주 지적된다.
- Model FLOPs Utilization (MFU)
- — MFU는 실제 하드웨어가 모델 계산에서 이론적 peak FLOPs 대비 얼마나 활용되는지를 나타내는 지표이다. 이 수치는 연산 병목, 메모리 대기, 비효율적 커널로 인한 성능 손실을 정량화하는 데 사용된다. 본문에서는 Ascend 기반 최적화 결과의 핵심 성능 지표로 사용되어 최종 효율 개선을 수치로 보여준다.
- SuperPOD
- — SuperPOD는 여러 NPU 노드를 대규모로 클러스터링한 인프라 구성으로, 높은 대역폭과 집적된 가속기를 통해 대규모 모델 학습을 수행한다. 대규모 분산 학습에서는 노드 간 통신 패턴과 메모리 분배 방식이 전체 성능에 큰 영향을 준다. Ascend NPU SuperPOD는 본 연구의 시스템 최적화 대상 하드웨어 환경으로 작동했다.
- CPT
- — CPT는 본문에서 도메인 특화 사전학습(workflow) 단계로 활용되어 복잡한 Operations Research 문제에 맞춘 데이터 파이프라인과 모델 적응을 지원한다. 원문은 CPT를 통해 도메인 자원을 통합하고 solver-검증 합성 문서를 포함한 학습자료를 구성했다고 보고한다. CPT는 SFT 이전에 모델 역량을 도메인에 맞춰 강화하는 단계로 기능했다.
- Solver-verified Synthetic Data
- — 솔버 검증 합성 데이터는 최적화 소프트웨어(솔버)를 사용해 생성된 문제와 해답을 합성한 자료로, 생성된 해답이 솔버로 검증되어 품질을 확보한다. 본 논문에서는 OR(Operations Research) 과제를 위해 도메인 자원과 결합된 형태로 10K 수준의 고품질 SFT 샘플을 만들었다. 이런 데이터는 수학적 모델링 및 해법 생성 능력을 학습시키는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.