용어 해설
- Mixture of Experts(Mixture of Experts (MoE))
- — MoE는 모델 내부에 여러 전문가(expert) 서브네트워크를 두고 입력마다 일부 전문가만 활성화해 계산량을 줄이는 구조이다. 활성화 정책으로 일부 전문가만 선택되므로 전체 파라미터는 크지만 실제 연산량은 절약될 수 있다. 대규모 트릴리언 파라미터급 모델의 후처리(post-training)에서 메모리와 통신 패턴이 복잡해지는 원인으로 자주 지적된다.
- 모델 플롭스 활용률(Model FLOPs Utilization (MFU))
- — MFU는 실제 하드웨어가 모델 계산에서 이론적 peak FLOPs 대비 얼마나 활용되는지를 나타내는 지표이다. 이 수치는 연산 병목, 메모리 대기, 비효율적 커널로 인한 성능 손실을 정량화하는 데 사용된다. 본문에서는 Ascend 기반 최적화 결과의 핵심 성능 지표로 사용되어 최종 효율 개선을 수치로 보여준다.
- SuperPOD
- — SuperPOD는 여러 NPU 노드를 대규모로 클러스터링한 인프라 구성으로, 높은 대역폭과 집적된 가속기를 통해 대규모 모델 학습을 수행한다. 대규모 분산 학습에서는 노드 간 통신 패턴과 메모리 분배 방식이 전체 성능에 큰 영향을 준다. Ascend NPU SuperPOD는 본 연구의 시스템 최적화 대상 하드웨어 환경으로 작동했다.
- CPT
- — CPT는 본문에서 도메인 특화 사전학습(workflow) 단계로 활용되어 복잡한 Operations Research 문제에 맞춘 데이터 파이프라인과 모델 적응을 지원한다. 원문은 CPT를 통해 도메인 자원을 통합하고 solver-검증 합성 문서를 포함한 학습자료를 구성했다고 보고한다. CPT는 SFT 이전에 모델 역량을 도메인에 맞춰 강화하는 단계로 기능했다.
- 솔버 검증 합성 데이터(Solver-verified Synthetic Data)
- — 솔버 검증 합성 데이터는 최적화 소프트웨어(솔버)를 사용해 생성된 문제와 해답을 합성한 자료로, 생성된 해답이 솔버로 검증되어 품질을 확보한다. 본 논문에서는 OR(Operations Research) 과제를 위해 도메인 자원과 결합된 형태로 10K 수준의 고품질 SFT 샘플을 만들었다. 이런 데이터는 수학적 모델링 및 해법 생성 능력을 학습시키는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.