섹션별 상세
Trinity Large는 400B 파라미터 규모의 MoE 아키텍처를 채택했으며, 256개의 전문가 중 13B 파라미터만 활성화되는 높은 희소성을 특징으로 한다.

학습에는 Nvidia의 최신 B300 Blackwell GPU 2,048개가 사용되었으며, 이는 해당 하드웨어에서 수행된 최초의 대규모 공개 학습 사례 중 하나이다.
최적화 알고리즘으로 Adam 대신 Muon을 선택하여 수렴 속도를 높였으며, DeepSeek V3의 보조 손실 없는 밸런싱 기법을 변형하여 적용했다.
Arcee AI는 기존 수익 창출 사업을 일시 중단하고 자본의 약 70%인 2,000만 달러를 이 모델 개발에 투입하는 올인 전략을 취했다.
모델은 Apache 2.0 라이선스로 공개되어 상업적 이용이 자유로우며, 이는 미국 기업들의 규제 준수 및 보안 요구를 충족하기 위한 선택이다.
포스트 트레이닝 과정에서 2,300억 개의 토큰을 사용한 대규모 SFT를 수행하여 모델의 지시 이행 능력을 강화했다.
학습 초기 10일간 전문가 붕괴 현상 등 불안정성을 겪었으나, 시퀀스 손실 추가 및 라우팅 알고리즘 조정을 통해 안정적인 학습 곡선을 확보했다.
모델 개발 과정에서 데이터 파트너인 Datology와 긴밀히 협력하여 사전 학습 데이터가 포스트 트레이닝 단계에서 효과적으로 작용하도록 최적화했다.
용어 해설
- 전문가 혼합 모델(MoE)
- — 전체 파라미터 중 일부 전문가(Expert) 네트워크만 활성화하여 추론하는 구조이다. Trinity Large는 400B 파라미터 중 13B만 활성화하여 연산 효율성을 극대화했다. 대규모 모델의 성능을 유지하면서도 추론 비용과 지연 시간을 줄이는 데 핵심적인 역할을 한다.
- 뮤온 최적화 알고리즘(Muon)
- — Adam 최적화 알고리즘의 대안으로 주목받는 기법이다. 모멘텀 버퍼를 하나만 사용하여 메모리 사용량을 줄이고, 특정 검증 손실 지점까지 더 빠르게 수렴하는 특성을 가진다. Arcee AI는 대규모 학습의 효율성을 높이기 위해 이 알고리즘을 채택했다.
- 희소성(Sparsity)
- — 모델의 전체 파라미터 대비 실제 계산에 참여하는 파라미터의 비율이 낮은 상태를 의미한다. Trinity Large는 400B 중 13B만 활성화되는 높은 희소성을 특징으로 한다. 이는 하드웨어 자원을 절약하면서도 거대 모델의 지식 용량을 확보하는 전략이다.
- 보조 손실 없는 밸런싱(Auxiliary-loss-free Balancing)
- — MoE 모델에서 특정 전문가에게 연산이 쏠리는 현상을 방지하기 위한 기법이다. 별도의 보조 손실 함수를 추가하지 않고도 전문가 선택의 균형을 맞춘다. DeepSeek V3에서 제안된 방식을 Arcee AI가 자사 모델에 맞춰 변형하여 적용했다.
- 지도 미세 조정(SFT)
- — 사전 학습된 모델을 특정 지시사항이나 대화 형식에 맞게 추가 학습시키는 과정이다. Trinity Large는 2,300억 개의 토큰을 사용하여 대규모 SFT를 수행했다. 모델의 응답 품질과 사용자 의도 파악 능력을 결정짓는 중요한 단계이다.
기술
- Nvidia B300 Blackwell
- Muon Optimizer
- TorchTitan
- MergeKit
- DistillKit
활용 사례
- 기업용 온프레미스 LLM 구축
- 도메인 특화 모델 미세 조정
- 고성능 추론 에이전트 개발
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 28.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
