432B 파라미터에서 28B만 활성화해 긴 컨텍스트와 코드 성능을 높인 하이브리드 MoE 모델
GigaChat 3.5 Ultra는 MLA와 GatedDeltaNet으로 구성된 하이브리드 어텐션과 MoE를 결합해 총 432B 파라미터 중 28B만 활성화하여 긴 문맥 처리 효율과 코드·수학 성능을 동시에 개선한 다국어 인스트럭션 모델이다.
TL;DR
GigaChat 3.5 Ultra는 총 432B 파라미터 규모의 MoE 기반 모델로서 토큰당 활성화되는 파라미터를 28B로 유지해 추론 비용을 낮추는 동시에 MLA와 GatedDeltaNet 선형 어텐션을 레이어별로 혼용하는 하이브리드 설계를 도입해 긴 컨텍스트에서의 메모리 부담을 줄였다. GatedNorm을 통해 RMSNorm 이후에 곱셈형 게이트로 피처별 스케일을 명시적으로 제어해 대형 모델 훈련의 안정성을 확보했고 native FP8로 전체 학습을 수행해 메모리·대역폭 효율을 높였다. 두 개의 MTP 헤드와 speculative decoding 설정으로 greedy 디코딩 처리량을 1.5×~2.2×까지 가속했고 벤치마크에서는 MMLU, HumanEval, MATH 등에서 이전 세대 대비 개선된 점수가 보고되었다. 결과적으로 긴 문맥과 코드·수학 중심 워크로드에서 메모리 효율과 처리량 우위를 확보했으나 구체적 컨텍스트 길이 한계나 실제 배포시 필요한 클러스터 규모는 별도 검증이 필요하다.
핵심 역량
- 다국어 대화형 응답을 생성할 수 있으며 러시아어와 영어를 모두 지원한다고 명시되어 있다. 이 모델은 긴 컨텍스트를 처리하기 위해 하이브리드 어텐션을 사용해 메모리 사용량을 줄이면서도 문맥 기반 응답을 유지할 수 있다. 에이전트용 도구 호출과 툴 사용을 위한 파서 통합과 speculative decoding 설정을 통해 도구 기반 워크플로와의 연동이 가능하다.
- 코드 생성과 수학 문제 해결에서 높은 성능을 보이며 HumanEval과 MATH 계열 벤치마크에서 기존 세대 대비 개선된 점수가 보고되어 있다. 두 개의 MTP 헤드를 활용하면 greedy decoding 기준으로 생성 속도를 1.5×에서 2.2×까지 향상시킬 수 있어 실시간 응답성 측면에서 이점이 있다. 모델은 에이전트 시나리오에서의 연속적 도구 호출과 긴 로그 유지에 적합하도록 설계되었다.
- 대규모 클러스터 환경에서 FP8 정밀도를 통해 학습·추론 비용을 절감하도록 최적화되어 있으며 BF16 비양자화 체크포인트와 GGUF 배포 형식도 제공되어 다양한 배포 파이프라인을 지원한다. MoE 구조 덕분에 동일 총 파라미터 대비 활성 파라미터를 낮게 유지해 추론 비용과 메모리 요구를 줄였고 KV 캐시 사용량을 약 4배 절감한 것으로 보고되었다. 결과적으로 대용량 컨텍스트를 더 적은 메모리로 유지하며 높은 처리량을 확보할 수 있다.
강점
- 동일 계열 이전 버전 대비 모델 크기를 약 40% 줄이면서도 코드와 수학, 에이전트 시나리오 성능을 개선한 점이 README 수치로 확인된다. 이와 함께 KV 캐시 사용량을 약 4× 줄였고 동일 메모리에서 2× 이상 긴 컨텍스트를 저장할 수 있다고 보고되어 긴 대화 유지와 대용량 문서 처리가 용이하다.
- MoE 구조로 활성 파라미터가 28B에 머무르기 때문에 전체 432B 규모임에도 불구하고 추론 비용이 대폭 낮아 대규모 클러스터 배포에서 효율적인 처리량을 확보할 수 있다. 또한 native FP8 학습과 MTP를 통한 생성 가속(최대 2.2×)으로 실시간 응답성과 비용 측면에서 유리하다.
훈련 방식
모델은 MoE 기반의 대형 디코더로 설계되었고 hybrid attention(MLA + GatedDeltaNet)과 여러 가속화 기능에 대해 안정화 장치를 병행하는 훈련 레시피로 native FP8 정밀도에서 학습했으며 이후 SFT, DPO, Online RL을 포함한 정렬 파이프라인을 적용했다.
알아두면 좋은 것
- 모델 총 규모는 432B 파라미터이며 라우팅을 통해 활성 파라미터는 28B로 유지되어 동일 규모의 밀집 모델보다 추론 비용이 크게 낮다.
- 하이브리드 어텐션 아키텍처는 일부 레이어에 Multi-head Latent Attention(MLA)을 두고 다른 레이어는 GatedDeltaNet 기반의 선형 어텐션을 적용해 긴 문맥에서 KV 캐시 사용량을 약 4× 줄였다고 보고되었다.
- 학습은 native FP8 정밀도로 수행되었고 bf16으로 비양자화한 체크포인트를 별도로 제공하며 GGUF 버전과 학습용 베이스 및 체크포인트를 공개했다.
- 정렬 파이프라인은 Stage 1.5 → SFT → DPO → Online RL 순서로 구성되며 Online RL이 이번 릴리스의 주요 개선 요소로 성능 향상에 기여했다고 명시되어 있다.
기술적 특징
- 하이브리드 어텐션은 MLA와 GatedDeltaNet 선형 어텐션을 레이어별로 혼용해 설계되었고 이로 인해 전역 어텐션 레이어는 표현력을 보존하며 선형 레이어는 긴 문맥의 KV 캐시·메모리 비용을 크게 절감한다. 이러한 조합은 긴 요청에서의 메모리 병목을 줄이는 동시에 전체 성능 저하를 방지하도록 설계되었다. README는 이 설계로 KV 캐시가 약 4× 줄고 같은 메모리에서 컨텍스트 용량이 2× 이상 증가했다고 보고했다.
- MoE 구조는 총 432B 파라미터 중 토큰당 활성화되는 파라미터를 28B로 제한해 추론 비용을 밀집 모델보다 낮게 유지한다. 라우터는 각 토큰별로 top-k 전문가를 선택하고 선택된 전문가만 계산에 참여해 연산 효율을 확보한다. MoE 블록은 어텐션과 후속 정규화 및 출력 투영과 함께 디코더 층에 통합되어 있다.
- GatedNorm은 RMSNorm 다음에 곱셈형 게이트를 도입해 피쳐별 스케일을 명시적으로 조절하며 초기화시 2·sigmoid 재파라미터화를 적용해 학습 초기에 신호 흐름을 크게 바꾸지 않는다. 이 설계는 대형 모델에서 발생하는 암묵적 신호 앵커링 문제를 감소시키며 훈련 안정성에 기여한다. GatedNorm은 스케일 중립성을 통해 초기 단계에서 활성화 분포를 보존하고 필요한 경우 점진적으로 감쇠를 학습한다.
- Multi-Token Prediction(MTP)을 두 개의 헤드로 확장해 greedy decoding의 처리량을 높였고 단일 헤드 대비 1.5×, 두 헤드 사용 시 최대 2.2×의 생성 속도 향상이 보고되었다. MTP는 추론 단계에서 여러 토큰을 한번에 예측해 디코더 반복 횟수를 줄이는 방식으로 구현되어 있으며 특히 실시간 응답성이 요구되는 워크플로에서 이점이 나타난다.
- 학습 전체를 native FP8으로 수행해 메모리와 대역폭 요구를 줄였고 별도 bf16 비양자화 체크포인트를 제공해 호환성과 디버깅, 서드파티 도구 활용을 보장한다. FP8 기반 학습은 대규모 MoE와 긴 컨텍스트 처리를 실용적인 비용으로 수행하기 위한 핵심 요소로 채택되었다.
차별점
- MLA와 GatedDeltaNet 선형 어텐션을 레이어별로 혼용한 하이브리드 어텐션 설계를 채택해 긴 컨텍스트에서 메모리 효율을 높였다.
- MoE로 전체 파라미터는 크지만 토큰당 활성 파라미터를 28B로 제한해 동일 총량 대비 추론 비용을 크게 낮췄다.
- GatedNorm을 도입해 RMSNorm 뒤에서 명시적 게이트로 신호 스케일을 조절함으로써 대규모 학습 안정성을 개선했다.
- 학습 전 과정을 native FP8로 수행하고 MTP 다중 토큰 헤드를 활용해 추론 처리량을 실질적으로 향상시켰다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU (5-shot) | accuracy | 85.28 | GigaChat 3.1 Base (700B): 79.89 |
| MATH Minerva (math-verify) | accuracy | 61.7 | GigaChat 3.1 Base (700B): 55.78 |
| HumanEval (pass@1) | pass@1 | 80.49 | GigaChat 3.1 Base (700B): 70.12 |
| TAU2-bench (Instruct-model) | score | 68.71 | GigaChat-3.1-Ultra (700B): 41.87 |
| Average GENERAL (table avg) | avg | 72.3 | GigaChat 3.1 Base (700B): 69.6 |
이미지 분석

61
Likes
1.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.