106B MoE와 대규모 RL의 결합, 수학과 코딩에 특화된 오픈소스 추론 모델의 정점
텍스트 생성, 복합 추론, 코드 생성, 수학 문제 풀이, 에이전트 태스크106B (Active 12B)mit
수학, 코딩, 에이전트 태스크 역량을 극대화하기 위해 대규모 강화학습(RL)으로 훈련된 106B 규모의 MoE 모델입니다.
핵심 역량
- 106B 파라미터 규모의 Mixture-of-Experts(MoE) 아키텍처
- 수학 및 코딩 성능 극대화를 위한 대규모 강화학습(RL) 적용
- 에이전트(Agentic) 태스크 및 소프트웨어 엔지니어링 특화
- vLLM을 통한 효율적인 분산 서빙 지원 (2x H200 권장)
- DeepSeek-R1 추론 파서 및 Qwen2.5-Coder 툴 호출 파서 호환
알아두면 좋은 것
- INTELLECT-3 대비 수학, 코딩, 에이전트 성능 대폭 향상
- prime-rl 및 verifiers를 포함한 모든 학습 프레임워크 및 환경 오픈소스화
- 2x H200 GPU 환경에서 vLLM을 이용한 실시간 서빙 최적화 가이드 제공
- MIT 및 Apache 2.0 라이선스로 완전한 상업적 이용 허용
38
Likes
411
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.