tencent/Hy4-preview
텍스트 생성 (Mixture-of-Experts)770B1K 컨텍스트apache-2.0
770B 파라미터 MoE 아키텍처와 MTP 레이어를 결합해 실무 생산성 작업에 최적화된 차세대 플래그십 모델.
학습 방식 · 770B 파라미터 MoE 기반, Gated DSA 및 MTP 레이어 적용, 실무 생산성 특화 데이터셋으로 파인튜닝.
TL;DR
Tencent의 Hy4 preview는 770B 파라미터 규모의 Mixture-of-Experts 모델로, Gated DeepSeek Sparse Attention과 IndexCache를 도입해 1M 컨텍스트를 효율적으로 처리한다. MTP 레이어를 내장하여 speculative decoding을 기본 지원하며, 소프트웨어 엔지니어링, 데이터 분석, 게임 개발 등 실무 생산성 향상에 특화된 데이터를 학습했다. 초기 버전으로서 복잡한 작업 수행 시 과도한 추론이나 자기 검증을 반복하는 경향이 있으나, 실무 환경에서 높은 성능을 발휘하도록 설계되었다.
핵심 포인트
- 770B 파라미터 규모의 MoE 아키텍처를 채택하여 토큰당 49B 파라미터만 활성화함으로써 추론 효율과 성능을 동시에 확보했다.
- Gated DeepSeek Sparse Attention과 IndexCache를 통해 긴 문맥 처리 시 정보 흐름의 효율성을 극대화했다.
- MTP(Multi-Token Prediction) 레이어를 내장하여 speculative decoding을 기본 지원함으로써 추론 속도를 높였다.
- 소프트웨어 엔지니어링, 데이터 분석, 게임 개발 등 실무 현장의 복잡한 과업 해결에 최적화된 데이터로 학습되었다.
제한사항
- 초기 버전으로 복잡한 작업 수행 시 과도한 추론이나 자기 검증을 반복하는 경향이 있음.
- 실무 환경에서 높은 성능을 발휘하도록 설계되었으나 추가적인 최적화 여지가 남아 있음.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Pro | accuracy | 65.7 | — |
| GPQA Diamond | accuracy | 92.3 | — |
| MathArena Apex 2025 | accuracy | 74.2 | — |
이미지 분석


234
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.