본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

tencent/Hy4-preview

텍스트 생성 (Mixture-of-Experts)770B1K 컨텍스트apache-2.0

770B 파라미터 MoE 아키텍처와 MTP 레이어를 결합해 실무 생산성 작업에 최적화된 차세대 플래그십 모델.

학습 방식 · 770B 파라미터 MoE 기반, Gated DSA 및 MTP 레이어 적용, 실무 생산성 특화 데이터셋으로 파인튜닝.

TL;DR

Tencent의 Hy4 preview는 770B 파라미터 규모의 Mixture-of-Experts 모델로, Gated DeepSeek Sparse Attention과 IndexCache를 도입해 1M 컨텍스트를 효율적으로 처리한다. MTP 레이어를 내장하여 speculative decoding을 기본 지원하며, 소프트웨어 엔지니어링, 데이터 분석, 게임 개발 등 실무 생산성 향상에 특화된 데이터를 학습했다. 초기 버전으로서 복잡한 작업 수행 시 과도한 추론이나 자기 검증을 반복하는 경향이 있으나, 실무 환경에서 높은 성능을 발휘하도록 설계되었다.

핵심 포인트

  • 770B 파라미터 규모의 MoE 아키텍처를 채택하여 토큰당 49B 파라미터만 활성화함으로써 추론 효율과 성능을 동시에 확보했다.
  • Gated DeepSeek Sparse Attention과 IndexCache를 통해 긴 문맥 처리 시 정보 흐름의 효율성을 극대화했다.
  • MTP(Multi-Token Prediction) 레이어를 내장하여 speculative decoding을 기본 지원함으로써 추론 속도를 높였다.
  • 소프트웨어 엔지니어링, 데이터 분석, 게임 개발 등 실무 현장의 복잡한 과업 해결에 최적화된 데이터로 학습되었다.

제한사항

  • 초기 버전으로 복잡한 작업 수행 시 과도한 추론이나 자기 검증을 반복하는 경향이 있음.
  • 실무 환경에서 높은 성능을 발휘하도록 설계되었으나 추가적인 최적화 여지가 남아 있음.

벤치마크

벤치마크지표비교
SWE-bench Proaccuracy65.7
GPQA Diamondaccuracy92.3
MathArena Apex 2025accuracy74.2

이미지 분석

Hy4 preview의 주요 벤치마크 성능 요약 차트.
다양한 벤치마크 지표에서 이전 세대 모델 대비 향상된 성능을 시각적으로 보여주며, 모델의 전반적인 역량 개선을 입증한다.
Agentic Coding, Search, Working Agent 등 분야별 상세 벤치마크 수치 표.
벤치마크 항목별로 Hy4 preview와 경쟁 모델들의 구체적인 점수를 비교하여 모델의 실무적 강점을 정량적으로 제시한다.

234

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.