TL;DR
텐센트가 770B 파라미터 규모의 MoE 아키텍처를 기반으로 한 차세대 모델 'Hy4-preview'를 공개했다. 이 모델은 Gated DSA와 MTP 레이어를 통해 추론 성능과 효율을 극대화했으며, 소프트웨어 엔지니어링 및 데이터 분석 등 실무 작업에 최적화되었다. vLLM과 SGLang을 통한 배포를 지원하며, 내부 전문가 평가에서 기존 모델 대비 우위를 점했다. Apache 2.0 라이선스로 오픈소스화되어 누구나 활용할 수 있다.
섹션별 상세
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Hello! Can you briefly introduce yourself?"},
],
temperature=0.9,
top_p=1.0,
)OpenAI 호환 API를 사용하여 Hy4-preview 모델에 추론 요청을 보내는 예시 코드이다.
용어 해설
- 전문가 혼합 모델(Mixture-of-Experts)
- — 전체 파라미터 중 일부만 활성화하여 연산 효율을 높이는 아키텍처이다. Hy4-preview는 770B 파라미터 중 토큰당 49B만 활성화하여 대규모 모델의 성능과 추론 속도 사이의 균형을 맞춘다.
- 추측 디코딩(Speculative Decoding)
- — 작은 보조 모델이 다음 토큰을 미리 예측하고 본 모델이 이를 검증하는 방식으로 추론 속도를 높이는 기술이다. Hy4-preview는 내장된 MTP 레이어를 통해 이를 구현한다.
- Gated DeepSeek Sparse Attention(Gated DSA)
- — DeepSeek의 Sparse Attention을 기반으로 게이트 메커니즘을 결합한 어텐션 구조이다. 인덱스 캐시를 활용해 레이어 간 희소 인덱스를 재사용함으로써 효율적인 정보 처리를 가능하게 한다.
기술
- Hy4-preview
- vLLM
- SGLang
- AngelSlim
- OpenAI API
활용 사례
- 소프트웨어 엔지니어링
- 데이터 분석
- 게임 개발
- 과학 연구
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.