tencent/Hy3
주요 수행 태스크는 텍스트 생성이며 코드 작성, 제품용 에이전트 동작, 장문 문맥 처리와 같은 에이전트형 워크로드에 초점이 맞춰져 있다. README에서 모델은 코딩, 오피스 업무, 데이터 모델링, 프런트엔드 설계, 게임 개발 등 생산성 시나리오에서 개선된 성능을 보였다고 기재되어 있다. 장문 문맥과 도구 호출 안정성 개선을 위해 SFT와 RL을 결합한 학습 흐름이 적용되었다고 명시되어 있다.295B total, 21B activated, 3.8B MTP layer256K 컨텍스트apache-2.0
Hy3는 295B MoE 구조로 21B 활성 파라미터와 256K 컨텍스트를 지원하는 텍스트 생성 모델이다.
학습 방식 · 기반은 MoE 설계이며 post-training으로 고품질 데이터 스케일업과 함께 SFT와 RL의 공동 최적화를 적용하여 다중턴 의도 유지와 도구 호출 안정성을 개선했다.
TL;DR
Hy3는 Tencent Hy 팀이 공개한 MoE 기반 대형 언어모델로 총 295B 파라미터와 입력마다 활성화되는 21B 파라미터 구성을 통해 용량 대비 계산 효율을 확보한다. MTP 계층과 GQA 어텐션을 포함한 설계와 256K 컨텍스트 지원으로 장문 유지 및 다중턴 의도 추적을 개선하도록 설계되었고 SFT와 RL의 공동 최적화를 통해 도구 호출 안정성과 허위 응답 비율을 유의미하게 낮춘 내부 결과를 보였다. 오픈소스 가중치와 FP8 양자화 버전 공개, vLLM·SGLang 서빙 레시피 제공, AngelSlim 기반 압축 툴 지원으로 프로덕션 배포와 저비용 추론 경로를 함께 제공한다. 내부 블라인드 평가에서 2.67/4를 기록해 GLM-5.1의 2.51/4를 상회했으며 README에 제시된 내부 오류·허위 지표 개선 수치가 제품 적용에서의 안정성 향상을 뒷받침한다.
핵심 포인트
- 전체 파라미터는 295B로 매우 크지만 MoE 설계로 활성 파라미터를 21B로 제한하여 용량 대비 실질적인 계산 비용을 낮춘 설계가 핵심 차별점이다.
- 256K 토큰의 공식 지원 컨텍스트 길이를 제공하여 장문 대화와 문서 기반 작업에서 동종 모델 대비 실무적 이점을 제공하는 점이 특징이다.
- 서빙 및 툴 호출 안정성 개선에 중점을 두고 내부 제품 피드백을 반영한 버전업을 거쳐 프로덕션 레벨의 도구 호출 복구와 출력 포맷 일관성을 확보했다.
- 활성화 파라미터를 21B로 제한하는 MoE 설계로 전체 용량은 크지만 실제 활성 계산량을 줄여 대형 모델 수준의 표현력을 비용 효율적으로 제공할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Blind expert evaluation | score | 2.67/4 | vs GLM-5.1: 2.51/4 |
| Internal hallucination rate (product scenarios) | rate | 5.4% | before: 12.5% |
| Internal commonsense error rate | rate | 12.7% | before: 25.4% |
| Internal multi-turn issue rate (comprehensive tests) | rate | 7.9% | before: 17.4% |
이미지 분석


858
LIKES
14.1k
DOWNLOADS
5 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.