MoE 설계로 21B 활성 파라미터와 256K 컨텍스트를 갖춘 Hy3
주요 수행 태스크는 텍스트 생성이며 코드 작성, 제품용 에이전트 동작, 장문 문맥 처리와 같은 에이전트형 워크로드에 초점이 맞춰져 있다. README에서 모델은 코딩, 오피스 업무, 데이터 모델링, 프런트엔드 설계, 게임 개발 등 생산성 시나리오에서 개선된 성능을 보였다고 기재되어 있다. 장문 문맥과 도구 호출 안정성 개선을 위해 SFT와 RL을 결합한 학습 흐름이 적용되었다고 명시되어 있다.295B total, 21B activated, 3.8B MTP layer256K 컨텍스트apache-2.0
Hy3는 295B MoE 구조로 21B 활성 파라미터와 256K 컨텍스트를 지원하는 텍스트 생성 모델이다.
TL;DR
Hy3는 Tencent Hy 팀이 공개한 MoE 기반 대형 언어모델로 총 295B 파라미터와 입력마다 활성화되는 21B 파라미터 구성을 통해 용량 대비 계산 효율을 확보한다. MTP 계층과 GQA 어텐션을 포함한 설계와 256K 컨텍스트 지원으로 장문 유지 및 다중턴 의도 추적을 개선하도록 설계되었고 SFT와 RL의 공동 최적화를 통해 도구 호출 안정성과 허위 응답 비율을 유의미하게 낮춘 내부 결과를 보였다. 오픈소스 가중치와 FP8 양자화 버전 공개, vLLM·SGLang 서빙 레시피 제공, AngelSlim 기반 압축 툴 지원으로 프로덕션 배포와 저비용 추론 경로를 함께 제공한다. 내부 블라인드 평가에서 2.67/4를 기록해 GLM-5.1의 2.51/4를 상회했으며 README에 제시된 내부 오류·허위 지표 개선 수치가 제품 적용에서의 안정성 향상을 뒷받침한다.
핵심 역량
- 장문 컨텍스트 처리 능력을 갖추어 256K 토큰 길이의 입력을 유지하면서 다중턴 의도 추적과 핵심어에 따른 응답 일관성을 확보할 수 있다.
- 도구 호출 안정성과 출력 포맷 제약을 고려한 응답 생성이 가능하여 다양한 에이전트 스캐폴드에서 일관된 도구 인터페이스를 유지하도록 설계되었다.
- 코딩과 생산성 관련 작업에서 개선이 보고되었으며 프런트엔드 개발·데이터·CI/CD 관련 실무 과제에서 비교우위를 보였다고 내부 평가에서 나타났다.
- Hallucination과 상식 오류를 줄이기 위한 데이터 정제 및 학습 제약을 적용하여 내부 평가에서 허위 응답률과 상식 오류율이 감소한 결과를 보였다.
- 추론 모드 설정(reasoning_effort)을 통해 직접 응답과 고사고력(chain-of-thought) 모드 간 트레이드오프를 조정할 수 있는 인터페이스를 제공한다.
강점
- 활성화 파라미터를 21B로 제한하는 MoE 설계로 전체 용량은 크지만 실제 활성 계산량을 줄여 대형 모델 수준의 표현력을 비용 효율적으로 제공할 수 있다.
- 256K의 긴 컨텍스트를 공식적으로 지원하여 장문 대화·문서 요약·코드 베이스 이해 같은 긴 문맥 태스크에서 유리한 구조를 갖추고 있다.
- 제품 팀 피드백을 반영해 도구 호출 안정성, 출력 포맷 회복력, 다중 스캐폴드 일반화 측면에서 내부 검증을 거쳐 프로덕션 적용 가능성을 높였다.
훈련 방식
기반은 MoE 설계이며 post-training으로 고품질 데이터 스케일업과 함께 SFT와 RL의 공동 최적화를 적용하여 다중턴 의도 유지와 도구 호출 안정성을 개선했다.
알아두면 좋은 것
- 모델은 MoE 아키텍처로 총 295B 파라미터, 활성화 파라미터 21B, MTP 계층 파라미터 3.8B, 192개의 전문가(top-8 활성화)를 사용하여 용량 대비 효율을 목표로 설계되었다.
- Hy3와 FP8 양자화 버전(Hy3-FP8) 가중치를 오픈소스로 공개하고 있으며 Apache-2.0 라이선스를 적용했다.
- 서빙을 위한 권장 경로로 vLLM과 SGLang용 레시피를 제공하며 vLLM과 SGLang 예제가 README에 포함되어 있어 대규모 서빙 설정을 빠르게 재현할 수 있다.
- AngelSlim 도구를 통한 양자화 및 모델 압축 워크플로를 지원하여 저비용 추론 옵션을 제공한다.
기술적 특징
- Mixture-of-Experts 구조를 채택하여 총 295B 파라미터를 유지하되 각 입력에서 top-8 전문가만 활성화함으로써 활성 파라미터를 21B 수준으로 제한하고 계산 효율을 확보했다. 이 방식은 대규모 용량을 유지하면서 추론 시 필요한 연산을 줄여 실무 서빙 비용을 절감하는 목적을 가진다.
- MTP 계층을 모델에 포함하여 특정 표현 경로를 보강했으며 이 계층은 별도 파라미터(3.8B)를 보유하여 모델의 표현력을 보완한다. README는 MTP 관련 서빙 설정(vLLM/SGLang)과 speculative 설정을 권장하여 MTP가 서빙 최적화와 연동되어 작동함을 시사한다.
- 어텐션 설계는 64개 헤드를 사용하고 GQA와 8개의 KV 헤드를 명시하여 키·값 처리와 헤드 분할로 장문 문맥과 메모리 제약 사이의 균형을 맞추려는 의도를 보였다. head dim 128과 조합된 이 구성은 긴 컨텍스트에서의 표현 분리 및 저장 효율을 개선하도록 설계되었다.
- SFT와 RL을 공동 최적화하여 다중턴 의도 유지, 핵심어 기반 응답의 일관성, 코어퍼런스 해결을 개선하였으며 내부 평가에서 문제 발생률 감소가 보고되었다. 이 학습 조합은 제품 피드백 루프를 통해 반복적으로 개선된 데이터로 보완되었다.
차별점
- 전체 파라미터는 295B로 매우 크지만 MoE 설계로 활성 파라미터를 21B로 제한하여 용량 대비 실질적인 계산 비용을 낮춘 설계가 핵심 차별점이다.
- 256K 토큰의 공식 지원 컨텍스트 길이를 제공하여 장문 대화와 문서 기반 작업에서 동종 모델 대비 실무적 이점을 제공하는 점이 특징이다.
- 서빙 및 툴 호출 안정성 개선에 중점을 두고 내부 제품 피드백을 반영한 버전업을 거쳐 프로덕션 레벨의 도구 호출 복구와 출력 포맷 일관성을 확보했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Blind expert evaluation | score | 2.67/4 | vs GLM-5.1: 2.51/4 |
| Internal hallucination rate (product scenarios) | rate | 5.4% | before: 12.5% |
| Internal commonsense error rate | rate | 12.7% | before: 25.4% |
| Internal multi-turn issue rate (comprehensive tests) | rate | 7.9% | before: 17.4% |
이미지 분석


858
Likes
14.1k
Downloads
5 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.