tencent/Hy3-FP8
Hy3-FP8는 295B MoE 구조에서 21B 활성 파라미터를 사용하는 FP8 양자화 인스트럭션 LLM으로, 최대 256K 토큰의 컨텍스트와 배포용 레시피를 제공한다.
학습 방식 · Hy3 기반 모델은 대규모 MoE 설계에서 출발해 포스트트레이닝 단계에서 50개 이상의 제품 피드백을 반영하고 고품질 데이터로 스케일업한 뒤 RL(강화학습) 기반의 추가 학습을 확대했다. 문서에는 SFT와 RL의 공동 최적화를 통해 멀티턴 의도 유지와 장기 문맥 처리를 개선했다고 기술되어 있다. 훈련 데이터의 품질 정제와 학습 제약을 도입해 사실성(anti-hallucination) 개선에도 중점을 두었다.
TL;DR
Hy3-FP8는 Tencent Hy 팀이 공개한 295B 파라미터 규모의 Mixture-of-Experts 기반 인스트럭션 모델의 FP8 양자화 버전으로, 입력마다 상위 8개 전문가를 활성화하는 MoE 설계로 21B 활성 파라미터 수준에서 고용량 표현을 유지한다. 모델은 GQA 기반 어텐션과 3.8B 규모의 MTP 레이어를 포함하며 최대 256K 토큰의 장기 컨텍스트를 지원해 멀티턴 대화와 장기 문맥 작업에 초점을 맞춘다. 배포 측면에서는 AngelSlim을 통한 저비트 양자화와 vLLM·SGLang 레시피를 제공해 실전 운영에서 메모리 및 비용 절감 경로를 확보했으며 내부 평가에서는 전문가 블라인드 점수와 환각률·다중 회차 이슈 감소 수치가 공개되어 제품 적용 관점의 개선이 확인되었다. 단점으로는 MoE 기반 대규모 모델의 특성상 분산·하드웨어 요구량이 높아 권장 구성(예: 8개 GPU, H20-3e 등)을 충족해야 본래 성능과 효율을 얻을 수 있다.
핵심 포인트
- 대규모 전체 파라미터(295B)와 비교적 작은 활성 파라미터(21B)를 결합한 MoE 설계가 Hy3의 핵심 차별점으로, 이 구조는 표현 용량을 크게 유지하면서 실제 추론 비용을 낮추는 방법으로 설계되었다. 전문가 집합을 192개로 구성하고 상위 8개를 활성화하는 정책은 입력별 전문화된 처리를 가능하게 해 특정 작업에서 효율을 확보한다. 따라서 동일 수준의 활성 파라미터 대비 더 풍부한 모델 용량을 활용할 수 있다.
- 배포 관점에서 FP8 양자화와 AngelSlim 툴킷을 공식적으로 지원해 대형 모델의 운영 비용을 낮추는 생태계를 제공하는 점이 차별화 포인트이다. README는 Hy3-FP8 가중치를 공개하고 vLLM·SGLang 레시피를 함께 제공해 배포 재현성과 실무 적용 시간을 줄였다. 이 접근은 대형 MoE 모델을 실제 제품 환경에 도입하려는 팀에 직접적인 이점을 제공한다.
- 제품 피드백을 반영한 포스트트레이닝과 SFT+RL 공동 최적화로 도구 호출 안정성, 환각률 감소, 멀티턴 의도 유지 등 실제 사용성 지표를 개선한 점이 실전 적용에서의 차별점이다. README에는 내부 지표 감소 수치와 블라인드 평가 결과가 제시되어 있어 단순 벤치마크 점수 이상의 실무 지표 개선을 목표로 했음이 확인된다. 이로 인해 Hy3는 에이전트·생산성 업무에 초점을 맞춘 구현에서 강점을 가진다.
- Hy3는 동일 계열의 모델 대비 대규모 전체 파라미터를 보유하면서도 MoE 구조로 활성 파라미터를 제한해 추론 효율을 달성한 점이 강점이다. README에서는 동급 모델 대비 우수한 성능을 보이며, 더 큰 플래그십 오픈소스 모델들과도 경쟁력이 있다고 명시되어 있다. FP8 양자화와 AngelSlim 툴셋을 통해 배포 비용을 줄이는 옵션을 제공해 실무 적용성에서 이점이 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Blind expert evaluation | expert score (out of 4) | 2.67/4 | GLM-5.1: 2.51/4 |
| Internal hallucination rate | hallucination rate | 5.4% | from 12.5% |
| Multiturn issue rate (internal) | issue rate | 7.9% | from 17.4% |
이미지 분석


53
LIKES
10.7k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.