295B MoE 기반 Hy3-FP8, 256K 컨텍스트와 FP8 압축 지원
Hy3-FP8는 295B MoE 구조에서 21B 활성 파라미터를 사용하는 FP8 양자화 인스트럭션 LLM으로, 최대 256K 토큰의 컨텍스트와 배포용 레시피를 제공한다.
TL;DR
Hy3-FP8는 Tencent Hy 팀이 공개한 295B 파라미터 규모의 Mixture-of-Experts 기반 인스트럭션 모델의 FP8 양자화 버전으로, 입력마다 상위 8개 전문가를 활성화하는 MoE 설계로 21B 활성 파라미터 수준에서 고용량 표현을 유지한다. 모델은 GQA 기반 어텐션과 3.8B 규모의 MTP 레이어를 포함하며 최대 256K 토큰의 장기 컨텍스트를 지원해 멀티턴 대화와 장기 문맥 작업에 초점을 맞춘다. 배포 측면에서는 AngelSlim을 통한 저비트 양자화와 vLLM·SGLang 레시피를 제공해 실전 운영에서 메모리 및 비용 절감 경로를 확보했으며 내부 평가에서는 전문가 블라인드 점수와 환각률·다중 회차 이슈 감소 수치가 공개되어 제품 적용 관점의 개선이 확인되었다. 단점으로는 MoE 기반 대규모 모델의 특성상 분산·하드웨어 요구량이 높아 권장 구성(예: 8개 GPU, H20-3e 등)을 충족해야 본래 성능과 효율을 얻을 수 있다.
핵심 역량
- 일반적인 인스트럭션 대응형 텍스트 생성 능력을 제공하며 온-디바이스 또는 분산 배포 환경에서 FP8 양자화로 메모리 비용을 낮출 수 있다. Hy3의 MoE 구조는 입력 쿼리마다 일부 전문가만 활성화해 대형 용량에서 효율적인 추론을 가능하게 한다. 제공되는 배포 레시피와 툴 파서는 실제 제품의 도구 호출 시나리오를 안정적으로 처리하도록 설계되었다.
- 에이전트용 도구 호출과 포맷 제약을 갖는 워크플로에서 높은 안정성을 목표로 설계되었으며 도구 호출 실패 복구와 출력 포맷 일관성 개선이 적용되어 있다. README에 따르면 다양한 에이전트 스캐폴드에서 출력 분산(accuracy variance)이 좁게 유지되는 결과가 관찰되었다. 이 특성은 복수의 툴이 연계되는 자동화 파이프라인에서 일관된 동작을 보장하는 데 유리하다.
- 긴 문맥과 다중 회차 대화에서 핵심 참조를 유지하는 능력이 향상되어 핵심어치환·생략·대화 의도 전파와 같은 문제에서 개선이 보고되었다. 내부 다중 회차 평가에서 문제 발생률이 눈에 띄게 감소했으며 이는 장기 대화 시스템에서 의도 표류를 줄이는 데 직접적인 영향을 준다. 또한 reasoning_effort 옵션을 통해 복잡한 추론 작업에서 더 깊은 체인-오브-생각 모드를 활성화할 수 있다.
강점
- Hy3는 동일 계열의 모델 대비 대규모 전체 파라미터를 보유하면서도 MoE 구조로 활성 파라미터를 제한해 추론 효율을 달성한 점이 강점이다. README에서는 동급 모델 대비 우수한 성능을 보이며, 더 큰 플래그십 오픈소스 모델들과도 경쟁력이 있다고 명시되어 있다. FP8 양자화와 AngelSlim 툴셋을 통해 배포 비용을 줄이는 옵션을 제공해 실무 적용성에서 이점이 있다.
- 제품 피드백 기반의 개선으로 도구 호출의 안정성과 출력 포맷 일관성이 향상되어 실제 에이전트 시나리오에서 신뢰도를 끌어올린 점이 장점이다. 내부 평가에서 환각률과 상식 오류율, 멀티턴 이슈율이 유의미하게 감소한 수치가 공개되어 있어 품질 개선이 계량적으로 확인된다. vLLM과 SGLang에 대한 구체적 레시피를 제공해 운영 편의성도 확보했다.
훈련 방식
Hy3 기반 모델은 대규모 MoE 설계에서 출발해 포스트트레이닝 단계에서 50개 이상의 제품 피드백을 반영하고 고품질 데이터로 스케일업한 뒤 RL(강화학습) 기반의 추가 학습을 확대했다. 문서에는 SFT와 RL의 공동 최적화를 통해 멀티턴 의도 유지와 장기 문맥 처리를 개선했다고 기술되어 있다. 훈련 데이터의 품질 정제와 학습 제약을 도입해 사실성(anti-hallucination) 개선에도 중점을 두었다.
알아두면 좋은 것
- Hy3는 총 295B 파라미터의 MoE 모델이며 활성화되는 파라미터는 21B로 설정되어 있다. 문서에는 192개의 전문가 중 상위 8개를 활성화하는 구성과 MTP 레이어 3.8B 파라미터가 명시되어 있어 모델 용량과 활성화 전략이 분리되어 설계된 점이 강조되어 있다. 컨텍스트 길이는 256K로 장기 문맥 처리에 초점이 맞춰져 있다.
- Hy3-FP8로 명명된 FP8 양자화된 가중치가 공개되어 양자화된 배포를 위한 레시피와 AngelSlim 툴킷 사용 안내가 포함되어 있다. README는 AngelSlim이 저비트 양자화와 샘플링 관련 압축 기법을 포괄적으로 지원한다고 기술하고 있어 대형 모델의 실전 배포 비용을 낮추는 목적이 명확하다. vLLM과 SGLang을 위한 구체적 실행 명령어와 권장 GPU 구성이 제공되어 운영 적용이 용이하다.
- 제품 피드백과 내부 평가를 통해 도구 호출 안정성, 환각(hallucination) 감소, 멀티턴 의도 유지 등 실제 사용성 개선 작업이 이루어졌으며 특정 지표 변화치가 README에 수치로 기재되어 있다. README 예시로는 전문가 블라인드 평가 점수와 내부 환각률·상식 오류율·다중 회차 이슈율의 감소 수치가 포함되어 있다. 이로 인해 모델이 단순 벤치마크뿐만 아니라 실제 제품 호환성 측면에서 보완되었음이 드러난다.
- 배포와 미세조정 문서, vLLM·SGLang 레시피, finetuning 가이드와 함께 모델 소스 링크가 제공되어 연구·제품 양쪽에서 재현과 적용이 가능하다. Hy3 저장소와 관련 리소스가 공개되어 있어 사용자는 제공된 가이드에 따라 서버를 구축하고 FP8 모델을 운영할 수 있다. 라이선스는 Apache-2.0으로 개별적 상업적 사용 시 라이선스 제약이 비교적 낮다.
기술적 특징
- 모델 아키텍처는 Mixture-of-Experts 구조로, 총 192개의 전문가를 보유하고 입력마다 top-8 전문가만 활성화해 추론 시 필요한 파라미터만 실행하도록 설계되었다. 이로 인해 전체 파라미터 규모(295B)는 크되 실제 활성 파라미터는 21B 수준으로 유지되어 계산 효율과 표현 용량을 동시에 확보한다. MTP 레이어는 별도 3.8B 파라미터로 도입되어 특정 계층에서 성능 향상을 도모한다.
- 어텐션 구성은 GQA 기반으로 전체 64개 헤드를 사용하고 8개의 KV 헤드를 구분해 헤드 차원과 메모리 배분을 최적화했다. 이러한 헤드 분할은 긴 컨텍스트 처리에서 어텐션 계산 비용과 표현력 사이의 균형을 맞추는 설계적 선택이다. 결과적으로 Hy3는 256K 토큰의 장기 문맥을 지원하도록 설계되었다.
- 배포·추론 측면에서는 FP8 양자화와 AngelSlim 툴킷 지원으로 저비트 표현을 통해 메모리와 대역폭을 절감할 수 있도록 설계되었다. README에 Hy3-FP8가 공개되어 있으며 vLLM과 SGLang을 위한 구체적 실행 레시피가 제공되어 실제 운영 환경에서 양자화 모델을 적용하기 쉽다. 이 조합은 대규모 MoE 모델을 비교적 적은 GPU 리소스로 서비스하는 데 기여한다.
- 추론 효율과 제품 적용성을 위해 vLLM과 SGLang에서 MTP·speculative sampling 관련 설정 레시피를 제공하며, SFT와 RL의 공동 최적화를 통해 다중 회차 의도 유지 및 도구 호출 안정성을 개선했다. README의 배포 예시는 텐서 병렬 크기 설정과 추측 토큰 수 등 실전 파라미터를 명시해 운영자가 곧바로 적용할 수 있게 구성되어 있다. 이로 인해 연구 단계가 아닌 제품 적용 관점에서의 실용성이 높아졌다.
차별점
- 대규모 전체 파라미터(295B)와 비교적 작은 활성 파라미터(21B)를 결합한 MoE 설계가 Hy3의 핵심 차별점으로, 이 구조는 표현 용량을 크게 유지하면서 실제 추론 비용을 낮추는 방법으로 설계되었다. 전문가 집합을 192개로 구성하고 상위 8개를 활성화하는 정책은 입력별 전문화된 처리를 가능하게 해 특정 작업에서 효율을 확보한다. 따라서 동일 수준의 활성 파라미터 대비 더 풍부한 모델 용량을 활용할 수 있다.
- 배포 관점에서 FP8 양자화와 AngelSlim 툴킷을 공식적으로 지원해 대형 모델의 운영 비용을 낮추는 생태계를 제공하는 점이 차별화 포인트이다. README는 Hy3-FP8 가중치를 공개하고 vLLM·SGLang 레시피를 함께 제공해 배포 재현성과 실무 적용 시간을 줄였다. 이 접근은 대형 MoE 모델을 실제 제품 환경에 도입하려는 팀에 직접적인 이점을 제공한다.
- 제품 피드백을 반영한 포스트트레이닝과 SFT+RL 공동 최적화로 도구 호출 안정성, 환각률 감소, 멀티턴 의도 유지 등 실제 사용성 지표를 개선한 점이 실전 적용에서의 차별점이다. README에는 내부 지표 감소 수치와 블라인드 평가 결과가 제시되어 있어 단순 벤치마크 점수 이상의 실무 지표 개선을 목표로 했음이 확인된다. 이로 인해 Hy3는 에이전트·생산성 업무에 초점을 맞춘 구현에서 강점을 가진다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Blind expert evaluation | expert score (out of 4) | 2.67/4 | GLM-5.1: 2.51/4 |
| Internal hallucination rate | hallucination rate | 5.4% | from 12.5% |
| Multiturn issue rate (internal) | issue rate | 7.9% | from 17.4% |
이미지 분석


53
Likes
10.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.