본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

tencent/Hy3-FP8

주요 수행 과제는 인스트럭션 기반 텍스트 생성이며 코딩, 제품성 업무 자동화, 에이전트형 작업에서 도구 호출과 멀티턴 대화 관리가 포함된다. README에 따르면 장기 문맥 유지와 멀티턴 의도 추적, 도구 호출 안정성 개선을 위해 특별한 트레이닝과 포스트트레이닝 파이프라인이 적용되었다. 또한 FP8 양자화 버전이 공개되어 메모리 제약이 있는 배포 환경에서도 텍스트 생성 파이프라인을 운영할 수 있다.295B total, 21B active, 3.8B MTP layer256K 컨텍스트apache-2.0

Hy3-FP8는 295B MoE 구조에서 21B 활성 파라미터를 사용하는 FP8 양자화 인스트럭션 LLM으로, 최대 256K 토큰의 컨텍스트와 배포용 레시피를 제공한다.

학습 방식 · Hy3 기반 모델은 대규모 MoE 설계에서 출발해 포스트트레이닝 단계에서 50개 이상의 제품 피드백을 반영하고 고품질 데이터로 스케일업한 뒤 RL(강화학습) 기반의 추가 학습을 확대했다. 문서에는 SFT와 RL의 공동 최적화를 통해 멀티턴 의도 유지와 장기 문맥 처리를 개선했다고 기술되어 있다. 훈련 데이터의 품질 정제와 학습 제약을 도입해 사실성(anti-hallucination) 개선에도 중점을 두었다.

TL;DR

Hy3-FP8는 Tencent Hy 팀이 공개한 295B 파라미터 규모의 Mixture-of-Experts 기반 인스트럭션 모델의 FP8 양자화 버전으로, 입력마다 상위 8개 전문가를 활성화하는 MoE 설계로 21B 활성 파라미터 수준에서 고용량 표현을 유지한다. 모델은 GQA 기반 어텐션과 3.8B 규모의 MTP 레이어를 포함하며 최대 256K 토큰의 장기 컨텍스트를 지원해 멀티턴 대화와 장기 문맥 작업에 초점을 맞춘다. 배포 측면에서는 AngelSlim을 통한 저비트 양자화와 vLLM·SGLang 레시피를 제공해 실전 운영에서 메모리 및 비용 절감 경로를 확보했으며 내부 평가에서는 전문가 블라인드 점수와 환각률·다중 회차 이슈 감소 수치가 공개되어 제품 적용 관점의 개선이 확인되었다. 단점으로는 MoE 기반 대규모 모델의 특성상 분산·하드웨어 요구량이 높아 권장 구성(예: 8개 GPU, H20-3e 등)을 충족해야 본래 성능과 효율을 얻을 수 있다.

핵심 포인트

  • 대규모 전체 파라미터(295B)와 비교적 작은 활성 파라미터(21B)를 결합한 MoE 설계가 Hy3의 핵심 차별점으로, 이 구조는 표현 용량을 크게 유지하면서 실제 추론 비용을 낮추는 방법으로 설계되었다. 전문가 집합을 192개로 구성하고 상위 8개를 활성화하는 정책은 입력별 전문화된 처리를 가능하게 해 특정 작업에서 효율을 확보한다. 따라서 동일 수준의 활성 파라미터 대비 더 풍부한 모델 용량을 활용할 수 있다.
  • 배포 관점에서 FP8 양자화와 AngelSlim 툴킷을 공식적으로 지원해 대형 모델의 운영 비용을 낮추는 생태계를 제공하는 점이 차별화 포인트이다. README는 Hy3-FP8 가중치를 공개하고 vLLM·SGLang 레시피를 함께 제공해 배포 재현성과 실무 적용 시간을 줄였다. 이 접근은 대형 MoE 모델을 실제 제품 환경에 도입하려는 팀에 직접적인 이점을 제공한다.
  • 제품 피드백을 반영한 포스트트레이닝과 SFT+RL 공동 최적화로 도구 호출 안정성, 환각률 감소, 멀티턴 의도 유지 등 실제 사용성 지표를 개선한 점이 실전 적용에서의 차별점이다. README에는 내부 지표 감소 수치와 블라인드 평가 결과가 제시되어 있어 단순 벤치마크 점수 이상의 실무 지표 개선을 목표로 했음이 확인된다. 이로 인해 Hy3는 에이전트·생산성 업무에 초점을 맞춘 구현에서 강점을 가진다.
  • Hy3는 동일 계열의 모델 대비 대규모 전체 파라미터를 보유하면서도 MoE 구조로 활성 파라미터를 제한해 추론 효율을 달성한 점이 강점이다. README에서는 동급 모델 대비 우수한 성능을 보이며, 더 큰 플래그십 오픈소스 모델들과도 경쟁력이 있다고 명시되어 있다. FP8 양자화와 AngelSlim 툴셋을 통해 배포 비용을 줄이는 옵션을 제공해 실무 적용성에서 이점이 있다.

벤치마크

벤치마크지표비교
Blind expert evaluationexpert score (out of 4)2.67/4GLM-5.1: 2.51/4
Internal hallucination ratehallucination rate5.4%from 12.5%
Multiturn issue rate (internal)issue rate7.9%from 17.4%

이미지 분석

다양한 벤치마크에서 Hy3와 타 모델의 성능을 막대그래프로 비교한 종합 성능 시각화 차트이다.
이 이미지는 에이전트, 코딩, 장기 문맥 등 복수의 벤치마크 항목을 좌우로 배치하고 각 모델의 점수를 막대 형태로 표시해 모델별 상대 성능을 빠르게 파악하도록 구성되어 있다. Hy3 계열 막대가 강조 색상으로 표시되어 있어 동일 항목에서의 상대적 우수성과 약점을 한눈에 확인할 수 있다. README 본문에 명시된 블라인드 전문가 평가와 내부 지표 개선 사례를 보완하는 시각 자료로 사용되었다.
상세 벤치마크 표를 포함한 부록 이미지로, 개별 데이터 포인트와 비교 수치를 제시한 표 형식의 시각 자료이다.
이 부록 이미지는 각 벤치마크 항목에 대해 여러 모델의 세부 점수를 표 형태로 나열해 정량적 근거를 제공한다. 표에는 모델 간 미세한 성능 차이나 특정 작업에서의 우수 모델 식별이 가능하도록 수치가 배치되어 있어 README에서 요약한 주장들을 수치 근거로 뒷받침한다. 운영자가 모델 선택 시 특정 작업별 성능을 비교하는 데 직접적으로 활용할 수 있다.

53

LIKES

10.7k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.