본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

deepseek-ai/DeepSeek-V4-Pro-DSpark

자연어 생성(text-generation)과 장문 문맥 이해, 코드·수리 문제 해결 및 에이전트형 작업을 포함한 추론 중심 태스크들을 수행한다.1.6T (DeepSeek-V4-Pro, 활성화 49B) 및 284B (DeepSeek-V4-Flash, 활성화 13B) 등 변형별 표기1K 컨텍스트MIT

DeepSeek-V4는 MoE 아키텍처와 CSA/HCA 하이브리드 어텐션, FP8/FP4 혼합 정밀도를 결합해 1M 토큰 문맥에서 낮은 KV 캐시와 낮은 단일 토큰 FLOPs로 고성능 추론을 구현한 대형 언어모델 시리즈이다.

학습 방식 · 사전학습은 32T 이상의 다양하고 고품질 토큰으로 수행되었고, 이후 SFT와 GRPO 기반의 도메인별 전문가 육성 단계를 거친 다음 온-정책 증류로 통합하는 두 단계의 포스트트레이닝 파이프라인을 적용했다. 이 과정에서 개별 전문가들은 독립적으로 특화 능력을 키우고 통합 단계에서 정책 일관성 및 지식 통합을 확보하도록 설계되었다. Muon Optimizer가 최적화와 수렴 안정성 향상을 위해 학습 과정 전반에 사용되었다.

TL;DR

DeepSeek-V4 시리즈는 MoE 아키텍처와 하이브리드 어텐션(CSA+HCA), 그리고 FP4/FP8 혼합 정밀도를 결합해 최대 1,000,000 토큰의 장문 컨텍스트를 실용적으로 처리하도록 설계된 대형 언어모델 군이다. 이 시리즈는 32T 토큰 이상의 사전학습과 SFT·GRPO 기반 전문가 육성 후 온-정책 증류로 통합하는 두 단계의 사후학습 파이프라인을 거쳐 도메인별 전문성과 통합 역량을 확보했다. 아키텍처적 핵심은 어텐션 압축과 mHC 연결을 통해 장문에서 단일 토큰 당 FLOPs와 KV 캐시를 크게 낮춘 것이며 README는 1M 토큰 환경에서 Pro 변형이 기존 버전 대비 27% FLOPs와 10% KV 캐시를 사용한다고 표기했다. 그 결과 코드·수리·추론 벤치마크에서 높은 성능이 보고되며 DSpark 같은 추측적 디코딩 변형은 동일 체크포인트로 저지연 모드를 추가해 배포 유연성을 제공하지만, 혼합 정밀도와 MoE 운용은 구현·하드웨어 요건과 정밀도 관리의 트레이드오프를 수반한다.

핵심 포인트

  • DeepSeek-V4는 CSA와 HCA를 결합한 하이브리드 어텐션을 통해 1M 토큰 문맥에서 FLOPs와 KV 캐시를 대폭 절감한 점이 차별화 요소이다. 이 접근법은 긴 문맥 확장성 문제를 아키텍처 수준에서 해결하려는 설계 결정을 반영한다. README는 수치(27% FLOPs, 10% KV 캐시)를 통해 이 차별점을 정량적으로 제시했다.
  • 모델 아키텍처는 대규모 MoE 구조와 활성화된 파라미터 개념을 결합하여 동일한 총 파라미터 수에서도 실사용 추론 비용을 낮춘다. 활성화된 파라미터 기준으로 Pro와 Flash 변형을 구분해 운영 유연성을 제공하며, 이는 대형 모델의 실무적 적용성을 높이는 방향이다. 이 차별점은 모델 변형별 표와 활성화 파라미터 수치로 확인된다.
  • 사후학습 파이프라인에서 도메인별 전문가를 독립적으로 육성한 뒤 온-정책 증류로 통합하는 워크플로우는 도메인 전문성 확보와 정책 일관성 유지라는 양면을 동시에 목표로 삼는다. 이 통합 흐름은 단일 모델이 다양한 도메인 능력을 보유하도록 설계된 점에서 다른 공개 모델들과 구별된다. README는 이 프로세스를 명시적으로 기술해 차별성을 부각했다.
  • 장문 컨텍스트 처리에서의 효율성이 README 수치로 뒷받침되어, 1M 토큰 설정에서 Pro 변형은 이전 버전 대비 단일 토큰 FLOPs를 27%로 줄이고 KV 캐시를 10%로 유지하는 설계적 우위를 보인다. 이 수치는 긴 문서·대화 상태를 유지해야 하는 시스템에서 메모리와 연산 비용 측면의 실질적 이점을 의미한다. 결과적으로 장문 관련 벤치인 LongBench-V2나 MRCR 1M에서 유의미한 성능 향상이 보고되었다.

벤치마크

벤치마크지표비교
MMLU (EM, 5-shot)EM90.1
HumanEval (Pass@1, 0-shot)Pass@176.8
LongBench-V2 (EM, 1-shot)EM51.5
LiveCodeBench (Pass@1, V4-Pro Max)Pass@193.5
MRCR 1M (MMR, V4-Pro Max)MMR83.5

이미지 분석

성능 도표는 모델 변형별 벤치마크 성적을 종합적으로 비교한 그래픽 요약으로 보인다. 표의 수치와 대응하여 Pro 계열이 Flash 계열보다 다수의 추론·지식 벤치에서 우위를 보이는 패턴이 시각적으로 강조되어 있다. 해당 이미지는 README의 벤치마크 표를 시각화한 자료로서 모델별 장단점과 모드별 성능 변화를 빠르게 파악하는 근거 자료 역할을 한다.
이미지는 여러 벤치에서 Pro 변형이 전반적으로 더 높은 점수를 획득하고 Think Max 모드에서 성능이 향상되는 추세를 시각적으로 요약한다. 막대·행렬 형태의 시각화는 LiveCodeBench, MMLU, MRCR 1M 등 장르별 주요 지표에서 Pro가 더 높은 값을 보이며 Flash는 경량 활성화 프로파일에서 효율적이라는 상대적 특징을 드러낸다. 이 시각적 요약은 README 표의 수치(예: HumanEval 76.8, LongBench-V2 51.5 등)를 근거로 하여 모델별 상대적 강점을 직관적으로 전달한다.

470

LIKES

36.5k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.