섹션별 상세
DeepSeek V3.2의 핵심 아키텍처 변화는 DeepSeek Sparse Attention(DSA)의 도입이다. DSA는 슬라이딩 윈도우 방식과 유사하게 과거 토큰의 일부에만 어텐션을 수행하지만, 고정된 윈도우 대신 'Lightning Indexer'와 'Token Selector'를 통해 학습된 방식으로 관련성 높은 토큰을 선택한다. 이를 통해 어텐션의 연산 복잡도를 O(L^2)에서 O(Lk)로 줄여 긴 컨텍스트 처리 효율을 높였다.



수학적 추론 능력을 극대화하기 위해 DeepSeekMath V2의 자기 검증(Self-Verification) 프레임워크를 채택했다. 이는 정답의 유무뿐만 아니라 중간 추론 과정의 논리적 엄밀함을 LLM 기반 검증기(Verifier)와 메타 검증기(Meta-verifier)를 통해 평가하고 학습에 반영하는 방식이다. 학습된 모델은 추론 시 별도의 검증기 없이도 스스로 오류를 수정하는 자기 정제(Self-Refinement) 능력을 갖추게 된다.


강화학습 알고리즘인 GRPO(Group Relative Policy Optimization)에 여러 기술적 업데이트가 적용되었다. 도메인별로 KL 발산(KL Divergence)의 강도를 다르게 설정하고, 특히 수학 도메인에서는 KL 페널티를 낮추거나 제거하여 최적의 성능을 끌어냈다. 또한 오프-폴리시(Off-policy) 데이터 재사용 시 정책 드리프트를 측정하여 부적절한 시퀀스를 마스킹하는 등 학습 안정성을 개선했다.
추론 스케일링(Inference Scaling)을 극대화한 'DeepSeek V3.2-Speciale' 변체 모델을 함께 공개했다. 이 모델은 RL 단계에서 추론 데이터 위주로 학습되었으며, 답변 길이에 대한 페널티를 줄여 모델이 더 길고 깊게 생각할 수 있도록 유도한다. 이는 더 많은 토큰을 생성하는 대신 복잡한 문제 해결 능력을 높이는 전략이다.
기술
- DeepSeek V3.2
- MLA
- DSA
- GRPO
- RLVR
활용 사례
- 복잡한 수학 문제 해결
- 긴 컨텍스트 기반 RAG
- 자율 코딩 에이전트
- 고성능 추론 서비스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 03.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

