100M 파라미터로 구현한 DeepSeek V4 아키텍처의 효율적 MoE 모델
텍스트 생성 및 대화형 질의응답100Mapache-2.0
DeepSeek V4 아키텍처와 MoE 구조를 채택하여 100M 규모에서 효율적인 텍스트 생성과 대화 성능을 구현한 초소형 언어 모델이다.
핵심 역량
- 멀티턴 대화 수행
- 지시사항 이행
- 텍스트 생성 및 요약
- 자연어 질의응답
강점
- 100M 규모의 초경량 파라미터로 저사양 환경 최적화
- DeepSeek V4 최신 아키텍처를 통한 구조적 효율성 확보
- Apache 2.0 라이선스로 자유로운 배포 및 활용 가능
훈련 방식
nanowhale-100m-base 기반 DeepSeek V4 MoE 아키텍처 적용 및 FineWeb-Edu, smol-smoltalk 데이터셋 활용 SFT
알아두면 좋은 것
- HuggingFaceFW/fineweb-edu 데이터셋을 통한 교육적 데이터 학습
- HuggingFaceTB/smol-smoltalk 데이터셋을 활용한 대화 능력 강화
- DeepSeek V4 아키텍처 기반의 MoE 구조 적용
- Apache 2.0 라이선스로 상업적 이용 및 수정 가능
50
Likes
2.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.