약 600원으로 2시간 만에 구축하는 26M 초경량 MiniMind
Research·Python0 / 0
PyTorch를 사용하여 26M 파라미터 규모의 GPT 모델을 데이터 정제부터 강화학습까지 직접 구현하는 오픈소스 프로젝트
주요 기능
- 26M에서 145M 사이의 초경량 Dense 및 MoE 아키텍처 모델 제공
- PyTorch 기반의 토크나이저, 사전 학습, SFT, LoRA, RLHF 전 과정 코드 포함
- DeepSeek-R1의 추론 능력을 이식하는 모델 증류 및 GRPO 강화학습 구현
- llama.cpp, vLLM, Ollama 등 주요 추론 엔진과의 완벽한 호환성 지원
- 이미지 이해가 가능한 멀티모달 VLM 확장 버전 MiniMind-V 지원
어떻게 동작하는가
PyTorch 원형 코드를 사용하여 Transformer 블록을 직접 구성하고, 6,400개 규모의 경량 토크나이저를 통해 임베딩 층의 파라미터 비중을 최소화하여 연산 효율을 극대화한다. 사전 학습 이후 SFT와 DPO/GRPO 과정을 거쳐 소규모 파라미터에서도 논리적 대화가 가능하도록 최적화한다가 특징이다. (README 근거: PyTorch原生重构, 6
사용 사례
- 개인용 GPU 환경에서 LLM의 학습 메커니즘을 단계별로 실습하고 내부 로직을 검증할 때 사용
- 특정 도메인의 소규모 데이터를 활용하여 리소스가 제한된 환경에서 작동하는 전용 소형 모델 구축
- DeepSeek-R1과 같은 최신 추론 모델의 증류 기법을 연구하고 로컬 환경에 직접 적용
43.3k
Stars
5.2k
Forks
+556
Trending
0
조회수
43.3k watchers37 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.