본문으로 건너뛰기
Hacker News - LLM조회 16

MiniMind: 3,000원으로 2시간 만에 바닥부터 만드는 초소형 언어 모델

25.8M 파라미터의 초소형 언어 모델을 바닥부터 학습시키는 전 과정을 오픈소스로 공개하여 LLM의 내부 작동 원리와 학습 메커니즘을 학습할 수 있게 한다.

섹션별 상세

기존 LLM 프레임워크의 고도화된 추상화가 학습자의 내부 원리 이해를 방해하는 문제를 해결하고자 한다. 모든 핵심 알고리즘을 PyTorch 기본 기능으로 재구현하여 데이터가 모델을 거쳐 출력되는 전 과정을 투명하게 공개했다. 이를 통해 사용자는 라이브러리 호출 대신 각 레이어와 최적화 기법의 실제 구현을 직접 학습할 수 있다.
모델 아키텍처는 Llama 3.1과 유사한 Decoder-only 구조를 채택했으며 Dense 모델과 MoE 모델을 모두 지원한다. RMSNorm, SwiGLU, RoPE 등 현대적인 LLM의 필수 구성 요소를 포함하여 소규모임에도 효율적인 추론 성능을 낸다. 특히 MoE 구조는 DeepSeek-V2/3의 설계를 참고하여 전문가 분할 및 공유 전문가 격리 기술을 적용했다.
학습 파이프라인은 지식 습득을 위한 Pretraining, 대화 스타일 학습을 위한 SFT, 그리고 AI 피드백 기반의 정렬 단계를 체계적으로 구성했다. 특히 최근 주목받는 DeepSeek-R1의 추론 방식을 모방한 MiniMind-Reason 모델 증류 과정을 포함하여 소형 모델에서의 추론 능력 구현 가능성을 탐색한다. 이는 복잡한 강화학습 없이도 데이터 기반으로 추론 성능을 개선하는 실무적 대안을 제시한다.
bash
torchrun --nproc_per_node 1 train_pretrain.py
torchrun --nproc_per_node 1 train_full_sft.py

단일 GPU 환경에서 프리트레이닝 및 전체 파라미터 SFT를 실행하는 명령어

실무 환경과의 호환성을 위해 transformers, llama.cpp, vllm, ollama 등 주요 추론 엔진 지원 및 OpenAI API 규격 인터페이스를 제공한다. 이는 학습시킨 초소형 모델을 실제 애플리케이션이나 Streamlit 기반 웹 UI에 즉시 통합하여 테스트할 수 있게 한다. 사용자는 자신이 학습시킨 모델을 다양한 환경에서 즉각적으로 검증하고 배포할 수 있다.
json
"rope_scaling": {
  "type": "yarn",
  "factor": 16.0,
  "original_max_position_embeddings": 2048,
  "beta_fast": 32.0,
  "beta_slow": 1.0,
  "attention_factor": 1.0
}

YaRN 알고리즘을 사용하여 RoPE 위치 임베딩의 길이를 외삽하기 위한 설정값

python
python eval_llm.py --weight full_sft --inference_rope_scaling

학습된 SFT 모델을 RoPE 외삽 옵션과 함께 실행하여 성능을 테스트하는 코드

MiniMind2 모델의 실제 채팅 데모를 보여주는 GIF 이미지이다.
Screenshot모델이 사용자의 질문에 대해 실시간으로 답변을 생성하는 과정을 시연한다. 0.1B 미만의 초소형 모델임에도 불구하고 자연스러운 대화가 가능함을 시각적으로 증명하며, 프로젝트의 실질적인 결과물을 확인시켜 준다.

용어 해설

지도 미세 조정(SFT)
지시어와 답변 쌍으로 구성된 데이터를 통해 모델이 대화 형식을 익히도록 하는 학습 단계이다. 프리트레이닝된 모델이 사용자의 의도를 이해하고 적절한 답변 형식을 갖추게 하는 필수적인 과정이다.
전문가 혼합 구조(MoE)
전체 파라미터 중 입력에 따라 일부 전문가 네트워크만 활성화하여 연산 효율을 높이는 구조이다. 모델 용량은 키우면서도 실제 추론 시 계산량을 낮게 유지할 수 있어 효율적인 모델 설계에 활용된다.
그룹 상대 정책 최적화(GRPO)
별도의 비평가 모델 없이 그룹 내 상대적 보상을 사용하여 정책을 최적화하는 강화학습 기법이다. DeepSeek-R1에서 사용되어 주목받았으며, 모델 구조를 단순화하면서도 효율적인 정렬이 가능하다.
회전 위치 임베딩(RoPE)
토큰의 위치 정보를 회전 행렬을 통해 주입하여 상대적 위치 관계를 학습하는 방식이다. 절대적 위치 임베딩보다 길이 외삽에 유리하여 학습 범위를 넘어서는 긴 텍스트를 처리할 때 높은 성능을 유지한다.
직접 편호 최적화(DPO)
보상 모델 학습 없이 선호도 데이터를 직접 사용하여 모델을 인간의 가치관에 정렬시키는 기법이다. PPO보다 구현이 간단하고 안정적이며, 모델이 더 선호되는 답변을 생성하도록 유도하는 데 효과적이다.

기술

  • PyTorch
  • Python
  • transformers
  • llama.cpp
  • vllm
  • ollama
  • SwanLab

활용 사례

  • LLM 학습 교육용
  • 초소형 온디바이스 AI 실험
  • 특정 도메인 특화 소형 모델 구축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 24.수집 2026. 03. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.