본문으로 건너뛰기
Hacker News - LLM조회 29

11세 소년이 1달러로 직접 학습시킨 커스텀 MoE LLM 'Wind Arc 1.6' 공개

11세 개발자 Arthur가 Qwen 1.7B를 기반으로 커스텀 MoE 아키텍처를 설계하고 RTX 5090을 활용해 1달러의 비용으로 학습시킨 3.6B 모델을 발표했다.

섹션별 상세

기존 MLP 레이어의 비효율성을 개선하기 위해 커스텀 MoE(Mixture of Experts) 아키텍처를 설계했다. 각 레이어에 4개의 라우팅 전문가와 1개의 공유 전문가를 배치하여 연산 효율을 높이고 성능을 최적화했다. Qwen 1.7B 베이스 모델의 FFN 레이어를 이 구조로 완전히 대체하여 3.6B 파라미터 규모로 확장했다. 이를 통해 모델의 용량은 늘리면서도 실제 추론 시 활성화되는 파라미터 수를 조절할 수 있게 됐다.
컨텍스트 윈도우 확장과 학습 안정성을 위해 최신 기술인 YaRN RoPE와 QK-Norm을 도입했다. YaRN RoPE를 통해 기존 8k였던 컨텍스트 길이를 32k 토큰까지 확장했으며, QK-Norm을 적용해 학습 중 발생할 수 있는 수치적 불안정성을 해결했다. 또한 4개 레이어마다 전체 어텐션을 수행하고 나머지는 슬라이딩 윈도우 방식을 사용하는 하이브리드 어텐션 구조를 채택했다. 이는 긴 문맥 처리 능력과 연산 속도 사이의 균형을 맞추기 위한 선택이다.
고성능 GPU 렌탈 서비스를 활용해 극도로 낮은 비용과 짧은 시간 내에 학습을 완료했다. Nova Cloud에서 RTX 5090 1대를 대여하여 단 55분 만에 학습을 마쳤으며, 이에 소요된 비용은 약 1달러 수준이다. FineWeb-Edu, python-codes-25k 등 고품질 데이터셋과 직접 작성한 데이터를 혼합하여 학습 데이터로 사용했다. 거대 모델에 비하면 손실값(2.66)이 높지만, 개인 개발자가 저비용으로 독자적인 모델을 구축할 수 있음을 증명했다.

용어 해설

전문가 혼합 구조(MoE)
모델의 전체 파라미터 중 일부 전문가(Expert) 신경망만 선택적으로 활성화하여 연산 효율을 높이는 구조이다. 모든 데이터를 처리하는 대신 입력값에 적합한 전문가에게 작업을 할당함으로써 모델 크기 대비 추론 비용을 획기적으로 줄인다.
YaRN 회전 위치 임베딩(YaRN RoPE)
회전 위치 임베딩(RoPE)을 개선하여 모델의 대규모 재학습 없이도 컨텍스트 윈도우를 효과적으로 확장하는 기법이다. 보간법을 통해 고주파 정보를 유지하면서도 더 긴 문장을 처리할 수 있게 하여 모델의 활용 범위를 넓힌다.
쿼리-키 정규화(QK-Norm)
Attention 메커니즘에서 쿼리(Query)와 키(Key) 행렬에 정규화를 적용하여 학습 시 수치적 안정성을 높이는 기술이다. 대규모 모델 학습 중 발생할 수 있는 그래디언트 폭주를 방지하고 손실값의 수렴을 돕는 역할을 한다.
하이브리드 어텐션(Hybrid Attention)
전체 어텐션(Full Attention)과 슬라이딩 윈도우 어텐션을 번갈아 사용하여 메모리 효율과 성능의 균형을 맞추는 방식이다. 모든 토큰을 참조하는 대신 특정 레이어에서만 전체를 참조함으로써 연산 속도를 높이면서도 긴 문맥 정보를 유지한다.

기술

  • Qwen
  • RTX 5090
  • YaRN RoPE
  • QK-Norm
  • MoE

활용 사례

  • 로컬 환경에서의 코딩 보조
  • 특정 도메인 지식 답변
  • 저사양 하드웨어용 LLM 배포

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 23.수집 2026. 03. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.