Akahsizrr/fuse-1-Lite
코딩 특화 전문가를 이식하고 라우터만 학습한 경량 Mixture-of-Experts 모델
학습 방식 · 학습은 전문가 프로파일링→어셈블리→라우터 학습의 세 단계로 구성되어 있습니다. 먼저 Qwen3.6-35B-A3B의 전문가 활성화를 코딩/비코딩 프롬프트로 프로파일링하여 960개의 코딩 특화 전문가를 선택·추출하고, 추출한 전문가를 LFM2.5 디코더 레이어의 잔차 보강으로 통합한 다음 라우터와 레이어별 스케일만 AdamW로 최적화합니다. 손실은 LM 손실에 0.01×Load Balancing 항을 더했으며 라우터 학습률은 1e-3, 스케일 학습률은 1.0로 설정되어 있고 전체 학습은 극히 적은 예제(총 55개: 코딩 40, 일반 15)로 300스텝만 수행되었습니다.
TL;DR
fuse-1 Lite는 LiquidAI의 LFM2.5-2.6B를 호스트로 하고 Qwen3.6-35B-A3B에서 추출한 960개의 코딩 전문가를 잔차 보강 방식으로 이식한 5.72B Mixture-of-Experts 퓨전 모델로, 호스트와 전문가 가중치는 동결하고 라우터와 레이어별 스케일(총 약 2.0M 파라미터)만 학습합니다. 토큰별 top-8 라우팅과 전문가 출력의 표준편차 정규화, 스케일 클램프 등의 안정화 기법을 통해 코딩 관련 토큰에서만 전문가를 선택적으로 활성화하도록 설계되어 있으며 라우터는 최종적으로 30개 레이어 중 11개 레이어에서 주로 전문가를 활성화하도록 학습되었습니다. 학습은 300스텝, 약 8.3분에 걸쳐 소량의 예제로 진행되어 비용 효율성을 노리는 반면 데이터의 제한으로 일반화와 전문가 호환성 검증이 필요하고, 배포는 bfloat16/8bit/4bit, MLX, GGUF, vLLM 플러그인 등 다양한 옵션을 제공하지만 커스텀 아키텍처로 인한 추가 설정이 요구됩니다.
핵심 포인트
- fuse-1 Lite는 LiquidAI의 LFM2.5-2.6B를 호스트로 삼고 Qwen3.6-35B-A3B에서 추출한 960개의 코딩 전문 expert를 이식하는 Mixture-of-Experts 기반 퓨전 설계입니다. 전문가 가중치는 그대로 통합하고 호스트와 전문가 블록은 동결한 채, 토큰별로 어떤 expert를 활성화할지 결정하는 라우터와 레이어별 스케일만 학습합니다. 이 방식은 지식 증류나 전체 재학습 없이 대형 모델의 코딩 역량을 소형 호스트에 효율적으로 주입하는 것을 목표로 합니다.
- 시스템 구성과 운영 방식은 구체적입니다. 총 파라미터는 5.72B이며 호스트는 2.70B, 추출된 전문가 파라미터는 3.02B로 표기되어 있고 학습 가능한 파라미터는 라우터와 스케일 등 약 2.0M에 불과합니다. 라우터는 토큰별로 top-8 experts를 선택하고 전문가 중간 크기는 512이며, 전문가 출력은 호스트 표준편차로 정규화된 뒤 학습된 스케일로 잔차로 더해지는 흐름을 가집니다.
- 학습과 배포 측면에서 비용과 옵션이 강조되어 있습니다. 라우터 학습은 300 스텝, 실측 시간은 Modal L4에서 8.3분이며 전체 학습 비용은 약 3달러로 기재되어 있습니다. 배포용으로 bfloat16 safetensors와 bitsandbytes 8‑bit/4‑bit(NF4) 양자화 버전, MLX(Apple Silicon), GGUF(특수 llama.cpp 포크 필요), vLLM 플러그인 등 다양한 포맷을 제공해 VRAM 제약에 따라 선택할 수 있도록 설계되어 있습니다.
제한사항
- 커스텀 아키텍처를 포함하므로 모델 로딩 시 trust_remote_code=True가 필요합니다. README에 Fuse3ForCausalLM과 관련 커스텀 로더·플러그인 코드가 포함되어 있어 표준 Transformers/llama.cpp 환경에서는 그대로 동작하지 않을 수 있습니다. 사용자 측에서는 추가 빌드나 플러그인 설치가 요구됩니다.
- 라우터 학습에 사용된 데이터가 매우 제한적입니다. 라우터는 55개의 예제(코딩 40, 일반 15)로만 학습되었고 이로 인해 모든 코딩 상황에 대해 완전한 일반화가 보장되지 않습니다. README 자체에서도 일반화 한계와 전문가 호환성 문제를 명시하고 있어 실무 적용 전 검증이 필요합니다.
- 전문가 이식 과정에서 활성화 정규화와 스케일 클램프 등 안정화 장치를 사용합니다. 전문가 출력은 호스트 레이어 표준편차로 정규화되고 스케일은 순전파 시 상한으로 제한되며 SwiGLU 중간값도 클램프되어 학습 안정성을 확보합니다. 이 과정은 전문가 지식의 일부가 변환 과정에서 소실될 가능성을 내포하고 있음을 README가 명시하고 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Code Generation / HumanEval (style) | pass@1 | TBD | — |
71
Likes
201
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.