테스트용 0.40B Kimi-K3 축소판
피처 추출(feature-extraction)을 위한 경량화된 테스트·개발용 모델0.40Bmit
moonshotai/Kimi-K3을 0.40B로 축소해 아키텍처 실험에 맞춘 Tiny 모델
TL;DR
moonshotai/Kimi-K3의 아키텍처를 유지하면서 레이어 수와 차원, 전문가 수를 대폭 줄여 약 0.40B로 축소한 개발·테스트용 Tiny 체크포인트입니다. 원본의 3:1 KDA:MLA 패턴과 attention·MLP 잔차 블록을 보존하고 토큰당 2개 전문가만 활성화해 활성 파라미터는 약 0.06B 수준이며 단일 safetensors 파일로 배포됩니다. llm-compressor의 커스텀 모델 구현을 필요로 하고 GenerationMixin을 상속하지 않으므로 model.language_model.generate(...) 형태로 생성 호출을 해야 합니다.
핵심 역량
- 이 모델은 원본 moonshotai/Kimi-K3 아키텍처를 축소해 총 파라미터 약 0.40B 규모로 압축한 개발·테스트용 체크포인트입니다. 원본의 핵심 패턴인 KDA:MLA 비율과 attn_res_block_size를 보존하여 아키텍처 레벨 실험에 적합합니다. 단, 비전 타워는 포함되어 있으나 비전 작업용으로는 학습되지 않았습니다.
- 모델은 희소 MoE 구조를 유지하면서 토큰당 8개 전문가 중 2개만 활성화하는 설정을 사용해 활성 파라미터를 약 0.06B로 제한합니다. 이로 인해 메모리·연산 비용이 줄어들어 소형 개발 환경에서 MoE 동작을 검증하는 용도로 유용합니다. 활성 전문가 수와 레이어 배치는 README의 원문 설정을 그대로 따릅니다.
- 로컬에서 불러올 때 llmcompressor.modeling.kimi_k3의 커스텀 구현이 필요하며 AutoModelForCausalLM 대신 KimiK3ForConditionalGeneration 클래스를 사용해야 합니다. 해당 클래스는 GenerationMixin을 상속하지 않아 model.language_model.generate(...) 형태로 생성 API를 호출해야 정상 동작합니다. trust_remote_code=True를 설정해야 커스텀 코드가 적용됩니다.
강점
- 총 파라미터 약 0.40B로 로컬 개발 환경에서 빠르게 로드·실행해 아키텍처 변경의 효과를 실험하기에 적합합니다. 원본의 KDA/MLA 패턴과 잔차 구조를 보존하므로 아키텍처별 동작 차이를 비교 검증하는 데 유리합니다. 단일 샤드 safetensors로 배포되어 파일 관리와 로드가 간편합니다.
- 희소 MoE를 유지하면서 토큰당 2개 전문가만 활성화하는 설정으로 실제 활성 파라미터는 약 0.06B에 해당해 추론 비용을 낮춘 상태를 재현할 수 있습니다. 이 특성은 MoE 설계의 동작 검증과 효율성 실험에 직접적인 이점을 제공합니다. 다만 전체 성능 측정은 README의 제한된 검증 데이터에 의존합니다.
- 커스텀 모델 클래스와 구현을 포함하므로 원본 코드 경로를 갖추면 원래 아키텍처와 동일한 API 흐름으로 실험할 수 있습니다. GenerationMixin을 상속하지 않는 구현적 특성 때문에 생성 호출 방식이 다르다는 점을 미리 고려하면 통합 테스트가 수월합니다. trust_remote_code 설정이 필요해 보안·배포 측면의 고려가 요구됩니다.
훈련 방식
모델은 llm-compressor의 create-tiny-model 워크플로를 통해 생성되었으며, 원본 moonshotai/Kimi-K3 설정을 검토해 핵심 아키텍처 비율을 유지하면서 레이어 수와 차원을 축소하는 방식으로 설계되었습니다. 모든 가중치는 정규분포(std=0.02)로 초기화하고 노름은 1.0, 바이어스는 0.0으로 세팅한 뒤 토이 copypasta 데이터셋으로 약 57 에폭 동안 fine-tune하여 퍼플렉시티 < 3.0을 달성했다고 README에 기재되어 있습니다. 이 과정은 연구·개발용 프로토타입 목적에 맞춘 경량 파이프라인을 반영합니다.
알아두면 좋은 것
- 이 체크포인트는 moonshotai/Kimi-K3의 축소판으로, 원본의 아키텍처 비율과 블록 구성은 유지하되 레이어 수·히든 차원·전문가 수를 대폭 줄여 약 0.396B 총 파라미터를 목표로 제작되었습니다. 핵심 설계 요소인 3:1 KDA:MLA 비율과 attention·MLP 잔차 연결은 Tiny 버전에서도 동일하게 적용되어 아키텍처 특성 실험에 적합합니다. 비전 타워는 포함되었지만 비전용 가중치는 학습되지 않은 상태입니다.
- 구성 변경 항목 표는 num_hidden_layers, hidden_size, num_experts 등 주요 하이퍼파라미터가 원본 대비 어떻게 축소됐는지를 상세히 나열하고 있습니다. q_lora_rank·kv_lora_rank 등 LoRA 관련 차원도 축소되어 있으며 이는 모델의 연산·메모리 프로파일을 재구성하려는 의도를 반영합니다. 원본 대비 파라미터·레이어 축소 폭이 명시되어 있어 재현 가능성이 높습니다.
- 체크포인트는 단일 safetensors 파일로 제공되며 내부 키 프리픽스가 원본의 샤드 구조와 호환되도록 구성되어 있습니다. README와 검증 출력에는 레이어별 attention 타입과 MoE 사용 여부, 활성 파라미터 수 등의 런타임 확인 정보가 포함되어 있어 로드 후 구조 검증이 수월합니다. 사용자는 모델 파일을 로컬에 놓고 llm-compressor 경로를 추가한 뒤 제공된 클래스에서 불러와야 합니다.
- 생성 및 검증 로그는 Forward pass loss=0.0013과 샘플 생성 문장을 포함해 모델이 텍스트 생성 기능을 수행함을 보여줍니다. 다만 README는 toy copypasta 데이터로 퍼플렉시티 목표치(ppl < 3.0)를 맞춘 점을 명시하므로, 실제 범용 성능 지표나 대형 데이터 기반 검증 결과는 제공되지 않습니다. 개발·테스트 목적으로 좁혀진 목적성이 명확합니다.
기술적 특징
- 아키텍처 수준에서는 원본과 동일한 3:1 KDA:MLA 비율을 유지하면서 레이어마다 KDA와 MLA를 혼합 배치하는 패턴을 보존했습니다. 이로 인해 경량화된 모델에서도 원본이 의도한 레이어별 연산 분포를 재현할 수 있습니다. 레이어 0은 dense MLP로, 1–7은 sparse MoE로 구성되어 원본 구조를 축소 복제한 형태입니다.
- 모델은 attn_res_block_size=4로 모든 레이어에 attention과 MLP 잔차 블록을 활성화하여 정보 흐름과 표현 보존을 강화했습니다. q_lora_rank, kv_lora_rank 등 LoRA 관련 차원을 축소해 연산·메모리 프로파일을 재조정했고 num_experts, num_experts_per_token 등 MoE 관련 하이퍼파라미터도 크게 줄였습니다. 이러한 변경은 전체 파라미터 수를 약 0.396B로 맞추기 위한 구조적 축소를 반영합니다.
- 체크포인트는 model.safetensors 단일 파일로 제공되며 내부 키 네이밍(language_model.model.layers.{i}.*)이 원본 샤드 구조와 호환되도록 구성되어 있습니다. 커스텀 모델 클래스는 llmcompressor.modeling.kimi_k3 모듈에 정의되어 있어 trust_remote_code로 원격 코드를 허용하거나 소스 트리를 로컬에 포함해야 정상 로드됩니다. 또한 KimiK3ForConditionalGeneration이 GenerationMixin을 상속하지 않으므로 model.language_model.generate 호출 방식으로 생성 API를 사용해야 합니다.
차별점
- 원본 moonshotai/Kimi-K3의 아키텍처 패턴을 유지하면서도 파라미터·레이어·전문가 수를 대폭 축소해 개발과 테스트에 특화된 'Tiny' 변형을 제공하는 점이 핵심 차별화 요소입니다. 이러한 축소는 원본 동작을 재현하며 리소스 제약 환경에서 구조 검증을 가능하게 합니다. 동시에 비전 타워는 포함하되 학습은 하지 않아 멀티모달 실험 전용 가중치는 별도 처리가 필요합니다.
- 생성에는 llm-compressor가 만든 커스텀 구현을 요구하는데, 이로 인해 일반적인 AutoModelForCausalLM 워크플로와 호환되지 않는 사용 흐름을 갖습니다. 모델 클래스 설계상 model.language_model.generate(...)를 사용해야 하므로 통합 시 호출 방식 변경이 필요합니다. trust_remote_code=True 설정과 로컬 소스 경로 추가라는 배포 전제 조건이 다른 공개 모델과 구별됩니다.
61
Likes
17.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.