TL;DR
SyzygyResearch가 35B Mixture of Experts 모델인 Mach-1-Additive-35B의 GGUF 파일과 사용자 지정 llama.cpp 포크를 공개했습니다. 모델 파일 크기는 7GB이며 모바일·엣지 장치와 저메모리 시스템을 겨냥합니다. 게시물은 소비자용 노트북에서 최대 120 t/s의 속도를 제시하지만 측정 조건은 밝히지 않았습니다. 일반 모델과 Multimodal 변형, 실행 코드, 관련 저비트 모델 추적 목록 링크가 함께 제공됐습니다.
실용적 조언
- 저메모리 장치에서 테스트하려면 먼저 제공된 Hugging Face 저장소에서 일반 GGUF와 Multimodal GGUF 중 작업에 맞는 파일을 선택한 뒤, SyzygyResearch의 llama.cpp-mach1 포크를 사용해야 합니다. 게시물은 모델 파일과 실행 포크의 링크를 함께 제공하므로 두 저장소의 사용 지침과 호환 조건을 확인하는 순서가 적절합니다. 최대 120 t/s 수치는 소비자용 노트북에서의 조건부 수치이므로 실제 장치에서는 동일한 속도를 전제로 삼지 않는 편이 안전합니다.
섹션별 상세
용어 해설
- 전문가 혼합 모델(Mixture of Experts)
- — 여러 전문가 네트워크 중 일부만 입력마다 선택해 계산하는 구조입니다. 전체 파라미터 규모를 유지하면서 실제 추론에 사용하는 연산량과 메모리 부담을 줄이는 데 쓰이며, Mach-1-Additive-35B는 이 구조를 35B 규모로 구현한 모델입니다.
- GGUF 모델 파일 형식(GGUF)
- — llama.cpp 계열 환경에서 대규모 언어 모델을 저장하고 실행하기 위한 파일 형식입니다. 양자화된 가중치와 모델 메타데이터를 함께 담아 GPU 메모리가 제한된 PC·모바일·엣지 장치에서 로컬 추론에 활용됩니다.
- llama.cpp 포크(llama.cpp fork)
- — 기존 llama.cpp 코드에서 특정 모델의 구조나 연산을 지원하도록 분기해 수정한 별도 코드베이스입니다. 이 글의 포크는 Mach-1-Additive-35B GGUF를 실행하는 사용자 지정 추론 환경으로 함께 배포됐습니다.
언급된 도구
Mach-1-Additive-35B GGUF 실행을 위한 사용자 지정 포크의 기반
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.