24B 모델을 32GB RAM에서! 초고속 온디바이스 추론을 실현한 Liquid AI의 MoE 모델
텍스트 생성 및 다국어 대화24B (2B Active)lfm1.0
24B 파라미터의 성능을 유지하며 2B 활성 파라미터로 엣지 기기에서 초고속 추론을 지원하는 하이브리드 MoE 모델입니다.
핵심 역량
- 토큰당 2B 활성 파라미터로 연산 효율 극대화
- 32GB RAM 이하 소비자용 기기에서 구동 가능
- AMD CPU 기준 112 tok/s, H100 기준 293 tok/s의 빠른 추론 속도
- 한국어를 포함한 9개국 다국어 지원
- llama.cpp, vLLM, SGLang 프레임워크 즉시 지원
알아두면 좋은 것
- 24B 모델임에도 2B 활성 파라미터만 사용하여 극강의 추론 효율성 달성
- 한국어 포함 9개 국어(en, ar, zh, fr, de, ja, ko, es, pt) 지원 확인
- GGUF 포맷 제공으로 llama-cli를 통한 즉시 실행 가능
- 350M에서 24B까지 로그-선형적으로 향상되는 예측 가능한 스케일링 성능
99
Likes
18.5k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.