230M 경량 LFM2.5, 모바일·엣지 추론 최적화
LFM2.5-230M은 230M 파라미터로 설계된 경량 다국어 텍스트 생성 모델로서 32K 컨텍스트와 엣지 최적화 포맷을 지원하여 저자원 기기에서도 실용적인 에이전트·데이터 추출 성능을 제공한다.
TL;DR
LFM2.5-230M은 Liquid AI가 LFM2 계열을 기반으로 만든 230M 파라미터 규모의 인스트럭션 튜닝 모델로서 긴 컨텍스트(32,768 토큰)와 엣지 친화적 배포 포맷(GGUF, ONNX, MLX)을 지원한다. 설계는 8개의 double-gated LIV convolution 블록과 6개의 GQA 블록을 혼용해 연산 효율과 문맥 처리 능력을 균형 있게 확보했으며 사전학습에 19T 토큰을 사용하고 LFM2.5-350M에서 증류·다단계 강화학습으로 정제했다. 벤치마크와 하드웨어 측정에서 Raspberry Pi 5와 Galaxy S25 Ultra 같은 저자원 디바이스에서도 실용적 처리량(예: Raspberry Pi 5 디코드 42 tok/s, Galaxy S25 Ultra 디코드 213 tok/s)을 보였고 여러 런타임과 포맷을 통한 엣지 배포 워크플로가 명시되어 있다. 한편 README는 고난이도 수리 추론이나 고성능 코드 생성 같은 작업에는 권장하지 않아 적용 범위를 명확히 구분하고 있다.
핵심 역량
- 대화형 응답 생성과 ChatML 유사 템플릿을 통한 일관된 메시지 포맷을 지원한다. 모델은 system/user/assistant 역할을 명확히 구분하는 입력을 받아 함수 호출 형식의 응답을 생성할 수 있다. 이 동작은 외부 툴 연동과 파이프라인 자동화를 용이하게 만든다.
- 툴 호출(function calling) 워크플로에서 Python 리스트 형식의 호출 출력을 기본으로 생성하며, 필요 시 JSON으로 출력 형식을 변경할 수 있다. 생성된 툴 호출은 실행 후 tool 역할로 결과를 반환하면 모델이 이를 해석해 최종 자연어 응답을 산출한다. 이 과정은 에이전트형 데이터 추출과 자동화에 적합하다.
- 긴 컨텍스트(32,768 토큰)를 처리할 수 있어 문서 기반의 질의응답, 장문 요약, 컨텍스트가 긴 에이전트 작업에서 이점을 가진다. 긴 컨텍스트 처리는 토큰화·메모리 관리와 결합되어 대화 이력과 문서 맥락을 포괄적으로 유지한다. 다국어 지원을 통해 다양한 언어로 입력을 처리할 수 있다.
- 엣지 및 로컬 환경에 맞춘 배포 포맷(GGUF, ONNX, MLX)을 제공해 CPU·모바일·Apple Silicon에서의 추론을 용이하게 한다. 이 포맷들은 양자화와 결합되어 메모리 사용량을 줄이고 로딩 속도를 개선한다. README에서 제시된 벤치마크는 소형 디바이스에서도 실용적 처리량을 확보한 점을 강조한다.
강점
- 작은 파라미터 수(230M)에도 불구하고 엣지 디바이스에서 실용적 처리량을 보이도록 설계되었다. README에 따르면 Galaxy S25 Ultra에서 디코드 속도 213 tok/s, Raspberry Pi 5에서 42 tok/s를 기록해 모바일·저전력 환경에서의 실사용 가능성을 입증했다. 또한 여러 배포 포맷을 제공해 다양한 런타임으로 전환하기 쉽다.
- 긴 컨텍스트(32K) 처리를 지원해 문서 기반 작업과 장문 대화 유지에 유리한 설계다. 이 설계는 작은 모델 크기 대비 문맥 정보를 더 오래 유지할 수 있게 하여 에이전트형 툴 호출과 데이터 추출 워크플로의 실용성을 높인다. 다국어 지원이 포함되어 있어 글로벌 애플리케이션에도 적용 가능하다.
훈련 방식
LFM2 아키텍처 기반으로 사전학습을 확장하고 LFM2.5-350M에서 지식을 증류한 뒤 다단계 강화학습을 통해 에이전트형 동작과 도구 사용에 특화되도록 튜닝했다.
알아두면 좋은 것
- 모델은 230M 파라미터로 설계되었고 사전학습에 19T 토큰이 투입되었으며 컨텍스트 길이는 32,768 토큰이다. 이 수치는 모델이 작은 파라미터 수 대비 긴 문맥을 처리하도록 설계되었음을 보여준다. 다국어 환경을 기본으로 지원해 다양한 언어 입력에 대응한다.
- 엣지 배포를 위한 여러 포맷(GGUF, ONNX, MLX)이 제공되어 llama.cpp, Transformers, vLLM, SGLang 등 다양한 런타임에서 실행할 수 있다. GGUF는 로컬 CPU 중심 실행에 최적화된 포맷으로 명시되어 있으며 MLX는 Apple Silicon에 특화된 포맷이다. 이로 인해 개발자는 대상 디바이스에 맞춰 포맷을 선택할 수 있다.
- 모델은 LFM2 아키텍처 기반이며 8개의 double-gated LIV convolution 블록과 6개의 GQA 블록을 포함한 계층 설계가 사용되었다. README는 LFM2.5-350M에서 지식·행동을 증류(distill)하고 다단계 강화학습으로 정제했다고 명시해 에이전트·툴 사용 역량을 강화했음을 나타낸다. 생성 시 권장 하이퍼파라미터로 temperature 0.1, top_k 50, repetition_penalty 1.05가 제시되었다.
- 추론 성능 벤치마크에서 Raspberry Pi 5와 Galaxy S25 Ultra 같은 저자원·모바일 환경에서의 실제 토크나이즈 처리량 수치가 공개되었다. README는 Raspberry Pi 5에서 42 tok/s 디코드 속도와 Galaxy S25 Ultra에서 213 tok/s 디코드 속도를 명시해 엣지 성능 지표를 제공한다. 벤치마크 표는 여러 평가셋(IFEval, IFBench, GPQA 등)과 비교 결과를 포함한다.
기술적 특징
- 모델은 14개 레이어 구성으로 8개의 double-gated LIV convolution 블록과 6개의 GQA 블록을 혼합해 사용했다. double-gated LIV convolution 블록은 지역적 합성곱 스타일의 처리로 연산 효율을 높이며 GQA 블록은 어텐션-유사 연산을 통해 장거리 문맥 이해를 보강한다. 이 조합은 파라미터 수를 제한한 상태에서 문맥 처리 능력과 연산 효율을 균형 있게 확보하는 데 기여한다.
- 사전학습에 대규모 토큰 19T를 투입한 뒤 LFM2.5-350M에서 지식을 증류하는 과정이 적용되었다. 증류는 큰 모델의 동작을 작은 모델로 이전해 효율 대비 성능을 개선하는 방식으로 작동하며, 이어서 다단계 강화학습을 통해 툴 사용과 에이전트 행동을 최적화했다. 이러한 파이프라인은 작은 모델이 실용적 에이전트 역량을 갖추는 데 핵심적인 역할을 했다.
- 긴 컨텍스트(32,768 토큰)를 처리할 수 있도록 토크나이저·메모리 관리 설계가 조정되었다. 컨텍스트 길이를 늘리면 토큰화와 캐시 관리 방식, 입력 분할 전략이 중요해지며 본 모델은 이를 고려한 구현을 통해 장문 작업에서의 안정성을 확보했다. 긴 문맥 지원은 문서 요약, 장문 Q&A, 에이전트 상태 유지에 직접적인 이점을 제공한다.
- 엣지 배포를 염두에 둔 포맷(원본 체크포인트, GGUF, ONNX, MLX)과 inference 런타임 호환을 명시했다. GGUF 포맷은 CPU 중심 툴체인에서 빠른 로딩과 낮은 메모리 사용을 가능하게 하며 MLX는 Apple Silicon 최적화를 제공한다. 이로써 동일 체크포인트를 다양한 디바이스와 런타임에 맞춰 효율적으로 배포할 수 있다.
차별점
- 파라미터가 230M인 소형 모델임에도 32K 컨텍스트와 긴 사전학습(19T 토큰)을 결합해 긴 문맥을 처리하도록 설계되었다. 이 조합은 동일 범주 내 더 큰 모델 대비 엣지·모바일 환경에서의 비용 대비 실용성을 제공한다. 작은 메모리 예산으로도 문서 중심 워크플로를 유지할 수 있게 한다.
- 아키텍처적으로 double-gated LIV convolution과 GQA 블록을 혼용해 지역적 연산과 전역 문맥 처리를 균형 있게 구현했다. 이러한 혼합 블록 설계는 연산 효율성을 유지하면서 문맥 이해 성능을 확보하는 설계적 차별점을 만든다. 특히 엣지 중심 모델에서 연산·메모리 비용을 낮추는 데 기여한다.
- 다양한 배포 포맷(GGUF, ONNX, MLX)을 공식 제공함으로써 장치별 최적화 경로를 명시적으로 지원한다. 이 접근은 개발자가 대상 하드웨어에 맞춰 손쉽게 포맷을 선택하고 양자화 기반 최적화를 적용할 수 있게 한다. 결과적으로 엣지 배포 시의 운영 복잡도를 낮춘다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | score | 25.41 | — |
| MMLU-Pro | score | 20.25 | — |
| IFEval | score | 71.71 | — |
| IFBench | score | 38.40 | — |
| Multi-IF | score | 37.70 | — |
| CaseReportBench | score | 22.51 | — |
| BFCLv4 | score | 43.26 | — |
| BFCLv4 (alternate) | score | 21.03 | — |
이미지 분석



214
Likes
41.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.