LiquidAI/LFM2.5-2.6B
에이전트 동작과 도구 사용에 최적화된 경량 장문 언어모델
학습 방식 · 사전학습은 약 34조 토큰 규모로 진행되었고, 중간 단계에서 컨텍스트 윈도우를 128K로 확장하는 mid-training이 포함되어 있습니다. 사후 학습은 기본적으로 Supervised Fine-Tuning(SFT) 두 라운드 이후 도메인별 교사 특화와 다중 도메인 온폴리시 증류(MOPD)를 거쳐 마지막에 에이전틱 Reinforcement Learning으로 마무리하는 연쇄적 파이프라인을 사용합니다. 특히 에이전틱 RL 단계에서는 여러 인기 있는 에이전트 하니스 환경 내부에서 모델을 실행하여 실제 툴 호출 형식, 시스템 프롬프트 구조, 상호작용 패턴을 직접 노출시키므로 에이전트 통합 호환성과 실행 신뢰성이 개선됩니다.
TL;DR
LFM2.5-2.6B는 LiquidAI의 LFM2 아키텍처를 기반으로 한 2.6B 규모의 사후 학습 모델로, 기본 체크포인트(LFM2.5-2.6B-Base)를 출발점으로 두 단계의 SFT, 교사 특화, MOPD와 에이전틱 RL을 거쳐 에이전트 친화적 행동을 학습했습니다. 128K 토큰 컨텍스트와 128K 어휘 환경을 활용해 장문 RAG와 도구 호출형 대화에서 강점을 보이며 Apple M5 Max에서 220 tok/s, AMD Ryzen AI Max+ 395에서 113 tok/s의 효율적 CPU 추론 성능을 달성합니다. 에이전트 워크로드, 도구 사용, 멀티턴 지향의 instruction-following 작업에 적합하지만, 코딩 중심의 에이전틱 작업이나 지식집약적 태스크에는 권장되지 않습니다.
핵심 포인트
- 에이전트 역량에 집중한 사후 학습 파이프라인을 통해 도구 사용과 멀티스텝 에이전트 작업에서 성능을 끌어올렸습니다. 두 단계의 SFT, 도메인별 교사 특화, 온폴리시 증류(MOPD)와 에이전틱 RL을 연속적으로 적용해 교사 모델들로부터 행동 패턴과 툴 인터페이스 사용법을 학습합니다. 이 과정은 동일한 규모보다 큰 모델과 비교해 도구 호환성과 실행 신뢰성을 높이는 데 초점을 맞춥니다.
- 경량화된 아키텍처와 효율적 구현으로 CPU와 Apple Silicon에서 빠른 추론을 제공합니다. 공개 수치로 Apple M5 Max에서 220 tok/s, AMD Ryzen AI Max+ 395에서 113 tok/s를 기록하며 메모리 사용량은 2.5GB 미만 수준으로 설계되어 있습니다. 이 성능 특성은 로컬 데스크톱, 엣지 서버, 심지어 모바일 환경에서 에이전트 워크로드를 운영할 때 비용과 지연을 낮추는 실질적 이점을 만듭니다.
- 긴 컨텍스트(131,072 토큰)와 다국어 지원을 염두에 둔 토크나이저·어휘 구성으로 장기 기억 기반 RAG나 문서 요약 같은 작업에 적합합니다. 어휘 크기 128K와 34T 토큰의 사전학습 데이터 규모가 결합되어 길고 복잡한 문맥을 유지하면서도 도구 중심의 대화 흐름을 관리할 수 있습니다. 따라서 장문 문서와 다단계 추론이 필요한 에이전트 응용에서 실용성이 큽니다.
제한사항
- 모델은 에이전트 작업과 도구 사용에 최적화되어 있으나 에이전틱 코딩 작업과 지식집약적 태스크에는 권장되지 않습니다. README에서 명시된 바와 같이 코딩 중심의 에이전트나 심층 지식 검색·정확성 요구가 높은 응용에서는 성능 한계가 발생할 수 있으므로 보다 큰 지식화 모델을 고려해야 합니다. 따라서 코드 생성이나 고정밀 정보 검증이 핵심인 제품에는 도입 전에 적절한 벤치마크 검증이 필요합니다.
- 라이선스는 'other' 카테고리의 lfm1.0으로 표기되어 있어 상업적·재배포 제한 여부를 사전에 확인해야 합니다. 허가 범위와 제한 조건은 모델 활용 방식과 배포 환경에 직접적인 영향을 주므로 라이선스 전문을 검토한 뒤 엔터프라이즈 통합을 진행하는 것이 안전합니다. 또한 README에 region:us와 endpoints_compatible 태그가 있으므로 공식 엔드포인트 사용 시 지역·호환성 요구사항을 염두에 두어야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Multi-IF | score | 80.07 | vs gemma-4-E2B-it: 69.44; vs Qwen3.5-4B: 55.67 |
| IFStruct | score | 85.49 | vs gemma-4-E2B-it: 64.85; vs Qwen3.5-9B: 78.50 |
| ToolSandbox | score | 77.83 | vs gemma-4-E2B-it: 52.40; vs Qwen3.5-4B: 75.55 |
| Claw-Eval average (EN) | score | 62.85 | vs gemma-4-E2B-it: 53.14; vs Qwen3.5-9B: 66.53 |
| AIME25 | score | 51.87 | vs gemma-4-E2B-it: 26.33; vs Qwen3.5-9B: 56.07 |
이미지 분석




136
Likes
47.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.