TL;DR
이 글은 2026년 현재 공개 또는 Fireworks 경로로 접근 가능한 주요 오픈 소스 LLM을 파라미터 수, 컨텍스트 윈도우, 멀티모달 지원, 라이선스, 벤치마크(예: Artificial Analysis Intelligence/Coding, GPQA, SciCode)와 출력 속도로 비교해 실무적 선택 기준을 제공한다. 핵심 결과로 Kimi K3가 벤치 상 가장 높은 인텔리전스·코딩 지표를 기록했고 GLM 5.2는 Fireworks에서 접근 가능한 오픈 모델 가운데 종합 점수가 가장 높아 장문 코드·문서 워크플로 평가의 출발점으로 권장된다. 멀티모달이 필요하면 MiniMax M3나 Kimi K2.7 Code를 우선 검증하고 고처리량·저비용이 목표이면 gpt-oss-120b와 같은 경량·고속 모델을 고려하되 최종 선택은 실제 입력 형태와 비용·지연을 반영한 태스크 수준 실험으로 확정해야 한다.
빠른 이해
새로운 점
초대형(1M+ 토큰) 컨텍스트를 상용 플랫폼에서 지원하는 오픈 소스 MoE 모델들이 다수 등장한 점
핵심 메커니즘
모델 입력은 긴 문서·코드·이미지 텍스트를 토큰화해 들어오고 MoE 계열은 활성화된 소수 전문가만 연산해 효율을 확보하며 IndexShare나 KV-cache 같은 구조가 긴 컨텍스트에서 반복 연산을 줄여 토큰당 FLOPs와 레이턴시를 낮춘 다음 함수 호출이나 도구 연동으로 구조화된 외부 동작을 출력으로 생성한다.
핵심 수치
- Kimi K3 Artificial Analysis Intelligence Index: 57.1- 표의 스냅샷 기준 점수(7월 16 데이터)
- Kimi K3 Artificial Analysis Coding Index: 76.2- 표의 스냅샷 기준 점수(7월 16 데이터)
- GLM 5.2 Intelligence Index: 51.1- Fireworks에서 사용 가능한 오픈 모델 중 최고 점수
- GLM 5.2 Coding Index: 68.8- Fireworks에서 관측된 중간값 출력 속도 165.3 tokens/sec 포함
- gpt-oss-120b Median output speed: 271.4 tokens/sec- 고처리량 요건에 적합한 모델 속도 수치
섹션별 상세
오픈 소스 LLM 환경과 평가 기준
벤치마크 구성과 해석 방식
모델별 비교 요약과 주요 특성
GLM 5.2의 기술적 특징과 적용성
- GLM 5.2는 Fireworks에서 사용 가능한 오픈 모델 중 Intelligence Index 51.1과 Coding Index 68.8로 표에서 가장 높은 종합 점수를 보였다. — 모델 비교 표와 GLM 5.2 섹션에 기재된 인덱스 점수
Kimi 계열과 K2.7 Code의 실무적 위치
- Kimi K3가 평가 대상 모델 가운데 Artificial Analysis Intelligence Index와 Coding Index에서 최고점(57.1, 76.2)을 기록했다. — 모델별 벤치마크 표(Reasoning and knowledge / Software engineering performance) 및 Kimi K3 섹션
DeepSeek V4 패밀리와 MiniMax M3의 역할 분담
Qwen3.7 Plus, gpt-oss-120b, Gemma 4 31B IT의 실무적 위치
Fireworks에서의 배포·서빙 옵션과 운영적 제언
요약적 권고와 한계
용어 해설
- 혼합 전문가(MoE)(Mixture-of-Experts (MoE))
- — Mixture-of-Experts는 입력 토큰마다 활성화되는 전문가 서브네트워크만 계산해 전체 파라미터 대비 연산을 줄이는 구조로, 대규모 파라미터를 유지하면서 실행 비용을 낮추고 서로 다른 전문가가 특정 패턴에 특화되도록 학습된다.
- Stable LatentMoE
- — Stable LatentMoE는 일부 MoE 변형으로, 매우 많은 전문가 집합 중 소수만 안정적으로 활성화하도록 설계되어 메모리와 연산을 제어하면서도 대규모 토큰 문맥을 처리할 수 있게 하는 기술적 접근 방식이다.
- IndexShare
- — IndexShare는 긴 문맥에서 희소(attention) 연산의 중복 인덱싱을 재사용해 토큰당 FLOPs를 감소시키는 구조적 기법으로, 1,040k 같은 초대형 컨텍스트 상황에서 연산 비용을 낮추는 목적을 가진다.
- 컨텍스트 윈도우(Context Window)
- — 컨텍스트 윈도우는 모델이 한 번에 참조 가능한 토큰의 최대 길이로, 문서·코드베이스·이미지 설명 등 장문 입력을 일관되게 처리하려면 모델의 문맥 유지 능력과 함께 적절한 윈도우 크기가 필수적이다.
- 함수 호출 기능(Function Calling)
- — Function Calling은 모델이 외부 도구나 API를 구조화된 방식으로 호출하도록 출력 형식을 생성하는 기능으로, 실제 데이터 조회·행동 실행·정형화된 결과 생성 같은 운영형 에이전트에서 중요하다.
기술
- MoE
- IndexShare
- Function calling
- KV-cache
- Speculative decoding
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
