TL;DR
AI 추론 속도와 비용이 병목이 되자 프랑스 startup Kog는 전용 칩 대신 AMD MI300X와 Nvidia H200 같은 기존 데이터센터 GPU를 software optimization으로 가속하려 합니다. 기술 프리뷰에서 약 20억 개 파라미터의 Laneformer 2B가 요청별 3,000 TPS를 기록했지만, Kog가 내건 30x faster LLM inference 목표는 아직 대형 LLM에서 검증되지 않았습니다. Kog는 assembly language와 binary code 수준의 GPU reverse-engineering을 통해 chip별 최적화를 수행하며, 새 GPU마다 수 주에서 수개월을 투입하는 방식 때문에 지원 범위가 제한됩니다. CEO는 9월까지 첫 major model에서 10x speed를 구현해 고객 traction을 입증하고 Series A 투자 유치로 이어가겠다는 계획을 밝혔습니다.
섹션별 상세
용어 해설
- LLM 추론(LLM Inference)
- — 학습이 끝난 대규모 언어 모델이 입력 토큰을 바탕으로 다음 토큰을 순차적으로 생성하는 과정입니다. 모델 가중치를 메모리에서 읽고 연산 결과를 반복 출력하므로 GPU의 메모리 대역폭과 디코딩 처리량이 속도와 비용을 좌우합니다.
- 초당 토큰 수(Tokens Per Second (TPS))
- — 언어 모델이 1초 동안 생성하는 토큰의 수로, 텍스트 생성 속도를 나타내는 지표입니다. Kog의 기술 프리뷰는 요청별 처리량을 3,000 TPS로 측정했지만, 약 20억 개 파라미터의 Laneformer 2B를 사용한 결과입니다.
- 메모리 대역폭(Memory Bandwidth)
- — GPU가 메모리에서 데이터를 읽고 쓰는 속도를 뜻합니다. LLM 디코딩에서는 매 토큰 생성 때 모델 가중치를 반복해서 읽어야 하므로, 최신 GPU의 높은 메모리 대역폭을 얼마나 효율적으로 활용하는지가 추론 성능에 직접 영향을 줍니다.
- CUDA
- — Nvidia GPU에서 범용 병렬 연산을 실행하기 위한 소프트웨어 플랫폼과 프로그래밍 모델입니다. ZML은 CUDA에 의존하지 않는 하드웨어 비종속 소프트웨어를 내놓았고, Kog는 GPU 내부 동작을 더 낮은 수준에서 최적화하는 접근을 취합니다.
기술
- AMD MI300X
- Nvidia H200
- Kog Inference Engine (KIE)
- Laneformer 2B
- CUDA
- ZML
- Claude Code
활용 사례
- Claude Code 기반 software engineering workflow
- prompt로 games와 apps를 생성하는 서비스
- 기존 데이터센터 GPU를 활용한 대형 LLM 추론
- 여러 chip과 model을 지원하는 agent-based inference pipeline
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.