본문으로 건너뛰기

기존 GPU를 30배 빠르게 쓰려는 Kog의 추론 전략

프랑스 startup Kog가 AMD와 Nvidia의 기존 데이터센터 GPU를 저수준 software optimization으로 가속해 대형 LLM 추론 시장을 공략한다는 내용입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 추론 속도와 비용이 병목이 되자 프랑스 startup Kog는 전용 칩 대신 AMD MI300X와 Nvidia H200 같은 기존 데이터센터 GPU를 software optimization으로 가속하려 합니다. 기술 프리뷰에서 약 20억 개 파라미터의 Laneformer 2B가 요청별 3,000 TPS를 기록했지만, Kog가 내건 30x faster LLM inference 목표는 아직 대형 LLM에서 검증되지 않았습니다. Kog는 assembly language와 binary code 수준의 GPU reverse-engineering을 통해 chip별 최적화를 수행하며, 새 GPU마다 수 주에서 수개월을 투입하는 방식 때문에 지원 범위가 제한됩니다. CEO는 9월까지 첫 major model에서 10x speed를 구현해 고객 traction을 입증하고 Series A 투자 유치로 이어가겠다는 계획을 밝혔습니다.

섹션별 상세

01
AI 추론 속도와 비용이 서비스 확장의 병목으로 떠오른 가운데 프랑스 startup Kog는 새 칩을 만드는 대신 기업이 이미 보유한 AMD MI300X와 Nvidia H200 GPU에서 더 많은 성능을 끌어내려 합니다. Kog의 기술 프리뷰는 표준 데이터센터 GPU에서 단일 요청 디코딩을 매우 빠르게 처리할 수 있다는 가능성에 초점을 맞췄습니다. Hacker News 공개 뒤 200건의 구체적인 business lead를 확보했다는 점에서 기존 하드웨어를 활용하려는 수요가 확인됐습니다.
02
Kog는 초기 고객으로 professional software engineering workflow를 우선 겨냥하고 있습니다. Claude Code 사용자가 결과를 받기까지 몇 시간 기다리는 상황과 Anthropic의 Claude Fast Mode 추가 요금을 겨냥해, Kog Inference Engine (KIE)으로 같은 작업의 응답 시간을 줄이려는 구조입니다. prompt로 games와 apps를 생성하는 design partner에게는 결과가 빨라질수록 더 많은 수익을 낼 여지가 있어, 추론 가속이 비용 절감뿐 아니라 매출 증가와도 연결됩니다.
03
Kog의 기술 프리뷰는 약 20억 개 파라미터의 open-sourced Laneformer 2B에서 요청별 3,000 tokens per second를 기록했습니다. 이 결과는 30x faster LLM inference라는 목표를 뒷받침하는 출발점이지만, 아직 대형 LLM에서 같은 성능을 입증한 결과는 아닙니다. prospective customer가 작은 모델 Fine-tuning을 원하지 않는다는 피드백에 따라 Kog는 대형 모델 가속으로 초점을 옮겼고, CEO는 첫 major model에서 10x speed를 9월에 구현할 것으로 예상했습니다.
04
Kog의 핵심 방식은 GPU가 디코딩에 부적합하다는 통념을 깨고, 각 GPU의 물리 법칙과 저수준 동작을 파고들어 사용되지 않던 성능을 끌어내는 것입니다. 팀은 assembly language와 binary code 수준의 reverse-engineering 방식을 GPU engineering research에 적용하며, 새 GPU마다 수 주에서 수개월을 들여 세부 동작을 조사합니다. 11명 규모의 팀으로는 지원 가능한 chip 수에 한계가 있지만, 장기적으로는 agent-based pipeline에 방법론을 넣어 더 많은 chip과 model을 지원하고 Series A 투자 유치의 근거를 마련하려 합니다.

용어 해설

LLM 추론(LLM Inference)
학습이 끝난 대규모 언어 모델이 입력 토큰을 바탕으로 다음 토큰을 순차적으로 생성하는 과정입니다. 모델 가중치를 메모리에서 읽고 연산 결과를 반복 출력하므로 GPU의 메모리 대역폭과 디코딩 처리량이 속도와 비용을 좌우합니다.
초당 토큰 수(Tokens Per Second (TPS))
언어 모델이 1초 동안 생성하는 토큰의 수로, 텍스트 생성 속도를 나타내는 지표입니다. Kog의 기술 프리뷰는 요청별 처리량을 3,000 TPS로 측정했지만, 약 20억 개 파라미터의 Laneformer 2B를 사용한 결과입니다.
메모리 대역폭(Memory Bandwidth)
GPU가 메모리에서 데이터를 읽고 쓰는 속도를 뜻합니다. LLM 디코딩에서는 매 토큰 생성 때 모델 가중치를 반복해서 읽어야 하므로, 최신 GPU의 높은 메모리 대역폭을 얼마나 효율적으로 활용하는지가 추론 성능에 직접 영향을 줍니다.
CUDA
Nvidia GPU에서 범용 병렬 연산을 실행하기 위한 소프트웨어 플랫폼과 프로그래밍 모델입니다. ZML은 CUDA에 의존하지 않는 하드웨어 비종속 소프트웨어를 내놓았고, Kog는 GPU 내부 동작을 더 낮은 수준에서 최적화하는 접근을 취합니다.

기술

  • AMD MI300X
  • Nvidia H200
  • Kog Inference Engine (KIE)
  • Laneformer 2B
  • CUDA
  • ZML
  • Claude Code

활용 사례

  • Claude Code 기반 software engineering workflow
  • prompt로 games와 apps를 생성하는 서비스
  • 기존 데이터센터 GPU를 활용한 대형 LLM 추론
  • 여러 chip과 model을 지원하는 agent-based inference pipeline
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 14.수집 2026. 08. 15.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.