본문으로 건너뛰기
HF Daily Papers조회 1

Kernel-Smith: 진화적 커널 최적화를 위한 통합 레시피

고성능 GPU 커널 작성은 AI 시스템 효율성의 핵심이지만, 사람이 직접 최적화하기 매우 어렵고 기존 LLM은 단발성 생성에 그치는 한계가 있다. 이 논문은 LLM이 스스로 코드를 실행하고 성능 피드백을 받아 반복적으로 개선하는 '진화적 루프'를 도입하여, 실제 상용 추론 엔진(SGLang, LMDeploy)에 채택될 수준의 최적화 성능을 자동화했다.

용어 해설

GPU 커널(GPU Kernel)
GPU 하드웨어에서 직접 실행되는 병렬 연산의 최소 단위이다. 딥러닝 모델의 행렬 곱셈이나 활성화 함수 등을 효율적으로 처리하기 위해 하드웨어 특성에 맞춰 최적화된 코드로 작성되며, 전체 시스템 성능의 병목이 되기 쉬운 핵심 요소이다.
진화 알고리즘(Evolutionary Algorithm)
생물의 진화 과정을 모방하여 최적의 해를 찾는 알고리즘이다. 여러 후보 해(개체)를 생성하고, 실제 실행 결과에 따라 성능이 좋은 개체를 선택 및 변이시켜 세대를 거듭하며 해를 점진적으로 개선하는 방식을 취한다.
그룹 상대 정책 최적화(GRPO)
DeepSeek-V3에서 제안된 강화학습 알고리즘으로, 별도의 비평가(Critic) 모델 없이 샘플 그룹 내의 상대적 보상을 사용하여 정책을 업데이트한다. 연산 효율성이 높고 커널 최적화와 같이 정답이 명확한 작업에 효과적이다.
타일링(Tiling)
대규모 데이터를 작은 블록(타일) 단위로 나누어 GPU의 고속 메모리(Shared Memory)에 올리고 연산하는 기법이다. 메모리 접근 횟수를 줄여 연산 속도를 극대화하는 GPU 커널 최적화의 핵심 전략 중 하나이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 30.수집 2026. 04. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.