섹션별 상세
KernelAgent는 하드웨어 프로파일링 신호를 폐쇄 루프 멀티 에이전트 워크플로우에 통합하여 Triton 커널을 최적화한다. 이 시스템은 ProfilerAgent, JudgeAgent, AnalyzeAgent, OrchestratorAgent 등 특화된 에이전트들이 협력하여 병목 현상을 진단하고 최적화 전략을 수립한다. 모든 단계는 NVIDIA Nsight Compute(NCU)에서 추출한 실제 하드웨어 메트릭을 기반으로 작동한다.
최적화 프로세스는 프로파일링, 진단, 처방, 오케스트레이션, 탐색, 측정의 6단계로 구성된다. ProfilerAgent가 DRAM 처리량, L2 캐시 히트율, 워프 점유율 등의 데이터를 수집하면, DiagnoseAgent가 이를 해석하여 성능 병목의 근본 원인을 분류한다. 이후 AnalyzerAgent가 GPU 아키텍처(A100 vs H100)에 최적화된 구체적인 수정 사항을 제안한다.
OrchestratorAgent는 과거의 최적화 시도 이력을 분석하여 현재 라운드의 탐색 전략을 결정한다. 이 과정에서 'Was the diagnosis correct?'와 같은 자기 분석(Self-analysis)을 수행하여 실패한 패턴을 피하고 성공 가능성이 높은 경로를 선택한다. 공유 메모리 구조를 통해 에이전트들이 라운드 간 학습 내용을 공유하며 로컬 미니마에 빠지는 것을 방지한다.
KernelBench L1 과제 100개를 대상으로 평가한 결과, KernelAgent는 이전 버전 대비 2.02배의 기하 평균 속도 향상을 달성했다. 기본 torch.compile과 비교했을 때 65개 과제에서 더 우수한 성능을 보였으며 평균 1.56배의 속도 향상을 기록했다. 특히 H100 GPU에서 하드웨어 이론적 최대 성능(SOL)의 89%에 도달하는 효율성을 입증했다.

행렬-벡터 곱셈(Matrix-Vector Multiplication) 사례 연구에서 KernelAgent는 레지스터 압박으로 인한 점유율 제한 문제를 해결했다. 대형 벡터 누산기를 스칼라 누산기로 교체하고 그리드 병렬성을 높이는 처방을 통해 실행 시간을 9.52ms에서 1.95ms로 단축했다. 이는 하드웨어 피드백 없는 일반 LLM 기반 최적화가 로컬 미니마에 갇히는 것과 대조적인 성과이다.


기술
- PyTorch
- Triton
- NVIDIA Nsight Compute
- H100 GPU
- KernelBench
활용 사례
- LLM 추론 커널 최적화
- 사용자 정의 연산(Custom Ops) 성능 튜닝
- 하드웨어 특화 딥러닝 가속
언급된 리소스
GitHubKernelBench
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 07.수집 2026. 03. 07.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
