본문으로 건너뛰기

CUDA Agent: 고성능 CUDA 커널 생성을 위한 대규모 에이전트 강화학습 시스템

CUDA Agent는 대규모 에이전트 강화학습을 통해 PyTorch 모델을 최적화된 CUDA 커널로 변환하며, 기존 상용 모델과 컴파일러를 압도하는 성능을 보여줍니다.

섹션별 상세

01
CUDA Agent는 데이터 합성, 에이전트 환경, 강화학습 알고리즘의 세 가지 핵심 구성 요소로 이루어진 대규모 에이전트 강화학습 시스템이다.
02
데이터 합성 단계에서는 PyTorch와 Transformer 라이브러리에서 시드 연산자를 수집하고, LLM을 통해 최대 5개의 연산자를 조합한 6,000개의 고품질 학습 데이터셋(CUDA-Agent-Ops-6K)을 구축했다.
3단계로 구성된 CUDA Agent 데이터 수집 파이프라인 다이어그램이다.
Diagram시드 문제 수집, 조합 합성, 루브릭 기반 필터링으로 이어지는 과정을 설명한다. 이 파이프라인을 통해 6,000개의 고품질 학습 데이터셋인 CUDA-Agent-Ops-6K가 구축되었음을 나타낸다.
03
에이전트 환경은 ReAct 스타일의 워크플로우를 따르며, SKILL.md 가이드를 기반으로 코딩, 컴파일, 디버깅, 프로파일링을 반복 수행하여 torch.compile 대비 5% 이상의 성능 향상을 목표로 한다.
CUDA Agent의 환경 루프와 작업 흐름을 보여주는 다이어그램이다.
DiagramSKILL.md 지침을 바탕으로 에이전트가 코드를 생성하고 GPU 풀에서 성능을 검증하며 반복적으로 최적화하는 ReAct 스타일의 워크플로우를 상세히 설명한다.
04
강화학습 파이프라인은 단일 턴 PPO 웜업, Rejection Fine-Tuning(RFT)을 통한 액터 초기화, 가치 사전 학습을 통한 크리틱 초기화 단계를 거쳐 최대 150턴의 긴 문맥에서도 안정적인 학습을 지원한다.
CUDA Agent의 다단계 학습 파이프라인 구조도이다.
Diagram단일 턴 웜업부터 RFT를 활용한 액터/크리틱 초기화, 그리고 최종 에이전트 RL 단계로 이어지는 전략을 도식화하여 장기 문맥 학습의 안정성 확보 방식을 보여준다.
05
KernelBench 평가 결과, 가장 어려운 Level-3 작업에서 torch.compile 대비 90%의 Faster Rate와 1.52배의 기하 평균 속도 향상을 기록하며 최신 상용 모델들을 압도했다.
CUDA Agent와 다른 상용 모델들의 성능을 비교한 벤치마크 차트이다.
ChartCUDA Agent가 Gemini 3 Pro, Claude Opus 4.5 등 강력한 상용 모델들보다 Correct Rate와 Speed-up 지표에서 월등히 앞서고 있음을 시각적으로 보여준다. 특히 속도 향상 측면에서 독보적인 성능을 기록했다.
KernelBench에서의 모델별 상세 성능 지표를 정리한 결과 표이다.
Chart난이도별(Level 1~3) Pass Rate, Faster Rate, Speed-up 수치를 상세히 제공한다. CUDA Agent가 모든 레벨에서 torch.compile 및 타 모델 대비 압도적인 SOTA 성능을 달성했음을 수치로 증명한다.

용어 해설

쿠다(CUDA)
NVIDIA GPU에서 병렬 컴퓨팅을 수행하기 위한 아키텍처 및 프로그래밍 모델로, 딥러닝 연산 가속을 위한 커널 최적화의 핵심 기술이다.
근사 정책 최적화(PPO)
에이전트의 정책을 안정적으로 업데이트하기 위해 변화량을 제한하는 강화학습 알고리즘으로, 학습 과정의 급격한 성능 붕괴를 방지한다.
토치 컴파일(torch.compile)
PyTorch 코드를 자동으로 최적화된 커널로 변환하여 실행 속도를 높이는 컴파일러 기능으로, 본 연구에서 성능 비교의 주요 기준점이 된다.
거부 미세 조정(Rejection Fine-Tuning)
생성된 결과물 중 품질이 낮은 데이터를 제외하고 우수한 데이터만 선별하여 모델을 미세 조정하는 기법으로, 정책의 효율성과 안정성을 높인다.
기하 평균 속도 향상(Geometric Mean Speed-up)
여러 작업의 속도 향상 비율을 기하 평균으로 계산하여 전체적인 성능 개선 정도를 나타내는 지표로, 산술 평균보다 이상치의 영향을 덜 받는다.

기술

  • CUDA
  • PyTorch
  • PPO
  • Python

활용 사례

  • 자동 CUDA 커널 생성
  • 딥러닝 모델 추론 가속
  • 컴파일러 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 03.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.