섹션별 상세
기존 Helion 커널 튜닝은 LFBO를 사용하여 수백 번의 컴파일 및 벤치마크 과정을 거쳐야 하므로 시간이 많이 소요되는 문제가 있었다.
LLM 기반 자동 튜너는 커널 소스 코드와 워크로드 정보를 바탕으로 유망한 설정 후보를 생성하여 탐색 공간을 효율적으로 좁힌다.
json
{"block_sizes":[1],"load_eviction_policies":["last","last","last","last","last"],"reduction_loops":[null]}Helion 컴파일러가 커널 구조를 분석하여 도출한 초기 시드 설정 예시
json
{"configs":[ {"block_sizes":[1],"load_eviction_policies":["last", "..."],"num_warps":8}, {"block_sizes":[8],"load_eviction_policies":["last", "..."],"num_warps":8,"num_stages":2} ]}LLM이 제안한 커널 설정 후보군 예시
33개 커널 인스턴스 벤치마크 결과, LLM 튜너는 기존 LFBO 대비 10배 적은 설정으로 동등한 성능(1.009배 지연 시간)을 달성했다.




LLM이 미세 조정에 취약한 경우, LLM으로 초기 설정을 잡고 LFBO로 정밀 튜닝하는 하이브리드 전략을 통해 성능 격차를 해소하고 3배 빠른 튜닝 시간을 확보했다.


Opus-4.8, gpt-5.5, Sonnet-4.6 등 다양한 모델에서 유사한 성능을 보여 LLM 모델 종류에 의존하지 않는 실용적인 튜닝 방식임이 확인됐다.
용어 해설
- Helion
- — PyTorch의 도메인 특화 언어(DSL)로, 성능 이식성이 뛰어난 ML 커널을 작성하고 최적화하는 데 사용됨.
- Likelihood-Free Bayesian Optimization(LFBO)
- — 벤치마크 데이터를 기반으로 유망한 설정을 예측하여 최적화하는 기법. 기존 Helion의 기본 튜너로 사용됨.
- 커널 자동 튜닝(Kernel Autotuning)
- — GPU 커널의 타일 크기, 블록 크기 등 다양한 설정값을 조합하여 하드웨어에서 최상의 성능을 내는 설정을 찾는 과정.
기술
- PyTorch
- Helion
- LFBO
- Claude Opus-4.8
- GPT-5.5
- Claude Sonnet-4.6
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 19.수집 2026. 06. 19.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
