HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

발행일
출처
arXiv
논문 번호
986
분야
Distributed Systems
arXiv 번호
2608.21157

LLM으로 GPU 커널을 자동 최적화할 때 '어느 구현 공간(파이토치 연산자/CUDA 라이브러리/직접 짠 CUDA)에서 풀지'부터 계획하게 해 효율을 크게 올린 프레임워크 논문이다.

이 논문은 한마디로 GPU 커널 최적화 AI 에이전트에 '공간 선택' 계획 단계를 넣은 연구다. 기존 LLM 기반 커널 최적화는 처음에 구현 방식을 하나 정해 두고 그 안에서만 다듬었기 때문에, 과업 특성에 안 맞는 공간을 고르면 탐색 예산을 낭비했다. HIERA는 인터페이스를 고정하는 과업 계약서를 만들고, 프로파일링 피드백과 전문가 지식으로 구현 공간을 먼저 고른 뒤 그 안에서 반복 개선한다. KernelBench에서 훈련 없는 기존 방법들을 모든 규모에서 이겼고, 과학 계산 스텐실 연산자에서는 cuDNN 대비 1.53배 빠른 구현을 찾아냈다.

핵심 요약

  • 파이토치 연산자와 CUDA 라이브러리, 직접 작성한 CUDA 가운데 구현 공간을 먼저 고르는 계층적 계획을 도입했다.
  • 과제 계약서와 프로파일링 피드백, 전문가 지식으로 선택한 공간 안에서 반복 개선해 적은 후보 예산에서도 실행 가능한 코드를 찾았다.
  • 세 기반 모델과 세 난이도의 27개 비교 중 22개에서 최고 또는 공동 최고였고, 후보 한 개 조건의 유효 구현 비율은 71.6%였다.
  • 과학 계산 스텐실 사례에서는 다섯 번의 반복으로 cuDNN보다 1.53배 빠른 커널을 찾아 표준 학습 연산 밖의 적용 가능성을 보였다.
  • 평가는 NVIDIA A100과 제한된 정밀도 설정에 집중됐고 스텐실 검증도 연산자 한 개와 설정 한 개뿐이라 다른 장치와 과학 연산으로의 일반화는 확인되지 않았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)