CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

발행일
출처
arXiv
논문 번호
906
분야
Machine Learning
arXiv 번호
2608.12629

GPU 커널 에이전트가 쓰는 프로그래밍 표현(Cake IR)과 컴파일러 하네스를 함께 진화시켜, 에이전트가 전문가급 GPU 커널을 재현·개량하게 만든 컴파일러-에이전트 공동 설계 논문.

이 논문은 한마디로 AI가 GPU 프로그램(커널)을 짤 때 컴파일러를 블랙박스로 두지 않고 함께 진화시키는 시스템 CAKE를 제안한다. 기존 에이전트는 코드를 던져 넣고 오류 메시지와 실행 시간만 돌려받았다면, CAKE는 하드웨어 동작이 드러나는 중간 표현(Cake IR)으로 코드를 쓰게 하고 어느 부분이 왜 틀렸는지 위치를 짚어주는 진단을 준다. 반복되는 실패는 검증 규칙·새 명령어·성능 모델 보정으로 축적돼 컴파일러 자체가 점점 똑똑해진다. 결과는 B200 GPU에서 Flash-KMeans 재현 시 튜닝된 기준의 1.144배(직접 CUDA는 0.928배)였고, 에이전트가 만든 Kimi Delta Attention 커널은 공식 구현 대비 2.05배 빨랐다.

핵심 요약

  • '무엇이 왜 틀렸는지' 위치를 알려주는 컴파일러와 함께 작업하면 블랙박스 환경보다 전문가급 GPU 커널에 훨씬 가까워진다.
  • 하네스 자체도 진화 대상이다 — 반복되는 실패를 검증 규칙·새 IR 명령·성능 모델 보정으로 바꿔 일회성 우회가 아니라 축적되는 지식을 만든다.
  • 같은 예산의 clean-start에서 Cake IR 표현은 튜닝 기준치 1.144배, 직접 CUDA/PTX는 0.928배 — 코드 표현 방식 자체가 성능을 가른다.
  • 에이전트가 만든 Kimi Delta Attention 커널이 공식 구현 대비 2.05배 기하평균 가속을 냈고 실제 서빙 검증까지 통과했다.
  • 단일 규격 최적화와 400여 개 규격 일반화(디스패치) 단계를 분리해 라이브러리 수준 통합까지 완성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)