Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

발행일
출처
arXiv
논문 번호
695
분야
AI / General
arXiv 번호
2607.20253

가사·텍스트 설명으로 완전한 곡을 만드는 통합 음악 생성 프레임워크로, Artificial Analysis 리더보드 2~3위를 기록한 논문이다.

이 논문은 한마디로 가사와 텍스트만 넣으면 보컬·반주까지 포함된 완성된 곡을 만들어주는 통합 시스템을 제안한 것이다. 8-codebook RVQ 토크나이저 + hybird-LM(계층적 토큰 생성) + FullDiT(전곡 flow matching 렌더링) 구조로 구성된다. 2단계 멜로디 모듈로 커버곡의 원곡 멜로디도 보존하며, DPO·GRPO 후훈련으로 음악성을 추가 개선했다.

핵심 요약

  • 가사→곡, 기악곡, 커버곡 3가지 작업을 하나의 프레임워크에서 지원한다.
  • Artificial Analysis Music with Vocals 리더보드 Elo 1,129점으로 공동 2~3위 (1위와 12점 차이).
  • 8개 장르·5개 언어 500곡 테스트에서 18개 지표 중 15개에서 최고점을 받았다.
  • FullDiT가 청크 단위가 아닌 전곡 단위 flow matching을 수행해 전역 일관성을 유지한다.
  • DPO + GRPO + OPD 후훈련으로 음악성과 렌더링 품질을 모두 개선했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)