MMAE: A Massive Multitask Audio Editing Benchmark

발행일
출처
arXiv
논문 번호
365
분야
LLMs / NLP
arXiv 번호
2606.07229

지시기반 오디오 편집의 첫 범용 벤치마크로, 7개 오디오 모달리티와 6단계 복잡도를 아우르는 2,000개 샘플과 17,741개 평가 루브릭을 구축했다.

MMAE는 범용 지시기반 오디오 편집 시스템을 평가하기 위한 최초의 종합 벤치마크다. 소리, 음성, 음악 및 그 혼합을 포함한 7개 모달리티, 기본 수정부터 다중 홉 추론과 다중 라운드 편집까지 6단계 복잡도, 국소 및 전역 세분성, 8개 연산 유형을 체계적으로 분류했다. 자유형태 작업을 검증 가능한 17,741개 루브릭으로 분해하는 평가 패러다임을 제안하여 정밀한 다차원 평가를 가능하게 했다. 5개 최신 모델 평가 결과 정확 일치율이 5% 미만이며 복잡한 혼합 모달리티에서는 0%로 떨어져 현재 시스템의 한계를 명확히 드러냈다.

핵심 요약

  • 오디오 편집 최초로 7개 모달리티와 6단계 복잡도, 8개 연산 유형을 아우르는 통합 분류 체계를 수립했다
  • 자유형태 편집 작업을 검증 가능한 다차원 루브릭으로 분해하는 평가 패러다임을 도입하여 객관적이고 해석 가능한 평가를 실현했다
  • 2,000개 고품질 샘플과 17,741개 평가 루브릭을 인간-에이전트 협업 파이프라인으로 엄선하여 구축했다
  • 최신 5개 모델 평가에서 EMR 5% 미만, 복잡 혼합 모달리티에서 0%를 기록하여 현재 시스템의 근본적 한계를 폭로했다
  • 외부 에이전트 플래너 도입이 일관된 개선을 가져오지 못하며 이해와 생성 양쪽 모두에서 병목이 존재함을 확인했다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)