MMAE: A Massive Multitask Audio Editing Benchmark
- 발행일
- 출처
- arXiv
- 논문 번호
- 365
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.07229
지시기반 오디오 편집의 첫 범용 벤치마크로, 7개 오디오 모달리티와 6단계 복잡도를 아우르는 2,000개 샘플과 17,741개 평가 루브릭을 구축했다.
MMAE는 범용 지시기반 오디오 편집 시스템을 평가하기 위한 최초의 종합 벤치마크다. 소리, 음성, 음악 및 그 혼합을 포함한 7개 모달리티, 기본 수정부터 다중 홉 추론과 다중 라운드 편집까지 6단계 복잡도, 국소 및 전역 세분성, 8개 연산 유형을 체계적으로 분류했다. 자유형태 작업을 검증 가능한 17,741개 루브릭으로 분해하는 평가 패러다임을 제안하여 정밀한 다차원 평가를 가능하게 했다. 5개 최신 모델 평가 결과 정확 일치율이 5% 미만이며 복잡한 혼합 모달리티에서는 0%로 떨어져 현재 시스템의 한계를 명확히 드러냈다.
핵심 요약
- 오디오 편집 최초로 7개 모달리티와 6단계 복잡도, 8개 연산 유형을 아우르는 통합 분류 체계를 수립했다
- 자유형태 편집 작업을 검증 가능한 다차원 루브릭으로 분해하는 평가 패러다임을 도입하여 객관적이고 해석 가능한 평가를 실현했다
- 2,000개 고품질 샘플과 17,741개 평가 루브릭을 인간-에이전트 협업 파이프라인으로 엄선하여 구축했다
- 최신 5개 모델 평가에서 EMR 5% 미만, 복잡 혼합 모달리티에서 0%를 기록하여 현재 시스템의 근본적 한계를 폭로했다
- 외부 에이전트 플래너 도입이 일관된 개선을 가져오지 못하며 이해와 생성 양쪽 모두에서 병목이 존재함을 확인했다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.