Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 307
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.05161
오디오-언어 모델(ALM)은 오디오 증거가 명확한 경우에도 오디오와 충돌하는 텍스트를 따르는 경우가 많다.
오디오-언어 모델은 소리가 분명해도 소리와 충돌하는 글을 따라 답하는 경우가 많다. 저자들은 같은 오디오를 유지하고 충돌하는 글만 뺀 반사실 비교를 통해, 다섯 모델과 네 과제의 충돌 표본 64.1%에서 오디오 답 선호가 글 답 선호로 뒤집힘을 확인했다. 활성값 바꿔 넣기 실험은 이 뒤집힘이 답을 정하는 위치의 계산에서 일어나며, 그 효과가 최종 후보 점수 차이와 0.93의 스피어만 상관을 보인다고 밝혔다. 학습이 필요 없는 GACL은 두 조건의 점수를 선택적으로 섞어 충실도 하락을 5%포인트 안에 두면서 가장 좋은 대조 기준보다 nAUC를 17.8점 높였다. 다만 이 방법은 모델이 이미 소리 정보를 표현했을 때만 중재를 고칠 수 있고, 참조 계산을 한 번 더 해야 해 지연이 늘어난다.
핵심 요약
- 이 논문은 오디오를 고정한 채 충돌하는 텍스트만 제거하고 그에 따른 모델 선호의 변화를 측정하는 동일 오디오 반사실 기법을 사용해 이 질문을 검토한다.
- 5개의 ALM과 4개의 충돌 작업에 걸쳐, 충돌 샘플의 64.1%에서 부호 반전이 나타났다. 즉, 동일 오디오 분기는 오디오가 뒷받침하는 답을 선호하는 반면, 결합 분기는 텍스트가 뒷받침하는 답을 선호한다.
- 엄격한 5 pp 충실도 하락 예산 하에서 GACL은 최고의 대조 학습 베이스라인 대비 nAUC를 17.8점 향상시키며, 재조정 없이 시각-텍스트 중재로 전이된다(최대 +40.5 pp).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.