Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 286
- 분야
- Computer Vision
- arXiv 번호
- 2606.02578
최근의 멀티모달 대규모 언어 모델은 강력한 추론 능력을 보여주었으나, 자동 평가자로서의 신뢰성은 한 가지 치명적 약점에 의해 여전히 제한된다. 즉, 시각적 증거가 텍스트 단서와 충돌할 때 MLLM 심사자는 지각적으로 올바른 답보다 그럴듯한 서사에 보상을 주는 경향이 있다.
이 연구는 멀티모달 언어 모델이 시각 증거와 텍스트 설명이 충돌할 때 눈으로 확인한 내용보다 그럴듯한 문장을 더 높게 평가하는 지각 판단 편향을 분석한다. 최소한으로 편집한 반사실 응답을 만들어 지각 오류만 분리한 PPJD 데이터셋을 구축하고, 검증 가능한 감독 신호를 제공한다. 이어서 구조화된 GRPO 보상과 배치 순위 목표를 결합해 명시적인 모든 쌍의 라벨 없이도 응답들의 일관된 전체 순서를 학습한다. 여러 멀티모달 심사 벤치마크에서 지각 충실도, 순위 일관성, 사람 평가와의 정렬이 개선됐다. 다만 매우 미세하거나 드문 시각 차이, 암묵적 3차원 구조, 복잡한 공간 관계와 다단계 추론에서는 여전히 잘못 판단할 수 있다.
핵심 요약
- 이 문제를 해결하기 위해, 이 논문은 지각적 오류를 분리하고 검증 가능한 감독을 가능하게 하는 최소 편집 반사실 응답을 구성하는 Perceptually Perturbed Judgment Dataset을 소개한다.
- 다양한 MLLM-as-a-Judge 벤치마크 전반에 걸친 실험은 이 접근법이 지각적 충실도, 순위 일관성, 그리고 인간 평가와의 정렬을 상당히 향상시킴을 보여준다.
- 이 결과는 지각적으로 근거가 있고, 해석 가능하며, 시각-추론 충돌에 견고한 멀티모달 심사자를 훈련하기 위한 확장 가능하고 일반화 가능한 경로를 확립한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.