HarnessEval-W: Agentifying the Evaluation of Visual Worlds
- 발행일
- 출처
- arXiv
- 논문 번호
- 921
- 분야
- Computer Vision
- arXiv 번호
- 2608.16859
세계 모델 영상에 한 점수만 매기지 않고, 평가 질문을 작은 검증 과제로 나눠 어떤 장면 근거로 판단했는지 보여주는 평가 체계다.
이 논문은 한마디로 영상 세계 모델의 결과를 근거와 함께 평가하는 HarnessEval-W를 제안한다. 관찰 품질, 상태 전환의 정확성, 세계 지속성이라는 세 축을 8개 세부 조건으로 나눈다. 각 사례에 맞는 평가 기술을 고른 뒤 여러 에이전트와 도구가 장면 근거를 모으고 검증자가 이를 확인한다. 18개 모델을 같은 330개 사례에서 평가했으며 모델마다 텍스트 지시, 카메라 경로와 제어 명령 같은 기본 입력 방식은 유지했다. 사람 판단과 높은 순위 상관을 보였지만, 사람 대조 검증은 가장 어려운 두 조건에 한정됐다.
핵심 요약
- 평가 항목은 렌더링, 물리 관찰, 탐색 전환, 의도 전환, 물리 전환, 불필요한 장면 변화 억제, 재방문 일관성과 화면 밖 변화까지 8개다.
- 평가기는 질문을 측정 가능한 작은 문제로 나누고, 필요한 기술과 도구만 골라 장면 근거를 수집한다.
- 같은 330개 사례에서 Seedance 2.0이 종합 75.5점으로 1위였다. 다만 모델마다 입력 방식이 달라 완전히 같은 입력 조건의 직접 대결로 보면 안 된다.
- 9개 모델에서 모은 사람의 비교 판단 5천 건과 대조했을 때 의도 전환의 스피어먼 순위 상관계수는 0.93, 물리 전환은 0.87이었다.
- 같은 영상과 GPT-5.5 평가기 조건에서 기존 WBench보다 사람 판단 일치율이 높았다. 다만 검증은 8개 조건 중 두 개에 집중됐고 평가 기술이 준비되지 않은 새로운 상황에는 알맞은 방법을 찾지 못할 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.